「牛来」模型 ?OpenRouter又放匿名模型,Ox Alpha疑似小米MiMo新模型
相关推荐
OpenRouter又上神秘模型Union Alpha,专攻Agent编程
动察 Beating AI 快讯,OpenRouter 和 OpenCode 上线神秘模型 Union Alpha,开发者身份暂未公开。它是一款面向研究、编程和 Agent 工作流的多模态模型,支持图片、工具调用和约 256K 上下文。OpenRouter 将其描述为具有「前沿级通用性能」。 OpenCode 称 Union Alpha 专门针对 Agent 编程优化,未来一周免费使用,而且不会用用户数据训练模型。 Union Alpha 到底是谁家的,目前没有答案。社区已经开始从输出风格、上下文长度等线索猜模型身份,但暂时没有可靠证据。
OpenRouter上线匿名大模型Space Bunny Alpha,支持100万Token上下文并免费开放
PANews 9月26日消息,据OpenRouter模型页,匿名大模型Space Bunny Alpha已于9月23日上线预览,主打高速推理和代码能力,支持可调节推理强度、原生多模态输入(文本、图像及视频)、工具调用、结构化输出以及100万Token上下文窗口,单次最多可输出524,288 Token。页面目前显示其输入与输出均免费。该模型由一家选择在预览期间保持匿名的第三方供应商开发和运营,OpenRouter仅负责请求路由,并非其开发者、所有者或提供商;用户提示词和模型输出可能由供应商保留,但不会用于训练。
小米先公开MiMo-V3新架构:百万Token预填充计算量降80%
动察 Beating AI 快讯,小米 MiMo 团队公开下一代 MiMo-V3 将采用的 HySparse2 架构。它主要解决 Agent 越跑越贵的问题。Agent 每次只发出很短的指令,却可能从网页、终端和工具拿回大段内容。模型必须先把这些新内容读完;上下文越长,这一步越耗算力,KV Cache 也越占显存。 HySparse2 先把模型分成前后两段。前半段负责处理输入,后半段继续推理和生成。后半段需要的上下文信息,可以直接从前半段已经算好的结果生成,因此 prefill 不用再把后半段完整跑一遍。这个思路来自微软研究院 2024 年提出的 YOCO,名字就是「You Only Cache Once」,核心是让后半段共享前面算好的信息,少存缓存,也少做重复计算。 它同时重做了稀疏注意力。普通全注意力每次都要看完整上下文,HySparse2 只让少数层这么做。它们先从长上下文里挑出最相关的 1024 个 token,后面的层直接沿用这批结果,同时固定保留最近 128 个 token。上一代 HySparse 是每 64 个 token 打成一组再挑,只要一组里有重要信息,整组都要留下。现在改成逐个 token 挑,同样的计算量可以留给更多真正相关的内容。单独测试这一改动后,两项长文本检索成绩分别提高 6.57 分和 8.14 分。 论文用一款总参数 800 亿、每次激活约 30 亿参数的模型做对照。49 层模型在 prefill 阶段只需要跑前 25 层。输入达到 100 万 token 时,相比 MiMo-V2 系列采用的混合滑动窗口注意力,prefill 计算量降到约 1/5,KV Cache 从 12.09GB 降到 2.69GB。
Pi开始给Prompt缓存自动续命,长任务少烧重复Token
动察 Beating AI 快讯,Pi Agent Harness 发布 0.86.0,新增 Prompt Cache Warming。Agent 跑长时间工具任务时,Pi 会在缓存快过期前重发上一次请求,只生成 1 个 Token,把已经缓存的长上下文继续保留下来。 很多模型服务会在一段时间没有请求后清掉 Prompt Cache。之后继续任务,同一大段上下文就可能重新按完整输入计费。Pi 现在会主动避免这种 Cache Miss,但不会无脑保活。 它会先算账。只有预计避免的 Cache Miss 成本减去刷新成本后,还能至少省 0.05 美元,才会发起刷新。每次刷新本身仍要支付整段缓存读取和 1 个输出 Token 的费用。
微软要把Windows变成Agent工作台:AI能直接操作电脑,还能少花Token
动察 Beating AI 快讯,微软公布 Windows「混合智能」计划,准备让 AI Agent 直接在电脑上执行任务。获得授权后,Copilot 可以读取本地文件和近期活动,还能整理文件、排查故障、编写程序。微软演示中,它自动找齐报税材料,修改文件名、打包附件,并起草了发给会计师的邮件。 这套方案的关键,是让本地 AI 和云端 AI 配合工作。Copilot 负责接收任务,Windows 提供访问文件和执行操作的能力。部分任务可以交给电脑上的模型处理,减少云端 Token 消耗,也让敏感数据留在本地。需要更强推理能力时,再调用云端模型。 为了支撑本地运行,微软将 1370 亿参数的编程模型 MAI Code 1.1 Flash 压缩至 53GB,让它能在搭载 RTX Spark 的高性能电脑上运行。GitHub Copilot 也将通过 HydraFusion 自动选择本地或云端模型,让部分编程任务不再依赖付费的云端推理。 微软还推出 MXC 安全沙箱,限制 Agent 能访问的文件和网络,防止越权操作。目前 MXC 已正式开放。Copilot 读取本地文件、执行电脑操作等新能力,则将在未来几个月陆续登陆 Copilot+ PC。
Monid融资770万美元:做Agent工具版「OpenRouter」,聚合2500个API
动察 Beating AI 快讯,Agent 工具平台 Monid 宣布完成 770 万美元种子轮融资。它要做「Agent 工具版 OpenRouter」:开发者只需接入一次,Agent 就能自己寻找、比较并调用不同供应商的工具,不用再逐个注册账号、管理 API Key 和购买订阅。 创始人 Shengkun Ye 最新称,Monid 已覆盖约 2500 个 API,包括搜索、SEO、销售线索、电商、股票、社交数据,以及视频、图片、音乐、3D、Agent 邮箱和电话等。Agent 会先搜索合适的工具,再查看输入格式和价格,最后直接调用。费用统一从 Monid 余额扣除,不同工具按调用次数或返回结果收费。