罗福莉憋了半年,小米把MiMo-V2.6强化学习直接直播了
相关推荐
阿里云:Token Plan个人版升级,新增12类Agent Harness工具
火星财经消息 9月11日,阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。(广角观察)
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化
动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。
Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。
CREAO再融千万美元:让Agent从每次失败里自己改Harness
动察 Beating AI 快讯,企业 Agent 平台 CREAO 完成新一轮千万级美元战略融资,累计融资超过 3000 万美元。CREAO 现在重点做的是 Harness 自我迭代,也就是让 Agent 根据真实任务里的错误和反馈,持续调整自己的执行系统。 Harness 是模型外面控制 Agent 怎么干活的一层,包括任务规划、工具调用、记忆、模型选择和出错后的处理方式。CREAO 已经跑通其中一部分自动纠错:Agent 完成任务后,系统会自动检查结果;发现问题后生成工单,AI 再调查原因、写修复、验证结果。新版本先用少量真实流量测试,效果变差就自动回滚。CREAO 官方此前已经公开过这套系统。 下一步,CREAO 准备把这种改进扩大到更多 Harness 环节。例如,同一类 Agent 反复在某个工具或任务流程上出错,平台可以根据大量真实任务的数据调整整套执行方式,新创建的同类 Agent 也能直接用上这些改进。 再往后,CREAO 还准备把一部分经验训进模型。它计划基于开源模型做垂直场景的后训练,让常见任务更多由成本较低的专用模型完成,复杂任务再调用前沿模型。
「牛来」模型 ?OpenRouter又放匿名模型,Ox Alpha疑似小米MiMo新模型
动察 Beating AI 快讯,OpenRouter 上线新匿名模型 Ox Alpha,定位为面向代码、长时间 Agent 工作和真实生产环境的前沿模型,支持 100 万 Token 上下文,并支持文本、图片、视频输入。目前模型免费开放测试,提供方不会使用用户的 prompt 和输出训练模型。 Ox Alpha 的身份暂未公开,但社区普遍猜测它可能来自小米 MiMo 团队。小米 CFO 林世伟此前也透露,新一代 MiMo 模型正在训练中,有望很快发布。 在 OpenRouter 上匿名放新模型已经快成中国模型厂商的固定节目。此前智谱的 GLM-5、小米的 MiMo-V2-Pro 和 MiMo-V2-Omni、蚂蚁的 Ling-2.6-flash、美团的 LongCat-2.0,都曾先换个名字在 OpenRouter 免费跑一轮,再公开真实身份。