小米先公开MiMo-V3新架构:百万Token预填充计算量降80%
相关推荐
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。
Pi开始给Prompt缓存自动续命,长任务少烧重复Token
动察 Beating AI 快讯,Pi Agent Harness 发布 0.86.0,新增 Prompt Cache Warming。Agent 跑长时间工具任务时,Pi 会在缓存快过期前重发上一次请求,只生成 1 个 Token,把已经缓存的长上下文继续保留下来。 很多模型服务会在一段时间没有请求后清掉 Prompt Cache。之后继续任务,同一大段上下文就可能重新按完整输入计费。Pi 现在会主动避免这种 Cache Miss,但不会无脑保活。 它会先算账。只有预计避免的 Cache Miss 成本减去刷新成本后,还能至少省 0.05 美元,才会发起刷新。每次刷新本身仍要支付整段缓存读取和 1 个输出 Token 的费用。
罗福莉憋了半年,小米把MiMo-V2.6强化学习直接直播了
动察 Beating AI 快讯,小米正在公开直播下一代 MiMo-V2.6 的强化学习训练。 负责人罗福莉称,团队沉默近半年,一直在研究强化学习到底还能扩展到多大规模。目前 V2.6 仍在训练,具体技术方案将在未来几周陆续开源。 这次一上来就把规模拉得很高。每一步使用 1568 个 prompt,每个生成 16 条 rollout,总计约 20 亿 Token,全程异步运行。代码、通用、视觉、网络安全和聊天等 Agent 任务,也被混在同一次训练里,并同时使用多套 harness。 外界可以实时看到每一步的任务组成、上下文长度、训练耗时等内部指标。UC Berkeley 博士生 Yichuan Wang 根据面板观察到,每一步约 1500 个任务,代码任务占约三分之二,同时活跃的沙箱超过 4 万个。
阿里云:Token Plan个人版升级,新增12类Agent Harness工具
火星财经消息 9月11日,阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。(广角观察)
海光信息发布“Agent to Token开放计算架构”
火星财经消息,在2026中国国际大数据产业博览会上,海光信息首发“Agent to Token开放计算架构”,依托CPU与DCU双芯协同及开放互连,为Agent任务执行与词元生产全周期提供系统级计算支撑。在此次数博会上,海光信息牵头成立的围绕国产通用计算平台的产业生态系统联合体光合组织多家成员单位同步亮相。