微软要把Windows变成Agent工作台:AI能直接操作电脑,还能少花Token
相关推荐
微软Win11将整合MAI Code 1.1 Flash:130B参数、上下文窗口256K
火星财经消息 10月8日,在美国旧金山举办的活动中,微软表示正计划将MAI Code 1.1 Flash模型引入Windows 11设备。该模型是6月版MAI-Code-1-Flash的升级版,参数量为1300亿,采用3-bit量化后体积缩小约80%,上下文窗口256K,定位在Copilot里高频、低成本、低延迟地完成编码任务。相比6 月版本,MAI Code 1.1 Flash模型在GitHub Copilot CLI的Terminal-Bench 2.1上提升约22%,在.NET任务上提升约15%;同时输出token流速度提升约25%,完成任务所需token减少约25%。多模态方面,新增“看图写代码 / 理解图”的能力,可直接读取截图、架构图、UI 草图等图像输入,而6月版本只支持纯文本输入。(广角观察)
ZCode再补偿代码上传风波:付费用户送8张重置卡,全员再发1亿Token
动察 Beating AI 快讯,智谱继续处理 ZCode 代码上传争议。现有付费用户和近一个月回归的付费用户,将获得 4 张周重置卡和 4 张 5 小时重置卡,1 个月内有效。9 月 28 日至 10 月 7 日,ZCode 还将向全体用户发放 10 万份 1 亿 GLM-5.3-Flash Token 额度。 智谱称,仓库快照上传链路已经移除,涉事云端数据也已删除。ZCode 开源版本目前更新至 v3.14.3,后续代码不会在用户未主动发起的情况下上传云端。 这场争议源于 ZCode 早期默认开启的 Repo Wiki 功能。它在生成代码仓库知识库时,会把仓库内容上传到云端处理。智谱此前已经切断相关上传路径,并邀请第三方机构核查云端数据。
阶跃星辰开源Step Code:自测追平DeepSeek Harness,token更省
动察 Beating AI 快讯,阶跃星辰开源 AI 编程工具 Step Code v0.1.0,采用 MIT 许可证。它直接跑在终端里,可以读写代码、跑测试和执行开发任务,还支持 MCP、Agent Skills 和 Claude Code 插件。内置的 StepPage 可以一条命令把本地静态网站发布到线上。 Step Code 主打少用 token。在阶跃自己的 Terminal-Bench 2.1 横评中,它完成 72/89 个任务,得分 80.9%,与 DeepSeek Harness 并列最高,但 token 用量更低。 阶跃自建的 Multi-Frame 长任务测试共有 150 道题,Step Code 完成 110 道,得分 73.3%,平均每题消耗 509 万 token,在对比的 6 款 harness 中同时拿到最高通过率和最低 token 用量。 不过阶跃没有公布这轮横评具体用了哪个底层模型,也没有拆解这些 token 是怎么省下来的。官方只提到 Step Code 与 Step 系列模型一起针对 token 消耗做过调优。 源码里也能看到不少「节流」设计:文件读取和命令输出会限长,搜索尽量缩小返回范围,长对话默认会压缩上下文,system prompt 也要求能直接调用工具就不要额外开 Agent。 还有一套更激进的 contextProjection,可以裁掉旧工具输出、重复结果和历史 reasoning,不过默认关闭。 综合来看,它的 token 优势来自模型和 harness 多处优化叠加。
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
Kimi Code桌面端上线:浏览器、终端、多Agent塞进一个窗口
动察 Beating AI 快讯,月之暗面正式上线 Kimi Code Desktop,把原本偏终端的 Kimi Code 做成了独立桌面应用。用户可以直接打开本地项目,让 Agent 读写代码、跑命令、查看 Git 改动,目前支持 macOS 和 Windows。 桌面版直接内置了浏览器和终端。做网页时,Agent 可以读取右侧网页的页面信息,用户也能直接点选元素、框出区域或者截图批注,告诉它具体哪里要改。改代码、看网页效果、跑测试都不用再切窗口。 它还支持计划、目标和 Swarm 三种任务模式。Swarm 可以把任务拆给多个子 Agent 并行处理,长任务也能放到后台继续跑。除了 Kimi 自家的模型,用户还可以自己填 API Key 和 Base URL,接入其他模型供应商。
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。