Kimi CLI前作者:模型越强,Harness反而会越厚
相关推荐
DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装
据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。
Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍
据动察 Beating 监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。 Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。 按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。 Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。
Kimi K3冲上Agent榜第4,用户确认成功指标第一
据 动察 Beating 监测,Arena Agent 榜基于真实用户任务和工具调用记录。Kimi K3 的综合净提升为 9.62%,排名第 4。它排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之后。 Arena 把所有参评模型均匀混合成一个虚拟平均基准,再估算换成 K3 后,各项结果改善多少。五项净提升最后取平均,得到综合分。 K3 已积累 8344 次测试会话。用户确认成功指标净提升 14.42%,排名第一。表扬多于投诉指标提升 20.62%,排名第三。它的纠错执行排名第 14,Bash 报错恢复排名第 17。K3 更容易交出让用户认可的结果,但中途改错和命令报错恢复仍是短板。
谷歌云从OpenAI挖走Harness engineering作者,押注企业Agent工作流
据动察 Beating 监测,OpenAI 前工程师 Ryan Lopopolo 宣布加入谷歌云,担任 Agentic Google Cloud Platform 首席工程师。 Lopopolo 是 OpenAI《Harness engineering》文章作者。这套方法强调给 Agent 配好上下文、工具、权限、评测和反馈回路,让 Agent 真正参与软件开发。 他在 OpenAI 参与过一个内部实验:团队用 Codex 从空仓库开始做产品,5 个月生成约 100 万行代码。代码、测试、CI、文档和内部工具都由 Codex 完成,人类主要负责目标和验收。 这次跳槽说明,谷歌云不只想卖模型和算力,也在补企业 Agent 工程化能力。
Canva可画正式上线MCP能力,首批接入Kimi等AI Agent
火星财经消息,7月30日,Canva可画宣布MCP(Model Context Protocol,模型上下文协议)能力正式在中国市场上线,并同步完成与Kimi、WorkBuddy及Qoder Work CN等本土AI Agent应用的首批接入。AI Agent可通过MCP标准化协议,直接调用Canva可画的视觉创作、素材管理和品牌资产管理等核心能力。
Pi重构Agent执行层:长任务开始走向持久化运行
据动察 Beating 监测,Pi 正在重做 Agent Harness。最新 Harness v3 规范已经写完,正在做最终审计。它重做了任务执行和存储,让 Agent 即使跑到一半进程崩溃,甚至 Harness 自己升级,也能从中断处继续。 Pi 是 Mario Zechner 创建的开源 Agent Harness,最早因为 OpenClaw 使用它而出圈。项目今年被 Earendil 收购,Mario 也加入公司继续负责开发。现在 Pi 已有超过 6 万 GitHub Star,MiniMax 最新的 MiniMax Code 也明确基于 OpenCode 和 Pi 搭建 Harness。 v3 这次直接重做了底层架构。模型请求和工具调用前都会先保存执行状态,完成后再写入结果。重启后,Pi 能知道哪些已经做完、哪些可以重跑、哪些有副作用不能再执行一次。对话、运行状态和 Token 成本也改成分开保存,并加入跨版本状态迁移。 Claude Code、Codex 都在把 Agent 往更长的任务推。OpenAI 已经专门研究怎么让 Codex 持续完成长时间工作,Anthropic 也称 Claude Code 正越来越多地被用于长时间运行的 Agent 任务。Agent 能连续干几小时以后,前面几小时就不能因为一次崩溃全部白干。