返回 7*24 快讯
来源MarsBit

Kimi CLI前作者:模型越强,Harness反而会越厚

据动察 Beating 监测,Raft 创始人、Kimi CLI 前作者 Richard Qian 提出一个反常识判断:模型越强,Agent harness 不一定越薄,反而可能越来越厚。 System Prompt、专用 Tool、Subagent 这些东西都可能慢慢消失。模型越来越聪明后,很多固定流程可以直接交给模型,最后甚至只留一个 Bash 工具。 但 Agent 一旦开始长期工作、互相协作,新的问题马上冒头:谁负责什么、任务做到哪了、上下文怎么同步、多个 Agent 怎么避免重复工作和互相冲突。这些都得由模型外面的系统解决。 Richard 离开月之暗面后做的 Raft,实际上就在补这一层。它把 Claude Code、Codex、Kimi CLI 等 Agent 拉进同一个工作区,让它们在频道里聊天、认领任务、读历史消息,再互相交接工作。 模型正在吃掉旧 harness,但 Agent 能做的事越多,外面的协作系统也会越来越复杂。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-13 20:52

DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装

据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。

08-01 14:54

Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍

据动察 Beating 监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。 Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。 按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。 Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。

07-21 17:10

Kimi K3冲上Agent榜第4,用户确认成功指标第一

据 动察 Beating 监测,Arena Agent 榜基于真实用户任务和工具调用记录。Kimi K3 的综合净提升为 9.62%,排名第 4。它排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之后。 Arena 把所有参评模型均匀混合成一个虚拟平均基准,再估算换成 K3 后,各项结果改善多少。五项净提升最后取平均,得到综合分。 K3 已积累 8344 次测试会话。用户确认成功指标净提升 14.42%,排名第一。表扬多于投诉指标提升 20.62%,排名第三。它的纠错执行排名第 14,Bash 报错恢复排名第 17。K3 更容易交出让用户认可的结果,但中途改错和命令报错恢复仍是短板。

07-09 19:49

谷歌云从OpenAI挖走Harness engineering作者,押注企业Agent工作流

据动察 Beating 监测,OpenAI 前工程师 Ryan Lopopolo 宣布加入谷歌云,担任 Agentic Google Cloud Platform 首席工程师。 Lopopolo 是 OpenAI《Harness engineering》文章作者。这套方法强调给 Agent 配好上下文、工具、权限、评测和反馈回路,让 Agent 真正参与软件开发。 他在 OpenAI 参与过一个内部实验:团队用 Codex 从空仓库开始做产品,5 个月生成约 100 万行代码。代码、测试、CI、文档和内部工具都由 Codex 完成,人类主要负责目标和验收。 这次跳槽说明,谷歌云不只想卖模型和算力,也在补企业 Agent 工程化能力。

07-30 18:36

Canva可画正式上线MCP能力,首批接入Kimi等AI Agent

火星财经消息,7月30日,Canva可画宣布MCP(Model Context Protocol,模型上下文协议)能力正式在中国市场上线,并同步完成与Kimi、WorkBuddy及Qoder Work CN等本土AI Agent应用的首批接入。AI Agent可通过MCP标准化协议,直接调用Canva可画的视觉创作、素材管理和品牌资产管理等核心能力。

08-11 18:16

Pi重构Agent执行层:长任务开始走向持久化运行

据动察 Beating 监测,Pi 正在重做 Agent Harness。最新 Harness v3 规范已经写完,正在做最终审计。它重做了任务执行和存储,让 Agent 即使跑到一半进程崩溃,甚至 Harness 自己升级,也能从中断处继续。 Pi 是 Mario Zechner 创建的开源 Agent Harness,最早因为 OpenClaw 使用它而出圈。项目今年被 Earendil 收购,Mario 也加入公司继续负责开发。现在 Pi 已有超过 6 万 GitHub Star,MiniMax 最新的 MiniMax Code 也明确基于 OpenCode 和 Pi 搭建 Harness。 v3 这次直接重做了底层架构。模型请求和工具调用前都会先保存执行状态,完成后再写入结果。重启后,Pi 能知道哪些已经做完、哪些可以重跑、哪些有副作用不能再执行一次。对话、运行状态和 Token 成本也改成分开保存,并加入跨版本状态迁移。 Claude Code、Codex 都在把 Agent 往更长的任务推。OpenAI 已经专门研究怎么让 Codex 持续完成长时间工作,Anthropic 也称 Claude Code 正越来越多地被用于长时间运行的 Agent 任务。Agent 能连续干几小时以后,前面几小时就不能因为一次崩溃全部白干。