返回 7*24 快讯
来源MarsBit

Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍

据动察 Beating 监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。 Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。 按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。 Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

07-30 11:45

Kimi K3接入Claude Code,平均任务成本是Kimi Code的9倍

据动察 Beating 监测,AI Agent 基础设施公司 Composio 将同一款 Kimi K3 接入 Kimi Code、Hermes 和 Claude Code,完成 28 项相同任务。三套运行框架的成功数只差 2 项,Token 用量和成本却相差很大。 Kimi Code 完成 22 项,Hermes 完成 21 项,Claude Code 完成 20 项。单项任务 Token 中位数分别为 6.1 万、6.7 万和 34 万。Composio 估算,平均每项任务成本约为 0.22 美元、0.28 美元和 2 美元。个别任务的 Token 用量最多相差 30 倍。 Hermes 速度最快,单项任务中位耗时为 179 秒。Kimi Code 为 297 秒,Claude Code 为 348 秒。 Writer 的另一项研究也得到相近结果。研究人员在 22 项企业任务和 6 款模型上只替换运行框架,Token 用量下降 38%,单项成本下降 41%,耗时下降 44%,完成质量基本持平。

07-20 13:35

DeepSeek版Claude Code即将上线,Harness将与V4正式版同步发布

据动察 Beating 监测,网友提供的群聊截图显示,DeepSeek Harness 团队计划把首款 Harness 产品与 V4 正式版一同发布。它是一款代码智能体产品,内部对标 Claude Code,负责让模型读写文件、调用工具、执行命令,并持续完成工程任务。 DeepSeek 此前宣布,V4 正式版计划于 7 月中旬上线,并同步启用峰谷定价。现在已是 7 月 20 日,原定时间窗口已经过去。如果计划没有再次调整,V4 和 Harness 都已进入发布倒计时。 DeepSeek 过去主要让开发者把 V4 接入 Claude Code、OpenCode 等第三方工具,这次终于要自己下场抢代码 Agent 的产品入口。

08-11 17:03

Spotify把Claude、Gemini和Codex塞进一个总控台,1300名工程师已在用

据动察 Beating 监测,Spotify 推出 AI 编程工具 Xirp。它把 Claude Code、Gemini CLI 和 Codex 接进同一个工作台,可以同时跑多个 Agent。中途换工具,项目上下文也能直接带过去。 Spotify 已经用 Xirp 跑了超过 3.6 万次 Agent 会话。官方称已有 1300 多名 Spotify 工程师使用。Xirp 可以同时协调 50 多个会话,每个任务单独放进一个 Git worktree,多个 Agent 能在同一代码库并行干活,互不干扰。 更核心的是「团队记忆」。接上 Spotify Portal 后,Agent 能直接读取服务架构、依赖关系、负责人和历史架构决策。一次会话积累的上下文也会存回 Portal,其他工程师或 Agent 可以接着做。 Xirp 更像一个 Coding Agent「总控台」。Spotify 不押注某一家模型,而是让 Claude、Gemini、Codex 随时可换。Spotify 此前已经把内部开发平台 Backstage 开源,又推出了商业版 Portal;现在 Xirp 再把多 Agent 调度接了进来。

08-10 11:59重要

Claude Code之父:720次提示词注入攻击0成功,一年前想都不敢想

据动察 Beating 监测,Claude Code 负责人 Boris Cherny 称,Anthropic 已经「在实际使用中基本解决」提示词注入攻击。一年前,他自己都没想到能做到这个程度。 提示词注入攻击一直是 Agent 的大麻烦。恶意网页可以藏一段指令,诱导 Agent 偷密码、上传密钥,甚至执行用户根本没要求的操作。 Anthropic 现在靠三层防护来拦:Claude 本身先抵抗恶意指令,外部内容进入上下文前再检测一次,真正执行操作前,Auto Mode 还会再审一次。 第三方测试用了 72 种此前没见过的攻击,重复 720 次。Sonnet 5、Fable 5 和 Opus 5 开启 Auto Mode 后,一次都没成功。 同一测试中,GPT-5.6 Sol 使用 Codex Auto-review 的攻击成功率为 5.83%,Full Access 则达到 19.03%。 这也解释了 Anthropic 为什么敢把 Auto Mode 设成默认。它是 Claude Code 防提示词注入攻击的最后一道检查。

07-29 18:04

阿里Qoder开源AI编程体检工具,Claude Code和Codex也能用

据动察 Beating 监测,阿里云旗下 AI 编程工具 Qoder 开源 Better Harness,并采用 MIT 许可证。它会检查一个代码项目有没有给 Coding Agent 准备好规则、工具和验证流程。 检查范围包括代码仓库、Agent 配置和真实任务记录。它会看项目能否正常启动,测试命令是否清楚,Agent 有没有权限限制,改完代码后是否真的跑了相关测试。 检查结束后,它会列出 Agent 容易出错的环节。每个问题都有证据、影响、修复范围和复验方法。用户可以直接让 Agent 修改,再重新检查。 Better Harness 已支持 Qoder、Claude Code、Codex、Cursor 和 Qwen Code。各平台能力还没有完全拉齐,Qoder 当前最完整。 Qoder 还用它检查了 Better Harness 自己的代码仓库,最终得到 58 分。这也说明它仍处于早期阶段,开源后还在快速修补问题。

07-22 11:09

Claude跟进Codex,录一遍屏就能生成可复用Skill

据动察 Beating 监测,Anthropic 给办公 Agent Claude Cowork 加入「Record a skill」。用户做一遍任务,并同步口述过程。Claude 会记录屏幕、点击、键盘输入和语音。系统随后把演示转成 Skill(可重复调用的工作流程)。下次遇到同类工作,可以直接运行,不用重新写步骤。 过去创建 Claude Skill,通常要手动编写 SKILL.md,再整理脚本、资料和模板。现在只需做给 Claude 看,非技术用户制作自动化流程的门槛明显降低。 不过 Claude 并非第一个。OpenAI 6 月 18 日已为 Codex 推出同类的 Record & Replay。两边连入口都叫「Record a skill」。 Claude 版本目前开放给 Pro、Max 和 Team 套餐,入口在桌面 App 的 Cowork「+」菜单。