返回 7*24 快讯
来源MarsBit

Kimi K3冲上Agent榜第4,用户确认成功指标第一

据 动察 Beating 监测,Arena Agent 榜基于真实用户任务和工具调用记录。Kimi K3 的综合净提升为 9.62%,排名第 4。它排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之后。 Arena 把所有参评模型均匀混合成一个虚拟平均基准,再估算换成 K3 后,各项结果改善多少。五项净提升最后取平均,得到综合分。 K3 已积累 8344 次测试会话。用户确认成功指标净提升 14.42%,排名第一。表扬多于投诉指标提升 20.62%,排名第三。它的纠错执行排名第 14,Bash 报错恢复排名第 17。K3 更容易交出让用户认可的结果,但中途改错和命令报错恢复仍是短板。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-01 14:54

Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍

据动察 Beating 监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。 Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。 按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。 Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。

07-25 09:26

Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%

据动察 Beating 监测,第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。 Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。 模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。 短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。

07-23 19:24

传Claude Opus 5最快今晚发布,多家供应商开始上线准备

据 动察 Beating 监测,Anthropic 可能在今晚至明晨发布 Claude Opus 5。相关模型似乎已开始在第三方供应商侧准备上线。 此前,代号「Honeycomb EAP」的未发布模型曾短暂出现在 Cursor。页面显示它支持「extra high」推理强度、逐轮控制和安全回退,随后很快下线。社区普遍猜测 Honeycomb 就是 Opus 5,但 Anthropic 没有确认。 新模型会重点提升编程、Agent、工具调用和多步推理,能力可能接近 Fable 5,同时更快、更便宜。

07-22 16:17

Kimi K3白领任务逼近Fable5,成本升至上代10倍

据动察 Beating 监测,Artificial Analysis 更新 AA-Briefcase 榜单。这个评测让模型从近 2000 份邮件、Slack 记录和公司文件中找信息,再交付表格、演示文稿和界面原型。它共设 4 个长期项目和 91 项保密任务。 Kimi K3 得分 1543 Elo,仅次于 Claude Fable 5 的 1574。它超过 GPT-5.6 Sol 的 1501,也领先 Claude Sonnet 5 和 Claude Opus 4.8。 K3 的客观要求通过率为 51%,Fable 5 为 56%。但 K3 的分析质量得分略高,1754 对 1744。它主要输在成品展示,低于 GPT-5.6 Sol 和 Opus 4.8。 性能提升也伴随着更高的 Token 消耗。K3 平均每项任务花费 10.57 美元,约为 Kimi K2.6 的 10 倍。它平均执行 83 轮,输出 12 万 Token,耗时 56.4 分钟。完成同类任务所需时间约为 Fable 5 的 2.5 倍。

07-18 09:32

Kimi K3实测3D建模:成本不到Claude Fable 5一半,原始风格生成效果接近

Odaily星球日报讯 Kimi 官推转发实测 3D 建模结果,要求与 Anthropic 的 Claude Fable 5 在最高算力模式下复刻《星球大战》中的“千年隼号”挑战像素风格和原始风格。测试结果显示,Kimi K3 生成速度略慢于 Fable 5,但成本优势明显。 首次像素风格测试中,Kimi K3 耗时 1 小时 11 分钟,成本 14.5 美元;Claude Fable 5 耗时 49 分钟,成本 21 美元。二次原始风格测试 Kimi K3 耗时 1 小时 17 分钟,成本 19.3 美元;Claude Fable 5 耗时 1 小时 5 分钟,成本 47.2 美元。从效果来看,Kimi K3 在原始风格 3D 建模中对细节处理能力已接近 Fable 5 水平,但在像素风格任务上仍存在一定差距。

07-30 11:45

Kimi K3接入Claude Code,平均任务成本是Kimi Code的9倍

据动察 Beating 监测,AI Agent 基础设施公司 Composio 将同一款 Kimi K3 接入 Kimi Code、Hermes 和 Claude Code,完成 28 项相同任务。三套运行框架的成功数只差 2 项,Token 用量和成本却相差很大。 Kimi Code 完成 22 项,Hermes 完成 21 项,Claude Code 完成 20 项。单项任务 Token 中位数分别为 6.1 万、6.7 万和 34 万。Composio 估算,平均每项任务成本约为 0.22 美元、0.28 美元和 2 美元。个别任务的 Token 用量最多相差 30 倍。 Hermes 速度最快,单项任务中位耗时为 179 秒。Kimi Code 为 297 秒,Claude Code 为 348 秒。 Writer 的另一项研究也得到相近结果。研究人员在 22 项企业任务和 6 款模型上只替换运行框架,Token 用量下降 38%,单项成本下降 41%,耗时下降 44%,完成质量基本持平。