Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍
相关推荐
Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%
据动察 Beating 监测,第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。 Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。 模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。 短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。
OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5
据动察 Beating 监测,Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。 所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。 GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。
传Claude Opus5最快本周发布,填补Fable5退场空档
据动察 Beating 监测,爆料账号 leo 称,Anthropic 正在为 Claude Opus 5 做最后准备。模型最快本周发布,也可能推迟到下周。其能力预计接近 Fable 5,但运行成本更低。 Anthropic 已把 Fable 5 的订阅内使用期延长至 7 月 19 日,但暂不准备再次延期。
网传DeepSeek Harness本周开启内测,对标Claude Code
BlockBeats 消息,7 月 28 日,据 Max For AI 爆料,名为「Harness」的 DeepSeek 版 Claude Code 即将开始内测。社群疯传的内测招募截图显示,DeepSeek Harness 计划于本周晚些时候开启内测,首批用户将从小范围群聊中筛选。入选者需要提交个人资料、签署《保密承诺函》,并获得产品访问权限。 更值得注意的是,图里还明确提醒:一旦泄密,不仅会被取消资格,还会影响之后 DeepSeek 各类模型、产品内测以及合作机会的入选。如果消息属实,V4 正式版和 Harness 将很快公布。 动察 Beating 稍早前报道,DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。Harness 封闭测试结束后约 1 至 2 周会开放 V4,发布时间可能在 8 月 10 日至 20 日之间。如果消息属实,DeepSeek V4 上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
Kimi K3白领任务逼近Fable5,成本升至上代10倍
据动察 Beating 监测,Artificial Analysis 更新 AA-Briefcase 榜单。这个评测让模型从近 2000 份邮件、Slack 记录和公司文件中找信息,再交付表格、演示文稿和界面原型。它共设 4 个长期项目和 91 项保密任务。 Kimi K3 得分 1543 Elo,仅次于 Claude Fable 5 的 1574。它超过 GPT-5.6 Sol 的 1501,也领先 Claude Sonnet 5 和 Claude Opus 4.8。 K3 的客观要求通过率为 51%,Fable 5 为 56%。但 K3 的分析质量得分略高,1754 对 1744。它主要输在成品展示,低于 GPT-5.6 Sol 和 Opus 4.8。 性能提升也伴随着更高的 Token 消耗。K3 平均每项任务花费 10.57 美元,约为 Kimi K2.6 的 10 倍。它平均执行 83 轮,输出 12 万 Token,耗时 56.4 分钟。完成同类任务所需时间约为 Fable 5 的 2.5 倍。
DeepSeek V4强得像Fable 5,社区怀疑API偷偷换了模型
据动察 Beating 监测,爆料博主 leo 质疑,DeepSeek V4 Pro 的官方 API 会把部分复杂编程请求转给 Claude Fable 5。目的可能是收集输出,用于模型蒸馏,也就是用强模型的答案训练另一个模型。 测试者通过 OpenCode 让模型生成 3D 游戏。部分结果与 Fable 5 高度相似,推理方式也突然改变。加入网络安全和生物问题后,游戏质量明显下降,知识范围也退回 DeepSeek 原本的水平。 这个测试利用了 Fable 5 的真实机制。Anthropic 会把部分网络安全、生物和蒸馏请求转给 Opus 4.8。测试者因此怀疑,请求先被转给 Fable 5,触发分类器后才回退到 DeepSeek。 但现有证据只够证明 API 行为异常。它无法确认实际回答者,也无法证明这些输出进入了训练数据。混合 prompt、未公开更新或 DeepSeek 自己的模型路由,都可能造成类似差异。