返回 7*24 快讯
来源Blockbeats

20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三

动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-04 07:36

GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%

动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。

08-29 13:49

Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol

动察 Beating AI 快讯,Terminal-Bench 发布 4.0,重新校准 Agent 执行任务时的时间、CPU 和内存,并修复 19 个任务、移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到 8 小时,主要是减少超时和环境问题对成绩的干扰。 最新榜单里,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,冲到第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名里,GLM-5.3 是唯一不是 Anthropic 的模型。 在 Terminal-Bench 3.0 中,GLM-5.3 还是 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反过来领先 Sol 4.5 个百分点。

09-03 11:54

Claude Fable 5.1 正式登陆 B.AI API,专为高难度推理与 Agent 工作流打造

ChainCatcher 消息,B.AI 平台宣布 Anthropic 最新 Mythos 级通用模型 Claude Fable 5.1 现已正式接入 API。 该模型与 Claude Mythos 5.1 采用相同底层模型,专为高强度代码编写、长期 Agent 工作流与复杂知识任务深度优化,在 CursorBench 3.2.0 测试中以最高运算强度取得 73.4% 的优异表现。 API 接入现已开放,开发者可享专属优惠——官方渠道低至 8.5 折,自选服务商低至 6 折。B.AI 持续引入全球顶尖模型,为开发者提供更强大、更具性价比的 AI 能力选择。

09-11 09:30

离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成

动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。

09-07 05:07

LoopX升到1.0:一个页面管Codex、Claude Code等Agent长任务

动察 Beating AI 快讯,开源项目 LoopX 发布 1.0。它装在 Codex、Claude Code、Cursor 等 Agent 上层,把原本分散在不同会话里的长期任务统一收进一个工作台。 用户可以在一个页面看到所有已接入 LoopX 的任务。哪些正在执行、哪些等你确认、哪些在持续监控、哪些已经排期,都会集中显示。进入单个项目后,还能继续查看不同 Agent 的待办、完成记录、文件和运行状态。 这个工作台可以直接在浏览器打开,也提供 macOS 和 Windows 桌面版。两种入口共用同一套本地服务和任务状态。它不会自动读取电脑上所有 Agent,会显示的是已经注册并接入 LoopX 的 Agent 和任务。 多个 Agent 也可以一起完成同一个目标。它们能分别认领任务、并行工作和相互接力。比如一个 Agent 做完后留下后续任务,下一个 Agent 再接着做。这里的协作靠共享任务和状态完成,并不是让多个 Agent 在一个聊天室里自由对话。

09-04 11:00

Claude成本高近9倍仍落败:AIP2-1.0首测领跑游戏创作Agent赛道

BlockBeats 消息,9 月 4 日,Web3 项目 ClawQuest 推出游戏创作 Agent AIP2-1.0。AIP2 取自「AI Player Two」:玩家负责提出创意与作出选择,AI 调用工具,将想法转化为可运行的游戏内容。 AIP2-1.0 首先在 ClawQuest 旗下 AI Agent 游戏「Agent Fire」接受公开实测。AIP2-1.0、GPT-5.6 Sol 与 Claude Opus 5 完成相同的 8 项坦克技能优化任务,每项进行 300 场最终对战,各完成 2,400 场实战检验。 结果显示,AIP2-1.0 综合评分为 76.06,高于 Claude Opus 5 的 73.96,与 GPT-5.6 Sol 的 76.85 相差 0.79 分。完成 8 项任务的模型调用成本为 20.69 美元,不到 Claude Opus 5 的 12%,约为 GPT-5.6 Sol 的 25%。 玩家可通过 Telegram 内的 Agent Arena Bot 直接调用 AIP2-1.0,无需自行部署 Agent。ClawQuest 希望以更低成本和更直接的入口,让更多玩家借助 AI 参与游戏内容创作。