一夜两条路线:Opus5.5冲到第一,GPT-6把同档成本砍半
相关推荐
Artificial Analysis重做智能榜:40%权重改用私有测试
动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。
Anthropic Claude Opus 5.5现已在所有平台上线
动察 Beating AI 快讯,Anthropic Claude Opus 5.5 现已在所有平台上线,包括亚马逊云服务 (AWS)、谷歌云和微软 Azure。
Muse上线一周,稳居美国免费榜第二:只输ChatGPT,超过Gemini和Claude
动察 Beating AI 快讯,Meta 的个人 AI Agent 产品 Muse 上线一周,目前仍排在美国 App Store 免费 App 总榜第二,仅次于 ChatGPT,高于 Google Gemini 和 Claude。 Muse 是一个可以长期工作的个人 Agent,能连接邮箱、日历等服务,自己浏览网页、拆解任务,并在用户关闭 App 后继续后台执行。
Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和
动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。