Sakana升级「模型战队」:Ultra v2冲性能,Max压成本
相关推荐
Claude、Grok、ChatGPT出现宕机或访问异常
动察 Beating AI 快讯,多家 AI 服务出现宕机/访问异常,包括: Claude:Claude 4.6/4.8/5/5.1 系列错误率均在上升。 Grok:Grok for Android 存在异常,grok api 服务在美东 1 区出现异常。 ChatGPT:网页版异常,部分用户客户端异常,未登录时登录可能出问题。
20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。
DeepSWE一夜两换榜首:Gemini刚上去,Meta又报75.4%
动察 Beating AI 快讯,Gemini 3.8 Flash 刚发布时,Google 在 DeepSWE v1.1 上跑出 73.7%。DeepSWE 官方榜目前将它显示为 74%±1%,排在 Claude Opus 5 和 GPT-5.6 Sol 前面。几个小时后,Meta 又公布 Muse Spark 1.3,自己在同一套 DeepSWE 上跑到 75.4%,把公开成绩再往上推了 1.7 个百分点。 这项测试让 Agent 独立处理 113 个真实代码库里的长周期软件工程任务。Google 和 Meta 都使用 mini-swe-agent,Google 跑的是 high 推理档,Meta 跑的是 max。Meta 上一代 Spark 1.2 只有 55.0%,这次直接涨了 20.4 个百分点。不过 Meta 的 75.4% 目前还没进入 DeepSWE 官方榜。 在 Artificial Analysis 的 Coding Agent Index 中,限量预览的 Spark 1.3 max 得到 68 分,仅次于 Claude Opus 5;目前公开可用的 xhigh 版本则是 64 分。
Google推出Gemini 3.8 Flash推理模型,今日起向Pro与Ultra用户开放
PANews 9月2日消息,Google Gemini 宣布其最新 Gemini 3.8 Flash 模型今日起向 Pro 与 Ultra 用户开放。官方称,该模型在日常话题行动建议、文本分析和复杂编码等任务中,将提供更可靠、更全面的回答,以增强高频使用场景下的实用性与执行效率。
视频|Dario Amodei:为安全推迟发布Claude六个月,亲手错过了「ChatGPT时刻」
Anthropic CEO Dario Amodei 在参加 CFR CEO Speaker Series 时表示,Anthropic 当年其实有机会抢在 ChatGPT 之前发布 Claude,但出于安全考虑,主动将发布时间推迟了大约 6 个月,也因此错过了「ChatGPT 时刻」。这个决定确实让 Anthropic 付出了商业上的代价,但也奠定了公司此后更重视安全的文化。
苹果推出搭载M5 Max和M5 Ultra芯片的新款Mac Studio
火星财经消息 8月25日,苹果推出搭载M5 Max和M5 Ultra芯片的新款Mac Studio。新款Mac Studio即日起接受预购,将于9月22日在门店正式开售。苹果称,M5 Max和M5 Ultra是“苹果迄今最强大的芯片”。(广角观察)