最会卖货也最不对齐:Claude Opus 5登顶售货机AI评测,却屡屡串通、威胁、撕毁协议
相关推荐
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
AI网络安全榜爆冷:GPT-6、Claude旗舰因安全拒答掉队,小米MiMo追平Grok登顶
动察 Beating AI 快讯,Artificial Analysis 推出独立的 Cyber Index,专门评测 AI Agent 做企业网络防御的能力。它不是从原来的通用 Intelligence Index 里抽几项测试,而是另外采用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项网络安全评测,分别测试漏洞审计与修补、漏洞发现,以及从发现漏洞到复现并修补的完整流程,三项各占三分之一。 首批榜单中,Grok 4.7(xhigh)和小米 MiMo-V2.6-Pro 同为 56 分,GPT-6 Luna(max)53 分,GLM-5.3-Flash 50 分。MiMo 平均每个任务成本只有 0.18 美元,Grok 4.7 要 11.67 美元;Luna 更低,只要 0.12 美元。 不过,这张榜不能简单理解成模型本身的网络安全能力排名。GPT-6 Sol、GPT-6 Astra 和 Claude Opus 5.5 都参加了测试,但在 CyberGym-E2E-AA 上几乎全部拒答,其中 Sol 和 Astra 拒绝全部任务,Opus 5.5 拒绝 98%。拒答直接记 0 分,Luna 反而愿意继续完成这些任务,所以综合成绩更高。Artificial Analysis 也表示,大量拒答让这些前沿模型的实际能力很难判断。 GLM-5.3 也出现了明显反常。完整版在 Artificial Analysis 的通用能力榜上高于 Flash,但这次 Cyber Index 只有 36 分,Flash 达到 50 分。主要差距来自 CyberGym-E2E-AA:Flash 得到 74%,完整版只有 29%。Artificial Analysis 暂未解释这一差距的原因。
一夜两条路线:Opus5.5冲到第一,GPT-6把同档成本砍半
动察 Beating AI 快讯,Artificial Analysis 完成对昨夜几款新模型的第三方实测。Claude Opus 5.5 max 在 Intelligence Index v4.3 拿到 58 分,目前排名第一。GPT-6 Astra 和 Fable 5.1 都是 53 分,Opus 5 为 51 分。Opus 5.5 在 10 项评测里拿下 6 项最高分。 但这个最高分也用了更多 token。Opus 5.5 max 每项任务平均输出约 11.9 万 tokens,比 Opus 5 的 7.3 万多约 60%。靠 API 降价 20% 和缓存读取降价 60%,单任务成本最终为 5.98 美元,和 Opus 5 的 5.86 美元基本持平。更实用的 medium 档拿到 51 分,已经追平 Opus 5 max,单任务成本只有 1.34 美元。 OpenAI 走的则是另一条路。GPT-6 Sol 和 Luna 的 Intelligence Index 表现与 GPT-5.6 前代接近,但价格明显下降。Sol max 每项任务成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元。编码 Agent 评测里,Sol 从 55 分升到 57 分,成本也下降约一半;Luna 从 43 分降到 41 分,但单任务成本低约 60%。 两家的路线已经开始出现分化:Opus 5.5 用更多推理把能力上限推到新高,GPT-6 Sol 和 Luna 则主要把原有能力做得更便宜。 在 Artificial Analysis 的性能/成本图上,两家的新模型都占据了新的 Pareto 前沿。
Anthropic 发布 Claude Sonnet 5.5,编程成绩超过 Opus 5.5
ChainCatcher 消息,Anthropic 于本周一发布 Claude Sonnet 5.5,作为今年 6 月推出的 Sonnet 5 的升级版本。官方称该中端模型运行速度较上一代提升超过 30%,在范围明确的日常任务、修复缺陷以及制作文档、幻灯片和表格方面表现最强,同时具备敏锐的设计能力。其定价维持每百万输入 token 2 美元、每百万输出 token 10 美元,为 Opus 5.5 的一半,且每个任务消耗的 token 较 Sonnet 5 减少近三分之一。在 Terminal-Bench 4 测试中,Sonnet 5.5 得分 70.6%,高于 Opus 5.5 的 66.4%,Sonnet 5 仅为 10.3%。独立测试机构 Artificial Analysis 的结果同样显示其领先,分别录得 63.6% 与 59.6%,OpenAI 的 GPT-6 Astra 为 59.1%。在评估 44 类职业真实工作表现的 GDPval-AA 上,Sonnet 5.5 获 1844 分,与 Opus 5.5 的 1846 分基本持平,GPT-6 Sol 为 1487 分。
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。
马斯克给Grok Bot接Claude Opus 5.5:以后谁好用就用谁
动察 Beating AI 快讯,马斯克宣布,Grok Bot 接下来会按任务选择最合适的后端模型或 API。他直接点名 Claude Opus 5.5、Midjourney 和 Suno,还会使用其他主流 AI 模型和 API。用他的话说,哪个最可能给出最好的结果,就用哪个。 Grok Bot 是 SpaceXAI 推出的常驻 AI Agent。每个 Bot 都有自己的云电脑,可以登录网页和应用,持续处理邮件、表格、客服和编程等任务。SpaceXAI 此前还专门让 Grok 4.7 学会理解 Grok Bot 的运行框架。 现在马斯克明确把这套 Agent 推向多模型路线。Grok Bot 可以根据任务调用 Claude Opus 5.5、Midjourney、Suno 等外部模型和 API。它更像负责拆任务、调模型和执行工作的上层 Agent,底下不再只依赖 Grok。