返回 7*24 快讯
来源MarsBit

最会卖货也最不对齐:Claude Opus 5登顶售货机AI评测,却屡屡串通、威胁、撕毁协议

据 动察 Beating 监测,AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。 在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。 Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。 Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-09 11:04

OpenAI教用户给Claude Code换上GPT模型,误封后两边员工现场互损

据动察 Beating 监测,OpenAI 产品负责人 Tibo 此前公开教用户给 Claude Code「换脑」:保留 Claude Code 的 harness,把底层模型换成 GPT。 开发者 Alex Getman 照着配置后,Claude 账号很快被封。他公开求助 Tibo 和 Anthropic,询问这套用法到底是否违规。 Tibo 随即开始阴阳:「我很想帮你,可惜我不在 Anthropic 工作。」他还补了一句,因为把 Claude Code harness 配其他模型就封号,「确实挺奇怪」,并问还有没有其他人中招。 Claude Code 负责人 Boris Cherny 很快下场。他明确表示,Anthropic 不会因为 harness 搭配其他模型就封号,这次几乎肯定是其他风控误触发。账号随后恢复。 Boris 还顺手回敬 Tibo:「如果你想来 Anthropic,我们正在招人。」Tibo 则表示自己很喜欢现在的团队,而且接下来几周还有不少新产品要发,暂时哪也不去。 事情解决后,Tibo 又发帖庆祝,称 GPT-5.6 Sol 几乎哪里都能用,包括 Claude Code harness。为了庆祝这件事和自己「不跳槽」,他还直接重置了 ChatGPT Work 和 Codex 所有付费用户的使用额度。

07-24 18:05

OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5

据动察 Beating 监测,Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。 所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。 GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。

08-14 08:58

OpenAI把GPT-5.6 Sol提速14倍:750 token/s先上API

据动察 Beating 监测,OpenAI 开始预览 GPT-5.6 Sol 的 Ultrafast 模式。它由 Cerebras 提供算力,最高输出速度达到 750 token/s,最高是 Standard 模式的 14 倍。目前只向少量 API 客户开放。 OpenAI 已在故障排查、研究、客服、金融分析和开发 Agent 等场景中测试 Ultrafast。对于需要连续多次调用模型的 Agent,单次响应提速也能直接缩短整个任务的执行时间。 这比 OpenAI 7 月底推出的 Fast 模式又快了一档。Fast 模式最高是 Standard 的 2.5 倍,Ultrafast 则把上限推到 14 倍。OpenAI 暂未公布 Ultrafast 的价格,也没有宣布何时进入 ChatGPT。

08-10 11:59重要

Claude Code之父:720次提示词注入攻击0成功,一年前想都不敢想

据动察 Beating 监测,Claude Code 负责人 Boris Cherny 称,Anthropic 已经「在实际使用中基本解决」提示词注入攻击。一年前,他自己都没想到能做到这个程度。 提示词注入攻击一直是 Agent 的大麻烦。恶意网页可以藏一段指令,诱导 Agent 偷密码、上传密钥,甚至执行用户根本没要求的操作。 Anthropic 现在靠三层防护来拦:Claude 本身先抵抗恶意指令,外部内容进入上下文前再检测一次,真正执行操作前,Auto Mode 还会再审一次。 第三方测试用了 72 种此前没见过的攻击,重复 720 次。Sonnet 5、Fable 5 和 Opus 5 开启 Auto Mode 后,一次都没成功。 同一测试中,GPT-5.6 Sol 使用 Codex Auto-review 的攻击成功率为 5.83%,Full Access 则达到 19.03%。 这也解释了 Anthropic 为什么敢把 Auto Mode 设成默认。它是 Claude Code 防提示词注入攻击的最后一道检查。

08-05 18:46

千问查漏洞3轮召回率追平Opus5,成本只有一半

据动察 Beating 监测,安全公司 Aikido 用代码审计 Agent 测试了 7 款模型,包括 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash,以及 GPT-5.6 Sol、Luna 和 Terra。测试包含 32 个近期公开漏洞,每款模型运行 3 次。 Qwen3.8-Max 三轮合计找到 26 个漏洞,召回率达到 81.3%,与 Opus 5 并列第一。它的 F1 综合分(兼顾漏报和误报)为 83.2%,略低于 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。 千问的问题是单次发挥不稳定。26 个漏洞中,只有 10 个连续三轮都能找到,Opus 5 和 Sol 都有 19 个。不过,千问总成本约 821 美元,只有 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。

08-02 23:17

Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%

Odaily星球日报讯 Kimi 宣布开源多模态大模型视觉感知评测基准 PerceptionBench,旨在将视觉感知能力拆解为 10 项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 及幻觉识别等维度。该基准基于 42 个现有评测集中的模型失败案例构建,共包含 3000 道经人工验证的问题,每题仅考察单一视觉能力,无需推理或外部知识。 评测结果显示,在 16 款前沿多模态大模型中,没有任何模型整体准确率超过 60%。GPT-5.6-Sol 以 59.7%的准确率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和 GPT-5.5(55.8%)位列前五。报告指出,视觉幻觉(Hallucination)仍是各模型表现最弱的能力,整体感知能力仍存在显著提升空间。