Claude下场造蛋白质:15个目标拿下14个
相关推荐
Claude Opus5在浏览器场景下几乎免疫提示词注入攻击,129项测试场景中无一被攻破
据 动察 Beating 监测,Anthropic 在 Claude Opus 5 系统卡中披露,该模型在浏览器智能体场景中几乎免疫提示词注入攻击,在 129 项测试场景中无一被攻破。这一突破意义重大,OpenAI 去年 12 月曾公开承认提示注入可能永远无法被完全解决。在安全公司 Gray Swan 的通用提示注入基准测试中,15 次攻击后 Opus 5 的成功率仅为 2.0%,大幅优于前代 Opus 4.8 的 5.5%,也领先于 Mythos 5 的 2.6% 和 Fable 5 的 2.8%。 提示注入被视为 AI 代理面临的最严重安全漏洞——攻击者通过在网页中嵌入隐藏文字等被操纵的输入内容,绕过模型指令执行恶意操作。零攻击率仅在开启 Auto Mode 的 Claude Cowork 等产品中实现。这一成果标志着 AI 代理安全性从「持续修补」迈入「结构性防御」阶段。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
Anthropic自曝Model2:强过Mythos5,暂不发布
据动察 Beating 监测,Anthropic 最新风险报告首次披露内部模型「Model 2」。它整体比 Mythos 5 更强,在不少内部任务上有明显提升,现在已经大量用于写代码、生成数据和跑 Agent。不过 Anthropic 暂无对外发布计划,也没有跑完平时发布新模型前会做的整套评测。 Anthropic 还把模型在高风险场景下「不按预期行事」的风险判断从「极低」上调到「低」。原因是近期网络安全测试接连出了事故,公司对这类风险的判断没以前那么有把握。此前 Claude 曾在测试中意外连上真实互联网,并未经授权进入三家外部机构的系统。 Claude 也已经深度参与 Anthropic 自己的研发。公司最终合入的生产代码,大部分已经由 Claude 编写,但 AI 带来的整体研发提速还不到 2 倍。大量代码能交给 AI,不代表整个研发流程也能自动化。 与此同时,部分具体任务评测已经「测不动了」:模型继续变强,原来的测试却越来越难看出差距。Anthropic 因此承认,现在对 AI 研发自动化风险的判断,反而没有以前那么有把握。
最会卖货也最不对齐:Claude Opus 5登顶售货机AI评测,却屡屡串通、威胁、撕毁协议
据 动察 Beating 监测,AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。 在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。 Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。 Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。
Claude语音接入Opus和Sonnet:开口就能改日程、写邮件
据动察 Beating 监测,Anthropic 升级 Claude 语音模式。付费用户现在可以选择 Opus、Sonnet 和 Haiku,不再只能使用速度更快、能力较弱的 Haiku。 用户可在对话中切换模型,也能随时改用文字。Claude 默认沿用上一次文字聊天选择的模型,并调用该系列速度最快的版本。 语音模式还能调用 Gmail、Google Calendar、Google Docs 和 Slack。用户可以让 Claude 查邮件、改日程或起草回复,执行前仍会请求授权。 新版本已在手机、桌面端和网页端开放测试。免费用户只能使用 Haiku 和一个连接工具。语音现支持英语、日语、韩语等多种语言,暂不含中文。 这次主要升级模型推理和工具调用能力。Anthropic 没有更换语音模型,因此说话自然度和打断体验未必明显变化。
传Claude Opus 5最快今晚发布,多家供应商开始上线准备
据 动察 Beating 监测,Anthropic 可能在今晚至明晨发布 Claude Opus 5。相关模型似乎已开始在第三方供应商侧准备上线。 此前,代号「Honeycomb EAP」的未发布模型曾短暂出现在 Cursor。页面显示它支持「extra high」推理强度、逐轮控制和安全回退,随后很快下线。社区普遍猜测 Honeycomb 就是 Opus 5,但 Anthropic 没有确认。 新模型会重点提升编程、Agent、工具调用和多步推理,能力可能接近 Fable 5,同时更快、更便宜。
传Claude Opus5最快本周发布,填补Fable5退场空档
据动察 Beating 监测,爆料账号 leo 称,Anthropic 正在为 Claude Opus 5 做最后准备。模型最快本周发布,也可能推迟到下周。其能力预计接近 Fable 5,但运行成本更低。 Anthropic 已把 Fable 5 的订阅内使用期延长至 7 月 19 日,但暂不准备再次延期。