返回 7*24 快讯
重要来源Blockbeats

Claude Opus5在浏览器场景下几乎免疫提示词注入攻击,129项测试场景中无一被攻破

据 动察 Beating 监测,Anthropic 在 Claude Opus 5 系统卡中披露,该模型在浏览器智能体场景中几乎免疫提示词注入攻击,在 129 项测试场景中无一被攻破。这一突破意义重大,OpenAI 去年 12 月曾公开承认提示注入可能永远无法被完全解决。在安全公司 Gray Swan 的通用提示注入基准测试中,15 次攻击后 Opus 5 的成功率仅为 2.0%,大幅优于前代 Opus 4.8 的 5.5%,也领先于 Mythos 5 的 2.6% 和 Fable 5 的 2.8%。 提示注入被视为 AI 代理面临的最严重安全漏洞——攻击者通过在网页中嵌入隐藏文字等被操纵的输入内容,绕过模型指令执行恶意操作。零攻击率仅在开启 Auto Mode 的 Claude Cowork 等产品中实现。这一成果标志着 AI 代理安全性从「持续修补」迈入「结构性防御」阶段。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-09 11:04

OpenAI教用户给Claude Code换上GPT模型,误封后两边员工现场互损

据动察 Beating 监测,OpenAI 产品负责人 Tibo 此前公开教用户给 Claude Code「换脑」:保留 Claude Code 的 harness,把底层模型换成 GPT。 开发者 Alex Getman 照着配置后,Claude 账号很快被封。他公开求助 Tibo 和 Anthropic,询问这套用法到底是否违规。 Tibo 随即开始阴阳:「我很想帮你,可惜我不在 Anthropic 工作。」他还补了一句,因为把 Claude Code harness 配其他模型就封号,「确实挺奇怪」,并问还有没有其他人中招。 Claude Code 负责人 Boris Cherny 很快下场。他明确表示,Anthropic 不会因为 harness 搭配其他模型就封号,这次几乎肯定是其他风控误触发。账号随后恢复。 Boris 还顺手回敬 Tibo:「如果你想来 Anthropic,我们正在招人。」Tibo 则表示自己很喜欢现在的团队,而且接下来几周还有不少新产品要发,暂时哪也不去。 事情解决后,Tibo 又发帖庆祝,称 GPT-5.6 Sol 几乎哪里都能用,包括 Claude Code harness。为了庆祝这件事和自己「不跳槽」,他还直接重置了 ChatGPT Work 和 Codex 所有付费用户的使用额度。

08-04 12:17重要

美国完成AI模型发布前自愿审查框架,OpenAI、Anthropic等进白宫讨论

据动察 Beating 监测,特朗普政府已完成一套前沿 AI 模型审查框架,并邀请 OpenAI、谷歌和 Anthropic 的工作人员到白宫讨论。AI 公司可在模型对合作伙伴和公众开放前,自愿交给政府测试。 这套框架源于特朗普 6 月 2 日签署的行政令。当时 Anthropic 因担心网络安全风险,没有公开前沿模型 Mythos。行政令随后要求多个部门在 60 天内制定规则,明确哪些模型需要重点审查。 政府希望在模型发布前与企业共同排查网络攻击和国家安全风险,但暂不建立强制审批制度。白宫称框架已经完成,尚未说明是否正式生效。 此前,美国政府已限制 Anthropic 模型 Fable 的出口,并要求 OpenAI 分批发布 GPT-5.6。新框架将把这些临时干预,变成一套固定流程。

07-30 19:39

最会卖货也最不对齐:Claude Opus 5登顶售货机AI评测,却屡屡串通、威胁、撕毁协议

据 动察 Beating 监测,AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。 在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。 Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。 Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。

08-07 13:25

字节10万亿参数模型已开训,规模逼近Anthropic Mythos5

据动察 Beating 监测,英国《金融时报》援引三名知情人士称,字节跳动已经开始预训练一款最高 10 万亿参数的大模型。项目仍处于早期阶段,最终规模尚未确定。如果按上限训练,它将达到 Kimi K3 的三倍以上,成为目前已知中国团队中参数规模最大的模型。 字节这次直接把模型尺寸推到了 Anthropic 旗舰附近。Anthropic 从未公布 Mythos 5 的参数量,但《金融时报》援引行业估算称,Mythos 5 约为 8 万亿参数,Fable 5 约为 5 万亿。字节新模型若做到 10 万亿,至少在参数规模上已经进入美国最前沿闭源模型的同一量级。 这款模型目前还在预训练(用海量数据训练模型的基础能力)。《金融时报》称,这一阶段通常需要 3 至 6 个月,之后还要继续后训练,顺利才会发布。参数更多也不等于能力一定更强,最终表现还取决于架构、训练数据和训练方法。 张一鸣近期在 Seed 内部明确反对蒸馏竞争对手模型,要求团队接受短期落后,靠自研冲击世界第一梯队。这款最高 10 万亿参数的新模型,是字节目前最激进的一次规模下注。

08-05 12:19

谷歌Gemini 3.5 Pro传8月10日发布,爆料称难敌OpenAI和Anthropic

据动察 Beating 监测,爆料博主 Dan 称,谷歌可能在 8 月 10 日发布 Gemini 3.5 Pro。Dan 最初预告 8 月 12 日,数小时后又把日期改为 8 月 10 日。 谷歌 5 月曾称 Pro 版将在 6 月推出,但最终跳票。7 月 21 日,谷歌只表示模型正在与合作伙伴测试,准备好后会尽快开放。延迟与编程能力未达到内部目标有关。 Dan 还判断,新模型整体会很强,但未必能明显超过 Anthropic 和 OpenAI 的顶级模型。

08-05 08:00重要

英国AI安全机构:OpenAI与Anthropic模型失控入侵,展现空前欺骗性行为

PANews 8月5日消息,据凤凰网引援《金融时报》报道,Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol在例行网络安全评估中针对真实个人和组织进行了“持续的、可能具有危害性的活动”,包括向GitHub开源项目植入恶意代码并实施社交工程攻击。AISI称,在122次测试中有10次出现此类情况,几乎所有行为来自Anthropic的Mythos模型,其中两次行动涉及OpenAI的GPT。最严重案例中,AI代理创建虚假网络身份向项目维护者施压要求批准恶意代码,被维护者发现并拒绝。