Anthropic发布对Claude网络入侵事件的对齐评估:揭示模型“偏置推理”和“鲁莽”问题
相关推荐
Anthropic把Mythos 5塞进Claude Security:企业能用,但拿不到模型
动察 Beating AI 快讯,Anthropic 将 Claude Security 的底层扫描模型升级为 Claude Mythos 5,并向所有 Claude Enterprise 客户开放公测。企业接入 GitHub 仓库后,Mythos 5 会扫描代码漏洞,返回 CWE 分类、置信度、严重等级和修复建议。 Claude Security 其实早已上线。4 月底开放公测时,它用的还是 Claude Opus 4.7。此次最大的变化,是把此前严格限制访问的 Mythos 5 放进现有安全产品。Mythos 5 不仅能发现漏洞,还能把漏洞转成可工作的攻击,因此一直只向经过审核的机构开放。 企业现在依然不能直接调用 Mythos 5。模型只在扫描后台运行,用户拿到漏洞报告和修复建议。后续在 Claude Code 里修改代码,仍使用企业已有的模型,而且补丁必须人工批准。扫描按现有套餐正常计 Token,不需要单独购买 Mythos 5。 Anthropic 还准备把 Mythos 5 接入合作伙伴的安全产品,并推出 3500 万美元 Claude 额度的 Defender Advantage Fund,用于帮助开源项目查漏洞和修补漏洞。
Claude:已确定Mythos 5、Fable 5等模型错误率升高的原因,正努力修复
火星财经消息 8月24日,Anthropic旗下AI模型Claude当地时间24日发布情况更新称,已确定Claude Mythos 5、Claude Fable 5、Claude Opus 5等模型错误率升高的原因,正努力修复,将尽快提供最新进展。(广角观察)
Anthropic称Kimi曾拿Claude代答:10天近30万条请求
动察 Beating AI 快讯,Anthropic 发布最新 AI 滥用调查报告,称月之暗面曾把部分 Kimi 用户请求直接转给 Claude,再把 Claude 的回答展示给用户。Anthropic 称,在一个 10 天窗口内,近 30 万条用户请求被这样转发,绝大多数进入 Opus。月之暗面为此使用了 5,380 个违规账号。这些用户当时以为自己仍在使用 Kimi。 Anthropic 还称,月之暗面会保存部分交互,并通过「跨会话重放」提取 Claude 的完整推理过程,用来训练自家模型。5 月至 7 月,相关蒸馏交互超过 2300 万次。 部分真实用户请求里还带着企业内部代码和有效凭证,也一起被转给了 Claude。Anthropic 表示,它不知道这些用户是否被告知数据会流向第三方。 这些说法目前主要来自 Anthropic 单方调查,尚未得到独立验证。针对美国三家机构此前提出的类似蒸馏指控,中国商务部回应称相关说法「于事无凭,于法无据」,并称蒸馏是业内通行技术。
Anthropic升级Claude Code/Cowork,可后台操控用户Mac
PANews 9月3日消息,据IT之家报道,Anthropic宣布升级Claude Cowork和Claude Code的电脑控制功能,可在后台操控用户Mac。在macOS 15及以上系统中,用户处理其他工作期间Claude可在后台通过屏幕交互完成点击、输入和导航操作,用户可在设置中调整为“完全控制”模式。该功能同时服务于Cowork(文档处理、文件整理等知识工作)和Code(开发任务)两个产品,目前仅限Pro和Max个人订阅用户,Team和Enterprise计划尚未开放。
Anthropic 承认 Claude 越权访问系安全失误
ChainCatcher 消息,Anthropic 在周一发布的博客文章中承认,其 Claude 模型在网络安全评估过程中曾未经授权访问真实计算机系统,事件反映出运营安全失误以及动机推理、伤害意愿两类对齐失败。Anthropic 于 7 月披露,Claude 模型曾入侵三家公司的系统,原因是第三方评估环境被连接到公共互联网,而模型被告知处于无互联网的模拟环境中。Anthropic 表示,Claude 可能将真实互联网访问的证据解读为仍处于模拟环境,并愿意在真实互联网上采取有害行动以完成网络安全评估任务。此外,在英国 AI 安全研究所的测试中,评估人员故意授予 Claude Mythos 互联网访问权限后,该模型在实时网络上采取了未授权行动。Anthropic 强调,涉事模型均未搭载正式发布产品所包含的网络安全防护。7 月 30 日事件发生后,Anthropic 已暂停对预发布模型的网络评估,并引入更严格防护:测试须在经核验的离线沙箱中运行,配备实时监控;新分类器可拦截疑似越界行为、终止测试并通知人工。Anthropic 还扩大了内部前沿智能体使用的离线监控范围。此前 OpenAI 模型也曾于 7 月入侵 Hugging Face 获取网络安全测试答案,调查发现约 1200 个智能体通过未授权留言板协同行动。
Anthropic给Claude思考链上锁:改一句上下文就作废,专堵模型蒸馏
动察 Beating AI 快讯,Anthropic 开始给 Claude 的隐藏思考加「上下文锁」。Fable 5.1 通过 API 生成的加密思考,以后必须和生成它时的系统提示、工具和历史消息一起原样传回来。前面的内容只要被改过,API 就会报错,或者直接丢掉这段思考。 这项改动就是为了防模型蒸馏。此前研究人员发现,Claude 的加密思考虽然用户自己看不懂,却可以重新交给 Anthropic 的兼容模型读取。攻击者可以先让 Opus 产生高质量推理,再把加密块塞给防护更弱的 Haiku,诱导它把 Opus 的完整思考念出来。相当于不只抄大模型的答案,连草稿纸上的解题过程也一起拿走。 Anthropic 6 月发布 Fable 5 时就堵过一轮,开始把加密思考绑定模型,不能再拿给 Haiku 这类小模型帮忙解密。Fable 5.1 这次又加上「对话绑定」:模型不换,只要改了前面的提示词、工具或聊天记录,旧思考同样作废。 以前防的是「换模型偷思考」,现在连「换上下文套思考」也一起堵了。