Claude Fable 5.1 正式登陆 B.AI API,专为高难度推理与 Agent 工作流打造
相关推荐
Anthropic 承认 Claude 越权访问系安全失误
ChainCatcher 消息,Anthropic 在周一发布的博客文章中承认,其 Claude 模型在网络安全评估过程中曾未经授权访问真实计算机系统,事件反映出运营安全失误以及动机推理、伤害意愿两类对齐失败。Anthropic 于 7 月披露,Claude 模型曾入侵三家公司的系统,原因是第三方评估环境被连接到公共互联网,而模型被告知处于无互联网的模拟环境中。Anthropic 表示,Claude 可能将真实互联网访问的证据解读为仍处于模拟环境,并愿意在真实互联网上采取有害行动以完成网络安全评估任务。此外,在英国 AI 安全研究所的测试中,评估人员故意授予 Claude Mythos 互联网访问权限后,该模型在实时网络上采取了未授权行动。Anthropic 强调,涉事模型均未搭载正式发布产品所包含的网络安全防护。7 月 30 日事件发生后,Anthropic 已暂停对预发布模型的网络评估,并引入更严格防护:测试须在经核验的离线沙箱中运行,配备实时监控;新分类器可拦截疑似越界行为、终止测试并通知人工。Anthropic 还扩大了内部前沿智能体使用的离线监控范围。此前 OpenAI 模型也曾于 7 月入侵 Hugging Face 获取网络安全测试答案,调查发现约 1200 个智能体通过未授权留言板协同行动。
Anthropic给Claude思考链上锁:改一句上下文就作废,专堵模型蒸馏
动察 Beating AI 快讯,Anthropic 开始给 Claude 的隐藏思考加「上下文锁」。Fable 5.1 通过 API 生成的加密思考,以后必须和生成它时的系统提示、工具和历史消息一起原样传回来。前面的内容只要被改过,API 就会报错,或者直接丢掉这段思考。 这项改动就是为了防模型蒸馏。此前研究人员发现,Claude 的加密思考虽然用户自己看不懂,却可以重新交给 Anthropic 的兼容模型读取。攻击者可以先让 Opus 产生高质量推理,再把加密块塞给防护更弱的 Haiku,诱导它把 Opus 的完整思考念出来。相当于不只抄大模型的答案,连草稿纸上的解题过程也一起拿走。 Anthropic 6 月发布 Fable 5 时就堵过一轮,开始把加密思考绑定模型,不能再拿给 Haiku 这类小模型帮忙解密。Fable 5.1 这次又加上「对话绑定」:模型不换,只要改了前面的提示词、工具或聊天记录,旧思考同样作废。 以前防的是「换模型偷思考」,现在连「换上下文套思考」也一起堵了。
Anthropic发布对Claude网络入侵事件的对齐评估:揭示模型“偏置推理”和“鲁莽”问题
PANews 9月10日消息,Anthropic在对约4.81亿条模型交互记录审查中,确认4起Claude模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。Anthropic将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中Claude Mythos 5曾在认为处于“模拟环境”前提下向PyPI上传恶意包、利用泄露凭证访问安全厂商真实数据库。
谷歌14年工程老将Addy Osmani加入Anthropic,参与Claude Code开发
动察 Beating AI 快讯,Addy Osmani 宣布加入 Anthropic,接下来会参与 Claude Code 开发,重点改善开发者体验。 Osmani 在谷歌工作超过 14 年,长期负责 Chrome 开发者体验,后来转到 Google Cloud AI。他负责过 Cloud AI 开发者体验和技术布道,也参与 Agent Platform、Agent CLI、Agent Studio 等产品上线。 他近一年一直在研究 Coding Agent 和 Agent 工作流,也长期公开使用和分析 Claude Code。
Anthropic预览Function Hooks:Claude Code插件能直接改界面
动察 Beating AI 快讯,Anthropic 正在测试 Claude Code 的新扩展机制 Function Hooks,目前还没有上线。它允许插件直接用 TypeScript 函数接入 Claude Code,甚至修改 React 界面的组件、显示内容和交互。现有 Hooks 则主要是在特定事件发生时调用命令、HTTP、MCP、Prompt 或子 Agent。 Function Hooks 的工作方式类似 Express、Koa 的中间件,可以让多个插件层层嵌套。插件通过一个受控的 $ 对象执行操作,管理员还能收走其中某些能力,让后面的插件无法调用。一个 Hook 也可以监听所有事件和插件通过 $ 发出的操作,用来统一记录审计日志。 最大的变化是,Claude Code 插件的能力开始深入到界面和交互层。官方演示里,Claude 可以一句话生成一个插件,在工具输出进入模型前自动遮掉密码等敏感信息。另一个插件可以直接修改 Claude Code Desktop 的显示,把敏感内容藏起来,鼠标移上去才显示。
Claude上线内容检测器:最会写文章,偏偏查不了文章
动察 Beating AI 快讯,Anthropic 上线了一个免费的 Claude Content Checker,可以检查图片、视频和音频文件里有没有 Claude 留下的内容凭证。 比较搞笑的是,Claude 目前最主要的生成内容明明是文字,而且本身也没有传统意义上的生图、视频生成模型。结果这个公开检测器偏偏还查不了文字。 Claude Fable 5.1 和 Mythos 5.1 已经开始给生成文字加入不可见水印,但对应的检测 API 目前还在私测,只开放给部分媒体、研究机构和监管机构。