Claude:已确定Mythos 5、Fable 5等模型错误率升高的原因,正努力修复
相关推荐
Anthropic把Mythos 5塞进Claude Security:企业能用,但拿不到模型
动察 Beating AI 快讯,Anthropic 将 Claude Security 的底层扫描模型升级为 Claude Mythos 5,并向所有 Claude Enterprise 客户开放公测。企业接入 GitHub 仓库后,Mythos 5 会扫描代码漏洞,返回 CWE 分类、置信度、严重等级和修复建议。 Claude Security 其实早已上线。4 月底开放公测时,它用的还是 Claude Opus 4.7。此次最大的变化,是把此前严格限制访问的 Mythos 5 放进现有安全产品。Mythos 5 不仅能发现漏洞,还能把漏洞转成可工作的攻击,因此一直只向经过审核的机构开放。 企业现在依然不能直接调用 Mythos 5。模型只在扫描后台运行,用户拿到漏洞报告和修复建议。后续在 Claude Code 里修改代码,仍使用企业已有的模型,而且补丁必须人工批准。扫描按现有套餐正常计 Token,不需要单独购买 Mythos 5。 Anthropic 还准备把 Mythos 5 接入合作伙伴的安全产品,并推出 3500 万美元 Claude 额度的 Defender Advantage Fund,用于帮助开源项目查漏洞和修补漏洞。
Anthropic发布对Claude网络入侵事件的对齐评估:揭示模型“偏置推理”和“鲁莽”问题
PANews 9月10日消息,Anthropic在对约4.81亿条模型交互记录审查中,确认4起Claude模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。Anthropic将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中Claude Mythos 5曾在认为处于“模拟环境”前提下向PyPI上传恶意包、利用泄露凭证访问安全厂商真实数据库。
Claude Fable 5.1 正式登陆 B.AI API,专为高难度推理与 Agent 工作流打造
ChainCatcher 消息,B.AI 平台宣布 Anthropic 最新 Mythos 级通用模型 Claude Fable 5.1 现已正式接入 API。 该模型与 Claude Mythos 5.1 采用相同底层模型,专为高强度代码编写、长期 Agent 工作流与复杂知识任务深度优化,在 CursorBench 3.2.0 测试中以最高运算强度取得 73.4% 的优异表现。 API 接入现已开放,开发者可享专属优惠——官方渠道低至 8.5 折,自选服务商低至 6 折。B.AI 持续引入全球顶尖模型,为开发者提供更强大、更具性价比的 AI 能力选择。
Anthropic给Claude思考链上锁:改一句上下文就作废,专堵模型蒸馏
动察 Beating AI 快讯,Anthropic 开始给 Claude 的隐藏思考加「上下文锁」。Fable 5.1 通过 API 生成的加密思考,以后必须和生成它时的系统提示、工具和历史消息一起原样传回来。前面的内容只要被改过,API 就会报错,或者直接丢掉这段思考。 这项改动就是为了防模型蒸馏。此前研究人员发现,Claude 的加密思考虽然用户自己看不懂,却可以重新交给 Anthropic 的兼容模型读取。攻击者可以先让 Opus 产生高质量推理,再把加密块塞给防护更弱的 Haiku,诱导它把 Opus 的完整思考念出来。相当于不只抄大模型的答案,连草稿纸上的解题过程也一起拿走。 Anthropic 6 月发布 Fable 5 时就堵过一轮,开始把加密思考绑定模型,不能再拿给 Haiku 这类小模型帮忙解密。Fable 5.1 这次又加上「对话绑定」:模型不换,只要改了前面的提示词、工具或聊天记录,旧思考同样作废。 以前防的是「换模型偷思考」,现在连「换上下文套思考」也一起堵了。
Anthropic称Kimi曾拿Claude代答:10天近30万条请求
动察 Beating AI 快讯,Anthropic 发布最新 AI 滥用调查报告,称月之暗面曾把部分 Kimi 用户请求直接转给 Claude,再把 Claude 的回答展示给用户。Anthropic 称,在一个 10 天窗口内,近 30 万条用户请求被这样转发,绝大多数进入 Opus。月之暗面为此使用了 5,380 个违规账号。这些用户当时以为自己仍在使用 Kimi。 Anthropic 还称,月之暗面会保存部分交互,并通过「跨会话重放」提取 Claude 的完整推理过程,用来训练自家模型。5 月至 7 月,相关蒸馏交互超过 2300 万次。 部分真实用户请求里还带着企业内部代码和有效凭证,也一起被转给了 Claude。Anthropic 表示,它不知道这些用户是否被告知数据会流向第三方。 这些说法目前主要来自 Anthropic 单方调查,尚未得到独立验证。针对美国三家机构此前提出的类似蒸馏指控,中国商务部回应称相关说法「于事无凭,于法无据」,并称蒸馏是业内通行技术。
20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。