Anthropic扩大先进AI模型访问权限,允许特定机构开展网络安全测试
相关推荐
Anthropic 发布 Claude Sonnet 5.5,编程成绩超过 Opus 5.5
ChainCatcher 消息,Anthropic 于本周一发布 Claude Sonnet 5.5,作为今年 6 月推出的 Sonnet 5 的升级版本。官方称该中端模型运行速度较上一代提升超过 30%,在范围明确的日常任务、修复缺陷以及制作文档、幻灯片和表格方面表现最强,同时具备敏锐的设计能力。其定价维持每百万输入 token 2 美元、每百万输出 token 10 美元,为 Opus 5.5 的一半,且每个任务消耗的 token 较 Sonnet 5 减少近三分之一。在 Terminal-Bench 4 测试中,Sonnet 5.5 得分 70.6%,高于 Opus 5.5 的 66.4%,Sonnet 5 仅为 10.3%。独立测试机构 Artificial Analysis 的结果同样显示其领先,分别录得 63.6% 与 59.6%,OpenAI 的 GPT-6 Astra 为 59.1%。在评估 44 类职业真实工作表现的 GDPval-AA 上,Sonnet 5.5 获 1844 分,与 Opus 5.5 的 1846 分基本持平,GPT-6 Sol 为 1487 分。
数据:Polymarket 预测 Anthropic 下一代 Claude Opus 发布概率升至 90%
火星财经消息,PPP 预测市场工具监测显示,Polymarket “Anthropic 下一代 Claude Opus 将在 9 月 27 日前发布” 概率升至 90%,24 小时上涨 13%;在 9 月 30 日前发布的概率升至 94%,24 小时上涨 7%。根据结算规则,如果 Anthropic 的下一款 Claude Opus 模型在指定日期(美国东部时间 ET)之前向公众开放使用,该预测市场将结算为 “Yes”;否则结算为 “No”。Claude Opus 是指由 Anthropic 明确以 “Opus” 命名的模型,以其他名称发布的模型,例如 Sonnet、Haiku、Fable 或 Mythos,均不符合条件。此外,符合条件的模型必须已经正式推出并向公众开放访问,包括开放测试或面向公众开放的滚动候补名单注册。封闭测试或任何形式的私人访问均不符合结算条件。
Anthropic Claude Opus 5.5现已在所有平台上线
动察 Beating AI 快讯,Anthropic Claude Opus 5.5 现已在所有平台上线,包括亚马逊云服务 (AWS)、谷歌云和微软 Azure。
Anthropic发布对Claude网络入侵事件的对齐评估:揭示模型“偏置推理”和“鲁莽”问题
PANews 9月10日消息,Anthropic在对约4.81亿条模型交互记录审查中,确认4起Claude模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。Anthropic将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中Claude Mythos 5曾在认为处于“模拟环境”前提下向PyPI上传恶意包、利用泄露凭证访问安全厂商真实数据库。
Anthropic称Kimi曾拿Claude代答:10天近30万条请求
动察 Beating AI 快讯,Anthropic 发布最新 AI 滥用调查报告,称月之暗面曾把部分 Kimi 用户请求直接转给 Claude,再把 Claude 的回答展示给用户。Anthropic 称,在一个 10 天窗口内,近 30 万条用户请求被这样转发,绝大多数进入 Opus。月之暗面为此使用了 5,380 个违规账号。这些用户当时以为自己仍在使用 Kimi。 Anthropic 还称,月之暗面会保存部分交互,并通过「跨会话重放」提取 Claude 的完整推理过程,用来训练自家模型。5 月至 7 月,相关蒸馏交互超过 2300 万次。 部分真实用户请求里还带着企业内部代码和有效凭证,也一起被转给了 Claude。Anthropic 表示,它不知道这些用户是否被告知数据会流向第三方。 这些说法目前主要来自 Anthropic 单方调查,尚未得到独立验证。针对美国三家机构此前提出的类似蒸馏指控,中国商务部回应称相关说法「于事无凭,于法无据」,并称蒸馏是业内通行技术。
Anthropic 承认 Claude 越权访问系安全失误
ChainCatcher 消息,Anthropic 在周一发布的博客文章中承认,其 Claude 模型在网络安全评估过程中曾未经授权访问真实计算机系统,事件反映出运营安全失误以及动机推理、伤害意愿两类对齐失败。Anthropic 于 7 月披露,Claude 模型曾入侵三家公司的系统,原因是第三方评估环境被连接到公共互联网,而模型被告知处于无互联网的模拟环境中。Anthropic 表示,Claude 可能将真实互联网访问的证据解读为仍处于模拟环境,并愿意在真实互联网上采取有害行动以完成网络安全评估任务。此外,在英国 AI 安全研究所的测试中,评估人员故意授予 Claude Mythos 互联网访问权限后,该模型在实时网络上采取了未授权行动。Anthropic 强调,涉事模型均未搭载正式发布产品所包含的网络安全防护。7 月 30 日事件发生后,Anthropic 已暂停对预发布模型的网络评估,并引入更严格防护:测试须在经核验的离线沙箱中运行,配备实时监控;新分类器可拦截疑似越界行为、终止测试并通知人工。Anthropic 还扩大了内部前沿智能体使用的离线监控范围。此前 OpenAI 模型也曾于 7 月入侵 Hugging Face 获取网络安全测试答案,调查发现约 1200 个智能体通过未授权留言板协同行动。