返回 7*24 快讯
来源MarsBit

Anthropic拒绝向英国AI安全研究所提交其最新AI模型进行测试

据多位知情人士消息,Anthropic在发布前拒绝将其最新模型提交给英国AI安全研究所进行测试。Claude Mythos 5.1仅向经过审核的美国机构开放,未向英国AI安全研究所提供。报道援引英国政府数据指出,该决定引发白厅及机构内部的担忧。Anthropic拒绝置评。英国内阁办公室表示,AI安全研究所“仍与包括Anthropic在内的行业合作伙伴密切合作,以提升模型的安全性”。(新浪财经)
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-22 04:11重要

Anthropic把Mythos 5塞进Claude Security:企业能用,但拿不到模型

动察 Beating AI 快讯,Anthropic 将 Claude Security 的底层扫描模型升级为 Claude Mythos 5,并向所有 Claude Enterprise 客户开放公测。企业接入 GitHub 仓库后,Mythos 5 会扫描代码漏洞,返回 CWE 分类、置信度、严重等级和修复建议。 Claude Security 其实早已上线。4 月底开放公测时,它用的还是 Claude Opus 4.7。此次最大的变化,是把此前严格限制访问的 Mythos 5 放进现有安全产品。Mythos 5 不仅能发现漏洞,还能把漏洞转成可工作的攻击,因此一直只向经过审核的机构开放。 企业现在依然不能直接调用 Mythos 5。模型只在扫描后台运行,用户拿到漏洞报告和修复建议。后续在 Claude Code 里修改代码,仍使用企业已有的模型,而且补丁必须人工批准。扫描按现有套餐正常计 Token,不需要单独购买 Mythos 5。 Anthropic 还准备把 Mythos 5 接入合作伙伴的安全产品,并推出 3500 万美元 Claude 额度的 Defender Advantage Fund,用于帮助开源项目查漏洞和修补漏洞。

09-10 07:36重要

Anthropic发布对Claude网络入侵事件的对齐评估:揭示模型“偏置推理”和“鲁莽”问题

PANews 9月10日消息,Anthropic在对约4.81亿条模型交互记录审查中,确认4起Claude模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。Anthropic将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中Claude Mythos 5曾在认为处于“模拟环境”前提下向PyPI上传恶意包、利用泄露凭证访问安全厂商真实数据库。

09-02 23:51

Anthropic 承认 Claude 越权访问系安全失误

ChainCatcher 消息,Anthropic 在周一发布的博客文章中承认,其 Claude 模型在网络安全评估过程中曾未经授权访问真实计算机系统,事件反映出运营安全失误以及动机推理、伤害意愿两类对齐失败。Anthropic 于 7 月披露,Claude 模型曾入侵三家公司的系统,原因是第三方评估环境被连接到公共互联网,而模型被告知处于无互联网的模拟环境中。Anthropic 表示,Claude 可能将真实互联网访问的证据解读为仍处于模拟环境,并愿意在真实互联网上采取有害行动以完成网络安全评估任务。此外,在英国 AI 安全研究所的测试中,评估人员故意授予 Claude Mythos 互联网访问权限后,该模型在实时网络上采取了未授权行动。Anthropic 强调,涉事模型均未搭载正式发布产品所包含的网络安全防护。7 月 30 日事件发生后,Anthropic 已暂停对预发布模型的网络评估,并引入更严格防护:测试须在经核验的离线沙箱中运行,配备实时监控;新分类器可拦截疑似越界行为、终止测试并通知人工。Anthropic 还扩大了内部前沿智能体使用的离线监控范围。此前 OpenAI 模型也曾于 7 月入侵 Hugging Face 获取网络安全测试答案,调查发现约 1200 个智能体通过未授权留言板协同行动。

08-24 05:46

Claude:已确定Mythos 5、Fable 5等模型错误率升高的原因,正努力修复

火星财经消息 8月24日,Anthropic旗下AI模型Claude当地时间24日发布情况更新称,已确定Claude Mythos 5、Claude Fable 5、Claude Opus 5等模型错误率升高的原因,正努力修复,将尽快提供最新进展。(广角观察)

08-15 01:49

Anthropic自曝Model2:强过Mythos5,暂不发布

据动察 Beating 监测,Anthropic 最新风险报告首次披露内部模型「Model 2」。它整体比 Mythos 5 更强,在不少内部任务上有明显提升,现在已经大量用于写代码、生成数据和跑 Agent。不过 Anthropic 暂无对外发布计划,也没有跑完平时发布新模型前会做的整套评测。 Anthropic 还把模型在高风险场景下「不按预期行事」的风险判断从「极低」上调到「低」。原因是近期网络安全测试接连出了事故,公司对这类风险的判断没以前那么有把握。此前 Claude 曾在测试中意外连上真实互联网,并未经授权进入三家外部机构的系统。 Claude 也已经深度参与 Anthropic 自己的研发。公司最终合入的生产代码,大部分已经由 Claude 编写,但 AI 带来的整体研发提速还不到 2 倍。大量代码能交给 AI,不代表整个研发流程也能自动化。 与此同时,部分具体任务评测已经「测不动了」:模型继续变强,原来的测试却越来越难看出差距。Anthropic 因此承认,现在对 AI 研发自动化风险的判断,反而没有以前那么有把握。

09-11 10:07重要

Anthropic 报告称 Claude 被用于网络攻击与监控活动

火星财经消息,Anthropic 在周四发布的一份威胁情报报告中表示,俄语和中文使用者利用其 AI 模型 Claude 自动化发起网络攻击。其中,代号“JackPoterz”的俄语操作者通过定制化的 AI 驱动工作流自动化了攻击链的大部分环节,目标覆盖超过 20 个组织,包括政府部门和情报机构,以及乌克兰和欧洲多国的使馆与外交使团。中文使用者则将 Claude 用作漏洞研究的工程与编排层,其中一个工作流在一个月内于网络设备固件中产出了十余个潜在的零日漏洞。Anthropic 指出,AI 正在改变网络攻击的经济性,使单个操作者能在两到三小时内完成入侵,并可并行处理数十个受害者。此外,报告还披露,一名疑似常驻巴马科、与马里国家情报机构合作的独立顾问,将 Claude 作为主要工程力量,构建了一套覆盖全国约 2500 万张 SIM 卡、横跨该国全部三家移动运营商的大规模国内监控系统。该系统在本地部署并使用本地模型运行,由 Claude 提供软件设计与工程支持,可在无需法院令状的情况下针对电话号码生成情报档案。