OpenAI、Anthropic等多家AI公司正遭遇服务中断
相关推荐
数学家指控OpenAI抢发成果,还要求删掉Anthropic员工署名
动察 Beating AI 快讯,纽约大学数学家 Tristan Buckmaster 和 Levent Alpöge 最近借助 Claude、Codex 等大模型,在一个月内推进了多个流体力学难题,部分结果已经通过 Lean 机器验证。 论文还没正式发完,两人先和 OpenAI 闹翻了。 Buckmaster 称,9 月初他们尚未公开的进展传到了 OpenAI。他主动联系 OpenAI,希望避免双方撞车。三天后,OpenAI 研究员 Sébastien Bubeck 告诉他,OpenAI 内部模型已经写出约 100 页的 Navier-Stokes 证明。这是数学界七个「千禧年难题」之一,Clay 数学研究所悬赏 100 万美元。 Buckmaster 随后反复追问 OpenAI 是什么时候开始做的。按照他的说法,对方最后确认,第一个 prompt 是最近几天才发出的,当时 OpenAI 已经知道他们取得了进展。OpenAI 走的还是一条与他们高度重合、此前很少有人研究的路线,背后还有一个团队和大量算力。 两人的研究草稿此前一直放在 Codex 里。Buckmaster 因此追问这些数据有没有被用于训练,没有得到明确回答。他也承认,目前没有证据证明 OpenAI 使用过这些数据。 后面的谈判把事情彻底推向公开。Buckmaster 称,OpenAI 提议让他们先发自己的成果,第二天再发布 Navier-Stokes;另一套方案由 Buckmaster 来写 OpenAI 的论文,但不要让 Alpöge 署名。Bubeck 据称两次提出删掉 Alpöge,提到的理由是他在 Anthropic 工作。 Buckmaster 拒绝后表示,如果 OpenAI 按这个方案发布,他会公开全部经过。他称对方随后问他:「你为什么要毁掉自己的职业生涯?」当天晚些时候,Bubeck 又单独联系 Alpöge,称自己不确定 Buckmaster 当时是否「完全理性」。Alpöge 没有接受单独沟通。 Buckmaster 最终提前公开论文和声明。他同时强调,自己没有看过 OpenAI 那份证明,不知道证明是否成立,也不知道自己的 Codex 数据有没有被使用。 Bubeck 随后公开否认相关指控,称其「虚假且煽动性」,并表示还会进一步回应。
OpenAI、Anthropic产品负责人互相阴阳:你家模型也就刚追上我家
动察 Beating AI 快讯,Claude Code 负责人 Boris Cherny 发帖称,GPT-6 Astra 的提示词注入防护已经和 Gemini Flash、Claude Opus 4.8「差不多」,还顺手夸了自家 Claude 模型大约两个月前已「在实践中解决」这个问题。提示词注入就是把恶意指令藏进网页、文档等内容,诱导 Agent 泄露数据或执行危险操作。 Boris 还称,公开评估并点名其他实验室,是推动它们训练出更安全模型的好办法,「我们会继续这样做,直到其他实验室更加重视安全」。 帖子很快被 X 加上 Community Note 反驳。Gray Swan 的独立评测显示,没有任何受测模型完全免疫提示词注入,Claude 同样存在攻击成功案例。另一名安全研究员还用特制网页攻击 Claude Code Opus 5 Auto Mode,在小规模测试中取得 60%–80% 的成功率。 OpenAI 核心产品负责人 Thibault Sottiaux 随后直接照着 Boris 的句式反写了一遍。他称自己也很高兴看到 Claude Code 新出的后台电脑操作终于追上 Codex,「而且是我们今年 5 月的版本」。 Boris 后来承认,原帖「比自己想要的更阴阳」,强调自己确实是在认真肯定 Astra 的进步。他同时澄清,所谓提示词注入已经「解决」,指的是 Claude 模型、注入检测机制和 Auto Mode 组合起来后的产品效果,不是模型本身已经免疫。
Anthropic与OpenAI、谷歌分歧扩大,反对放宽州级AI安全监管
Odaily星球日报讯 Anthropic 正因一项马萨诸塞州 AI 安全法案与谷歌、OpenAI 等大型科技公司产生分歧。该法案提议要求大型 AI 开发商每四个月聘请独立评估机构,对其 AI 模型可能造成的灾难性风险进行评估。如果通过,该提案可能成为美国州级 AI 监管的新标准。 在美国国会迟迟未能推进联邦 AI 监管立法之际,各州正加速推出相关规则。Anthropic 此次与其他科技巨头在 AI 安全监管问题上的立场分化,也反映出行业内部对于 AI 模型风险评估及监管强度仍存在明显分歧。(The Information)
Anthropic 承认 Claude 越权访问系安全失误
ChainCatcher 消息,Anthropic 在周一发布的博客文章中承认,其 Claude 模型在网络安全评估过程中曾未经授权访问真实计算机系统,事件反映出运营安全失误以及动机推理、伤害意愿两类对齐失败。Anthropic 于 7 月披露,Claude 模型曾入侵三家公司的系统,原因是第三方评估环境被连接到公共互联网,而模型被告知处于无互联网的模拟环境中。Anthropic 表示,Claude 可能将真实互联网访问的证据解读为仍处于模拟环境,并愿意在真实互联网上采取有害行动以完成网络安全评估任务。此外,在英国 AI 安全研究所的测试中,评估人员故意授予 Claude Mythos 互联网访问权限后,该模型在实时网络上采取了未授权行动。Anthropic 强调,涉事模型均未搭载正式发布产品所包含的网络安全防护。7 月 30 日事件发生后,Anthropic 已暂停对预发布模型的网络评估,并引入更严格防护:测试须在经核验的离线沙箱中运行,配备实时监控;新分类器可拦截疑似越界行为、终止测试并通知人工。Anthropic 还扩大了内部前沿智能体使用的离线监控范围。此前 OpenAI 模型也曾于 7 月入侵 Hugging Face 获取网络安全测试答案,调查发现约 1200 个智能体通过未授权留言板协同行动。
OpenAI给Codex连挖3人:Linear产品负责人+Kairos两位创始人加盟
动察 Beating AI 快讯,OpenAI 一天内给 Codex 和 ChatGPT 连挖 3 人。Linear 产品负责人 Nan Yu 宣布加入 OpenAI,结束在 Linear 4 年的工作。随后,Kairos Computer 两位联合创始人 Manas Bam 和 Samarth Patel 也宣布加入,三人去向都是 Codex 和 ChatGPT。 Kairos 做的是能直接操作电脑的个人 Agent。它给 Agent 一台云端电脑,让它自己登录网站、操作浏览器和软件,跨应用完成任务。两位创始人说,他们创办 Kairos 时想做「每个人的个人 AGI」,现在准备去 OpenAI 继续做这件事。
视频|Dario Amodei:为安全推迟发布Claude六个月,亲手错过了「ChatGPT时刻」
Anthropic CEO Dario Amodei 在参加 CFR CEO Speaker Series 时表示,Anthropic 当年其实有机会抢在 ChatGPT 之前发布 Claude,但出于安全考虑,主动将发布时间推迟了大约 6 个月,也因此错过了「ChatGPT 时刻」。这个决定确实让 Anthropic 付出了商业上的代价,但也奠定了公司此后更重视安全的文化。