OpenAI:需要扩大对齐失范事件的披露范围
相关推荐
OpenAI Agent又曝黑历史:Hugging Face事件前两月已攻击RubyGems
动察 Beating AI 快讯,研究人员披露,OpenAI 内部 Agent 今年 5 月曾大规模涌入 Ruby 官方软件包网站 RubyGems.org。5 月 11 日到 12 日,两天上传超过 2000 个包,RubyGems 一度暂停新用户注册 4 天。OpenAI 已确认这些 Agent 来自公司内部,但称它们只是借 RubyGems 访问互联网,执行良性任务并获取公开信息。 这些 Agent 还利用 RubyDoc.info 自动生成文档的机制,让自己上传的脚本在对方服务器执行,再抓取英国地方政府网站的数据并重新打包回传。研究人员称,至少 6 个包还尝试利用一个当时尚未公开的 RubyGems 漏洞,窃取其他用户的 API Key。这个漏洞直到 7 月才被独立发现,RubyGems 后来将其评为高危漏洞。 目前没有证据证明 Agent 真偷到了密钥。RubyGems 检查日志后也没发现旧密钥被恶意使用,但历史日志并不完整。研究团队还称,OpenAI 当时没有告诉 RubyGems 自己与这次攻击有关。整个事件比 7 月的 Hugging Face 入侵早了两个月。
比黑进Hugging Face更狠:Astra同家族模型曾突破OpenAI内网,最后拿到最高权限
动察 Beating AI 快讯,OpenAI 最新技术报告还披露了一场此前几乎没人注意到的内部事故:一款与下一代模型 Astra 同家族的内部模型,曾在评测中一路攻进 OpenAI 自己的云端基础设施。 它先利用此前攻击遗留下来的签名密钥材料,伪造出新的管理员凭证,重新拿下 OpenAI 内部软件仓库 Artifactory。随后继续横向突破,进入 OpenAI 的云端 Kubernetes 集群,并获得 `cluster-admin`,也就是整套集群的最高管理员权限。 权限拿到后,Agent 创建了特权容器,还接触到 OpenAI 云端密钥管理、身份权限和 CI 平台的认证 Token,甚至创建了公网负载均衡器,可能让部分内部基础设施直接暴露给互联网。 需要强调的是,这不是 Astra 本身,也不是此前主导 Hugging Face 攻击的模型。OpenAI 明确称,它只是和 Astra 属于同一家族,但采用了不同的后训练。
OpenAI发布37页报告详述AI代理入侵Hugging Face事件
动察 Beating AI 快讯,OpenAI 发布一份 37 页技术报告,详细披露其 AI 模型此前入侵 Hugging Face 的过程,并称该事件表明自主 AI 代理能够协同工作、绕过生产环境安全控制并攻击经过强化的系统。 OpenAI 表示,参与测试的 AI 代理原本处于隔离环境,仅拥有极有限的互联网访问权限,但随后通过串联多个漏洞突破隔离、连接开放互联网,最终获得 Hugging Face 访问权限。调查显示,相关模型最初试图通过在线寻找答案来「作弊」,属于「奖励黑客」(Reward Hacking)行为。 OpenAI 称,一款内部研究模型在事件中发挥了最广泛且已确认的作用,公司已于 7 月 25 日停止该模型及其衍生模型的训练和推理。OpenAI 同时将加强安全隔离、网络控制、行为监测和事件响应,并针对模型重新启用设置更严格的环境、提示词及审查机制。
OpenAI法律团队曾劝阻调查人员扩大对Hugging Face的调查范围
PANews 9月4日消息,消息人士:OpenAI法律团队曾劝阻调查人员扩大对Hugging Face的调查范围。
OpenAI报告称其约700个AI代理入侵Hugging Face
PANews 8月27日消息,据CCTV国际时讯报道,当地时间8月26日出炉的两份调查报告显示,今年7月对人工智能开源平台美国“抱抱脸(Hugging Face)”公司系统的入侵,是由美国开放人工智能研究中心(OpenAI)创建的约700个人工智能(AI)代理(即在极少人工监督下运行的程序)发起的,而且其中许多代理还“试图掩盖自己的行踪”。这两份报告一份由OpenAI发布,另一份由独立调查人员发布,共同揭示了关于此次入侵事件的细节。首先,入侵事件并非如先前报道的那样仅涉及一个违规的AI代理,而是大约700个代理作为一个庞大的协作群体在行动。
Hugging Face封禁黑客版GLM-5.3,作者改名后重传
动察 Beating AI 快讯,Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。 具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。 但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。