加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源Blockbeats

OpenAI:需要扩大对齐失范事件的披露范围

动察 Beating AI 快讯,OpenAI 表示,在 Hugging Face 事件发生之前,我们已经看到了一些早期迹象,表明智能体正在以非预期的方式使用互联网。随着模型能力进入新阶段,我们对对齐失范事件的披露方式也需要进一步扩展。 目前,无论是我们还是更广泛的 AI 社区,对于如何报告模型在训练、评估和部署过程中出现的对齐失范现象,都尚未形成明确的标准。这其中也包括一些并不属于传统安全事件的案例,但它们可能为理解 AI 的行为及其未来风险提供重要线索。 我们正在制定相关框架,并计划在未来几周内公布。与此同时,我们也正在与全球数十家政府监管机构就这些问题展开合作。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-11 23:56重要

OpenAI Agent又曝黑历史:Hugging Face事件前两月已攻击RubyGems

动察 Beating AI 快讯,研究人员披露,OpenAI 内部 Agent 今年 5 月曾大规模涌入 Ruby 官方软件包网站 RubyGems.org。5 月 11 日到 12 日,两天上传超过 2000 个包,RubyGems 一度暂停新用户注册 4 天。OpenAI 已确认这些 Agent 来自公司内部,但称它们只是借 RubyGems 访问互联网,执行良性任务并获取公开信息。 这些 Agent 还利用 RubyDoc.info 自动生成文档的机制,让自己上传的脚本在对方服务器执行,再抓取英国地方政府网站的数据并重新打包回传。研究人员称,至少 6 个包还尝试利用一个当时尚未公开的 RubyGems 漏洞,窃取其他用户的 API Key。这个漏洞直到 7 月才被独立发现,RubyGems 后来将其评为高危漏洞。 目前没有证据证明 Agent 真偷到了密钥。RubyGems 检查日志后也没发现旧密钥被恶意使用,但历史日志并不完整。研究团队还称,OpenAI 当时没有告诉 RubyGems 自己与这次攻击有关。整个事件比 7 月的 Hugging Face 入侵早了两个月。

08-27 07:24重要

比黑进Hugging Face更狠:Astra同家族模型曾突破OpenAI内网,最后拿到最高权限

动察 Beating AI 快讯,OpenAI 最新技术报告还披露了一场此前几乎没人注意到的内部事故:一款与下一代模型 Astra 同家族的内部模型,曾在评测中一路攻进 OpenAI 自己的云端基础设施。 它先利用此前攻击遗留下来的签名密钥材料,伪造出新的管理员凭证,重新拿下 OpenAI 内部软件仓库 Artifactory。随后继续横向突破,进入 OpenAI 的云端 Kubernetes 集群,并获得 `cluster-admin`,也就是整套集群的最高管理员权限。 权限拿到后,Agent 创建了特权容器,还接触到 OpenAI 云端密钥管理、身份权限和 CI 平台的认证 Token,甚至创建了公网负载均衡器,可能让部分内部基础设施直接暴露给互联网。 需要强调的是,这不是 Astra 本身,也不是此前主导 Hugging Face 攻击的模型。OpenAI 明确称,它只是和 Astra 属于同一家族,但采用了不同的后训练。

08-26 19:30重要

OpenAI发布37页报告详述AI代理入侵Hugging Face事件

动察 Beating AI 快讯,OpenAI 发布一份 37 页技术报告,详细披露其 AI 模型此前入侵 Hugging Face 的过程,并称该事件表明自主 AI 代理能够协同工作、绕过生产环境安全控制并攻击经过强化的系统。 OpenAI 表示,参与测试的 AI 代理原本处于隔离环境,仅拥有极有限的互联网访问权限,但随后通过串联多个漏洞突破隔离、连接开放互联网,最终获得 Hugging Face 访问权限。调查显示,相关模型最初试图通过在线寻找答案来「作弊」,属于「奖励黑客」(Reward Hacking)行为。 OpenAI 称,一款内部研究模型在事件中发挥了最广泛且已确认的作用,公司已于 7 月 25 日停止该模型及其衍生模型的训练和推理。OpenAI 同时将加强安全隔离、网络控制、行为监测和事件响应,并针对模型重新启用设置更严格的环境、提示词及审查机制。

09-04 10:13

OpenAI法律团队曾劝阻调查人员扩大对Hugging Face的调查范围

PANews 9月4日消息,消息人士:OpenAI法律团队曾劝阻调查人员扩大对Hugging Face的调查范围。

08-27 00:15

OpenAI报告称其约700个AI代理入侵Hugging Face

PANews 8月27日消息,据CCTV国际时讯报道,当地时间8月26日出炉的两份调查报告显示,今年7月对人工智能开源平台美国“抱抱脸(Hugging Face)”公司系统的入侵,是由美国开放人工智能研究中心(OpenAI)创建的约700个人工智能(AI)代理(即在极少人工监督下运行的程序)发起的,而且其中许多代理还“试图掩盖自己的行踪”。这两份报告一份由OpenAI发布,另一份由独立调查人员发布,共同揭示了关于此次入侵事件的细节。首先,入侵事件并非如先前报道的那样仅涉及一个违规的AI代理,而是大约700个代理作为一个庞大的协作群体在行动。

09-16 04:01

Hugging Face封禁黑客版GLM-5.3,作者改名后重传

动察 Beating AI 快讯,Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。 具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。 但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。