OpenAI发布AI失控追踪框架,披露模型曾试图「自我绕过限制」
相关推荐
OpenAI Agent又曝黑历史:Hugging Face事件前两月已攻击RubyGems
动察 Beating AI 快讯,研究人员披露,OpenAI 内部 Agent 今年 5 月曾大规模涌入 Ruby 官方软件包网站 RubyGems.org。5 月 11 日到 12 日,两天上传超过 2000 个包,RubyGems 一度暂停新用户注册 4 天。OpenAI 已确认这些 Agent 来自公司内部,但称它们只是借 RubyGems 访问互联网,执行良性任务并获取公开信息。 这些 Agent 还利用 RubyDoc.info 自动生成文档的机制,让自己上传的脚本在对方服务器执行,再抓取英国地方政府网站的数据并重新打包回传。研究人员称,至少 6 个包还尝试利用一个当时尚未公开的 RubyGems 漏洞,窃取其他用户的 API Key。这个漏洞直到 7 月才被独立发现,RubyGems 后来将其评为高危漏洞。 目前没有证据证明 Agent 真偷到了密钥。RubyGems 检查日志后也没发现旧密钥被恶意使用,但历史日志并不完整。研究团队还称,OpenAI 当时没有告诉 RubyGems 自己与这次攻击有关。整个事件比 7 月的 Hugging Face 入侵早了两个月。
OpenAI或周四推出GPT-6 Sol:主打更快、更省
动察 Beating AI 快讯,OpenAI 可能会在本周四发布 GPT-6 Sol。AI 顶流博主 Mark Kretschmann 直接给出了这个日期,并称它相比 Astra 会更便宜、更快,但能力稍弱。 OpenAI 目前还没官宣。Sam Altman 只确认本周有一次「大发布」,Tibo Sottiaux 则称,本周的发布规模接近一届 DevDay。 Astra 目前是 GPT-6 的最高能力型号,Sol 如果本周上线,更可能成为速度和成本更友好的日常主力。
OpenAI把ChatGPT实时语音开放API:每分钟5美分
动察 Beating AI 快讯,OpenAI 开放 GPT-Live-1 API,也就是 ChatGPT 目前使用的实时语音模型。它能同时听和说,直接理解语音、处理普通对话,也能应对插话、停顿和背景噪音。 遇到复杂推理或工具调用时,GPT-Live-1 可以把任务交给 GPT-6 Astra、Luna 或第三方模型,拿到结果后再继续和用户聊。开发者可以自己决定后端接什么模型。 相比传统的「语音转文字→大模型→文字转语音」,GPT-Live-1 减少了中间的模型交接,让实时对话更连贯。 GPT-Live-1 收费每分钟 0.05 美元,后端模型另算。
OpenAI加速清旧模型,GPT-5.5上线不到半年就退场
动察 Beating AI 快讯,OpenAI 宣布,10 月 14 日起,GPT-5.5 将从 ChatGPT、ChatGPT Work 和使用 ChatGPT 账号登录的 Codex 中下线,所有套餐都受影响。Codex 用户需要改用 GPT-5.6 Sol 或 GPT-6 Astra。 GPT-5.5 今年 4 月 23 日才发布,从发布到计划下线只有 174 天。当时 OpenAI 还把它定位为面向复杂工作和编程的旗舰模型。随着 GPT-5.6 Sol 和 GPT-6 Astra 上线,5.5 很快就进入了上一代模型名单。 不过这次并不是彻底停服。OpenAI API 仍会继续提供 GPT-5.5,使用 API Key 的 Codex 会话也不受这次下线影响。OpenAI 开发者论坛已经有用户要求保留 5.5 的 Codex 入口,称它在自己的生产编码流程里依然更稳定、返工更少。
Hugging Face封禁黑客版GLM-5.3,作者改名后重传
动察 Beating AI 快讯,Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。 具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。 但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。
ChatGPT背后藏着数百双眼睛:OpenAI雇数百外包读用户对话训练模型
动察 Beating AI 快讯,404 Media 获得的内部材料显示,OpenAI 正通过代号「Project Lily」的项目,让数百名外包人员阅读真实用户与 ChatGPT 的对话,用来训练和改进模型。审核员看不到用户名,但可能看到完整对话。有些任务还会附上用户的「记忆摘要」,包括此前聊过什么、可能住在哪里等信息。 这些人会先总结用户想做什么,再比较 ChatGPT 生成的多个回答,并按 1 到 7 分打分。审核重点包括事实是否正确、有没有过度附和用户,以及 ChatGPT 是否把自己说得太像真人。 OpenAI 会先用 Privacy Filter 去除姓名、联系方式等个人信息,但官方也承认这个模型可能漏掉不常见的身份信息和模糊的私人信息。一些敏感内容仍可能出现在审核员面前。 不是所有 ChatGPT 聊天都会被人工阅读。个人版 Free、Plus 和 Pro 默认开启「为所有用户改进模型」,用户关闭后,新聊天不会再用于训练;Business、Enterprise 和 Edu 默认不用于训练。