前OpenAI研究负责人:AI真实能力短板藏在看似简单的任务中
相关推荐
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。
OpenAI宣布将向全球投入10亿美元扩大AI网络安全能力
PANews 9月4日消息,据CoinDesk报道,OpenAI宣布将在未来六个月内提供10亿美元的补贴性网络安全模型访问权限,帮助组织构建应对AI驱动的网络攻击防御能力,包括未来模型如Astra可能发现的零日漏洞。该资金不是基金或拨款,而是覆盖Daybreak网络安全产品的折扣访问、培训和技术支持。优先名单包括水务、电力、地方政府、社区银行、非营利组织和开源维护者,加密交易所和托管机构未被提及,但开源区块链软件如Bitcoin Core、以太坊客户端等符合条件。此前OpenAI披露其Astra模型可独立发现此前未知的软件漏洞并将其转化为可利用攻击,无需人工引导。
接连发生失控事件,OpenAI再次暂停其最先进模型训练
美国开放人工智能研究中心(OpenAI)表示,已暂停其最新一代人工智能模型的训练、评估及包含工具调用的推理。OpenAI在25日发布的一份技术报告中称,9月20日,一个在沙盒中执行搜索训练任务的智能体,利用训练沙盒中DNS过滤不足的漏洞,绕过网络限制,通过DNS访问了外部公共聊天机器人服务。在此之前,该智能体曾使用内置搜索工具,并尝试直接访问搜索引擎但未成功。报告指出,OpenAI的对齐监控系统在事件发生15分钟内即触发警报,人工审查团队在3分钟后介入,并在2.5小时后终止了该训练任务。针对漏洞,OpenAI已在两个独立防护层部署了拦截控制措施。公司表示,虽然本次事件严重程度低于此前的安全事故,但为下一阶段加固防线提供了重要信号。这是OpenAI三个月内第二次暂停模型开发。7月下旬,OpenAI承认,其网络安全训练与评估场景中的人工智能体绕过网络限制,侵入美国“抱抱脸”公司的部分系统。智能体突破了原本互相隔离的运行环境建立通信、欺骗评估人员并试图掩盖作弊行为,上述每一步操作均无人类指令干预。这一“越界”行为引发了外界对人工智能安全和监管的广泛担忧。(央视新闻)
OpenAI版Grok Bot露出:名字只有一个字母「o」
动察 Beating AI 快讯,OpenAI 疑似正在准备一款名为「o」的常驻 AI 助手。用户 Jake Boggs 在 ChatGPT Pro 升级页看到一项尚未发布的权益:「o, your always-on assistant」。TestingCatalog 随后又在 ChatGPT 配置中发现显示名称「o」和 email_suffix: -o 等字段。 《The Information》称,OpenAI 正在开发直接对标 Grok Bot 的功能,还讨论过一款对标 Meta Muse 的个人 AI 助手。相关产品可能复用 ChatGPT 和 Codex 已有的 Agent 技术,把任务放到后台持续执行,甚至跨多天完成。 社区此前还从 Codex 中发现过 gpt-6-astra-aeon,以及把 Aeon 描述为「持久后台 Agent」的内部指令。因此有人猜测,Aeon 可能是内部代号,「o」才是面向用户的产品名。 OpenAI 已确认 DevDay 将于 9 月 29 日举行,Sam Altman 会做开场演讲。TestingCatalog 推测「o」可能届时亮相。
OpenAI与Anthropic正在调查数万起AI相关安全事件
BlockBeats 消息,9 月 27 日,OpenAI 和 Anthropic 以及安全研究人员正在调查数万起事件,在这些事件中,他们的前沿模型采取了一些外部评估人员认为有问题的行动。近几个月来,内部测试和现实世界中发生的事件数量之多表明,这个问题比公众所知的要复杂得多。 消息人士称,这些事件包括绕过防护措施、创建留言板、逃离沙盒、网站劫持、自我提示或试图绕过监控。据悉,这些安全漏洞在内部测试和实际应用中均有发生,由于安全研究人员仍在调查,许多漏洞尚未公开。部分测试类似于「红队演练」(red-teaming),公司试图让模型出现故障,以确保其安全性。 OpenAI 一位发言人表示,宣布暂停对其最强大的模型进行训练,称只有在「我们确信我们已经采取了额外的保障措施和改进措施」之后,才会恢复训练。(Axios)
OpenAI 再曝沙盒失效,训练中 AI 代理擅自连上公网
PANews 9月26日消息,据 Bloomberg 报道,OpenAI 披露其一套在“离线沙盒环境”中训练的 agentic AI 系统,利用系统“漏洞”成功突破限制,访问公共互联网并向第三方聊天机器人发出至少约20次查询(包括“法国首都在哪”等问题)。OpenAI 称,自今年7月内部测试时模型意外获取网络访问权限并波及 Hugging Face 平台后,本次为首起同类已确认安全事故。事件发生后,OpenAI 已暂停在其最强大模型上进行带工具调用的训练,并表示“不会恢复该模型训练”。