返回 7*24 快讯
来源Blockbeats

OpenAI公开Navier-Stokes证明,并正面回应数学家抢功指控

动察 Beating AI 快讯,OpenAI 公布了一份由 AI 完成的 Navier-Stokes 证明。这是悬而未决约 90 年的数学难题,也是七个「千禧年难题」之一,奖金 100 万美元。 OpenAI 称,使用的是一个仍在训练、能力明显强于 GPT-6 Astra 的内部模型,约 1 万个 Agent 协同工作,88 小时找到解法,之后又用 Astra 花 17 小时完成 Lean 机器验证。论文和验证代码已经公开,但仍要接受数学界审查。 这项成果背后还有一场抢发争议。纽约大学数学家 Tristan Buckmaster 和 Anthropic 员工 Levent Alpöge 此前也借助 Claude、Codex 推进了同一方向的研究。Buckmaster 称,两人的未公开进展传到 OpenAI 后,OpenAI 几天内投入大量算力攻入同一路线,还曾提出由 Buckmaster 改写 OpenAI 的 Navier-Stokes 证明,但不让 Alpöge 署名。 OpenAI 现在承认,这场冲刺确实始于「Anthropic 可能解决了千禧年难题」的传闻。9 月 1 日,团队开始让新模型挑战多个数学难题,先用近 100 个 Agent 做出 Euler 结果,随后把资源集中到 Navier-Stokes,最终扩到约 1 万个 Agent。OpenAI 否认在 Buckmaster 公开论文前看过他的研究,也否认调用具体用户数据,但没有完全封死另一种可能:两人使用 OpenAI 产品产生的去标识化数据,可能曾被用于改进模型。 Sébastien Bubeck 也回应了署名和「毁掉职业生涯」的争议。他称,自己没有要求 Alpöge 放弃两人原有成果的署名;当时谈的是让 Buckmaster 主笔 OpenAI 的证明,他认为让 Anthropic 员工署名 OpenAI 的工作不合适。对于「为什么要毁掉自己的职业生涯」这句话,Bubeck 承认措辞糟糕并道歉,但否认是在威胁。Sam Altman 也公开站在 Bubeck 一边,并确认 OpenAI 当初就是听到 Anthropic 的传闻后,想看看自己的模型能不能做到。 OpenAI 表示不会领取这项难题对应的 100 万美元奖金。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-03 08:18

GPT-6 Astra即将发布:OpenAI官方仓库已出现GPT-6

动察 Beating AI 快讯,OpenAI 官方的 GitHub 仓库里,已经直接出现了 GPT-6。一名 OpenAI 开发者向 Computer Use 示例项目提交 PR,新增 gpt6-js-image 和 gpt6-py-image 两套环境,分支名也直接叫 codex/gpt6-computer-use-images。 这两套环境分别面向 JavaScript 和 Python。前者装好 Playwright 和 Chromium,后者则用 PyAutoGUI、Chromium 和 Linux 桌面环境,让 Agent 可以看屏幕、操作浏览器和桌面。PR 目前还没有合并,而且里面没有 GPT-6 的 API 调用,只是在准备 Computer Use 的运行环境。 Sam Altman 最近在采访中称,过去的模型操作电脑一直太慢或者不好用,但 Astra 让他第一次感觉「已经达到和人类差不多的水平」。他现在会直接让模型去不同应用里找消息,而不是自己一个个打开搜索。

09-11 08:50重要

OpenAI否认偷用数学家未公开研究:Codex草稿没影响Navier-Stokes证明

动察 Beating AI 快讯,OpenAI 最新回应了 Navier-Stokes 抢功争议,明确否认偷用了纽约大学数学家 Tristan Buckmaster 的未公开研究。公司调查后称,Buckmaster 过去两个月提交给 Codex 的 prompt,不可能以任何方式影响这套内部模型,包括通过训练。 Buckmaster 此前和 Levent Alpöge 一直在研究同一方向,大量草稿都放进了 Codex。两人的进展传到 OpenAI 后,OpenAI 几天内集中算力拿出了 Navier-Stokes 证明。Buckmaster 因此怀疑,自己的未公开研究是不是已经被模型学了进去。OpenAI 现在把这一点明确否认了。 OpenAI 还把时间边界划到了 7 月 3 日,此后的任何用户输入,都不可能影响这套系统。社区有人猜测,这一天可能对应某个训练数据截点或模型 checkpoint,但 OpenAI 没有解释。 Buckmaster 和 Alpöge 的关键突破发生在 8 月中旬,远远晚于 OpenAI 划出的 7 月 3 日边界。

09-07 11:04

OpenAI CEO:GPT-6 Astra让每个人拥有天才级员工,AI时代迎来「创意人士的复仇」

动察 Beating AI 快讯,据 AXIOS 报道,OpenAI 首席执行官 Sam Altman 表示,当前时代正迎来「创意人士」的复仇——那些曾经令人厌烦、空有创业想法却缺乏技术能力去实现的有志创业者。 这就像说「我有一个很好的歌曲创意,只需要那个拿吉他的人帮我做出来」一样。「我以前确实觉得这很可笑,」Altman 在北卡罗来纳州教堂山表示,「但现在我们看到整整一代人以前所未有的速度迭代创意。创办小型或大型企业的经济逻辑已经被重新定义。」 民调显示多数美国人认为 AI 风险大于收益,数据中心问题已成为中期选举中两党共同的争议焦点。正试图在强烈反对声中推广 AI 的 Altman 希望提醒美国人,在诸多现实风险之中,AI 也意味着机会。「这将是世界上创办初创公司最好的时代,」Altman 近期表示。 Altman 表示,借助 OpenAI 强大的新模型 GPT-6 Astra,你可以有效地创办和运营一家小企业……任何想拥有公司的人,现在在每个专业领域都拥有天才级的员工。

09-07 08:22

OpenAI更新GPT-6 Astra界面,补充模型性能及API定价等信息

Odaily星球日报讯 OpenAI 最新更新 GPT-6 Astra 产品页面,补充了模型性能、企业应用、安全能力及 API 定价等信息。Astra 在 ARC-AGI-3 取得 99.9%,FrontierMath Tier 4 约 97.6%,Terminal-Bench 4.0 达 57.9%,高于 GPT-5.6 Sol 的 37.3%,并略高于 Claude Fable 5.1 的 55.8%;专业任务 Agents’ Last Exam 得分 59.3%,也高于 Claude Opus 5 的 55.5%。 OpenAI 同时明确,Astra 未来数日将陆续开放给 Plus、Pro、Business 和 Enterprise 用户,并进入 API、Azure 和 AWS Bedrock。由此看,产品页此次更新很可能是在为更大范围开放做准备,但具体全面上线时间仍未公布。

09-05 02:34

GPT-6 Astra全量上线:OpenAI连送两次额度重置

动察 Beating AI 快讯,OpenAI 已将 GPT-6 Astra 向 Plus、Pro 和 Business 用户全量开放。昨天 Astra 还处在分批推送阶段,很多 Pro 用户也用不了;今天 Plus 和 Pro 用户都已经可以在 ChatGPT Work 和 Codex 中使用。核心产品负责人 Thibault Sottiaux 称,团队的系统扩展能力比预想更强,因此很快完成了这轮全量上线。 Astra 首发时只给少量企业客户。OpenAI 原本预计要用几天逐步开放。大量付费用户迟迟拿不到后,Sam Altman 还为这次「混乱的发布」道歉。现在团队称系统扩展能力比预想更好,因此提前把 Plus 也发完了。 原本承诺的补偿也照发。符合条件的现有 Plus、Pro 和 Business 用户,9 月 3 日和 4 日各能拿一次 banked reset。它相当于一张可以以后手动使用的 Codex 满额重置券,会刷新 5 小时和周额度。北京时间 9 月 5 日 11:00 前新开账号或升级套餐,也能拿到这次重置。 Plus 虽然能用 Astra,但额度不算宽裕。OpenAI 当前估算,Plus 每 5 小时大约可跑 5–45 条 Astra 本地消息,GPT-5.6 Sol 则是 10–100 条。实际消耗取决于任务长度、推理强度和工具调用。

09-04 07:36

GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%

动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。