ARC-AGI-4提前预告:下一代要测AI能不能自己搞发明
相关推荐
视频|Dario Amodei:为安全推迟发布Claude六个月,亲手错过了「ChatGPT时刻」
Anthropic CEO Dario Amodei 在参加 CFR CEO Speaker Series 时表示,Anthropic 当年其实有机会抢在 ChatGPT 之前发布 Claude,但出于安全考虑,主动将发布时间推迟了大约 6 个月,也因此错过了「ChatGPT 时刻」。这个决定确实让 Anthropic 付出了商业上的代价,但也奠定了公司此后更重视安全的文化。
OpenAI发布GPT-6 Astra模型,称其或接近实现AGI
Odaily星球日报讯 OpenAI 周四开始发布新旗舰模型 GPT-6 Astra,并称其在金融建模、工程设计等商业任务领域取得重大进展。该模型初期仅向部分机构开放,包括参与 OpenAI Daybreak Access 网络安全项目的组织,随后将向 ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及通过 API 和亚马逊云服务使用的用户开放。OpenAI 表示,GPT-6 Astra 在计算机操作、软件编程、专业工作等方面取得显著提升,并在 FrontierMath Tier 1 数学测试、ARC-AGI 3 推理测试以及 ExploitBench 网络安全测试中达到最高水平。OpenAI 联合创始人兼总裁格雷格·布洛克曼表示,通用人工智能(AGI)的实现时间一直存在模糊性,但“几年后回看”,这一里程碑“可能就在这一时期、就在这个模型附近”。GPT-6 Astra 定价为每百万输入词元 10 美元、输出词元 50 美元,是此前旗舰模型 GPT-5.6 Sol 价格的 2.5 倍。OpenAI 表示,未来 AI 行业可能转向按任务而非按词元收费。布洛克曼在发布会上表示:“欢迎来到 AGI 时代。”(金十)
AI下一战不只卷大模型,ARC-AGI创作者看好整套Agent系统
据动察 Beating 监测,知名 AI 评测 ARC-AGI 的创作者 François Chollet 表示,今天的高性能 AI Agent,本质上已经是「模型 + 程序」组成的完整系统。大模型负责理解和判断,外层程序负责控制流程、调用工具和运行代码。 Chollet 把这种神经符号架构形容成「符号三明治」:程序驱动神经网络,神经网络再调用程序。他认为,大模型还会继续变强,但外层程序同样会越来越重要,复杂任务最终要靠两者配合完成。 更进一步,Chollet 预测,现在主要靠工程师手写的外层程序,未来也可能由 AI 自己学习和进化。未来 AI 比拼的可能不再只是模型,而是整套 Agent 系统。
黄仁勋称 GPT-6 Astra 由约 10 万块芯片训练,AGI 已到来
火星财经消息,英伟达 CEO 黄仁勋表示,GPT-6 Astra 由约 10 万多块英伟达 Grace Blackwell NVLink72 训练而成。从 ChatGPT 到 o1,再到 Astra,仅用了 4 年。AGI 已经到来。恭喜 OpenAI 团队。
黄仁勋盛赞GPT-6Astra:AGI已来
BlockBeats 消息,9 月 7 日,英伟达 CEO 黄仁勋于 X 平台发文表示,「OpenAI 新模型 GPT-6 Astra 由约 10 万多块英伟达 (NVDA.O)Grace Blackwell NVLink72 训练而成。从 ChatGPT 到 o1,再到 Astra,仅用了 4 年。AGI(通用人工智能)已经到来。恭喜 OpenAI 团队。」
ARC竞赛第一团队现身:Mostik给大小模型搭桥,省掉大模型生成成本
动察 Beating AI 快讯,ARC-AGI-3 Kaggle 竞赛暂列第一的 CSTL,就是刚刚公开的 AI 创业公司 Mostik,目前成绩 7.51%。团队共 15 人,包括 12 名博士和一位菲尔兹奖得主。不过比赛还没结束,第二次 Milestone 要到 9 月 30 日截榜,最终提交 11 月 2 日截止。 Mostik 做的是让不同 AI 模型直接交换内部状态。普通多 Agent 主要靠文字传话,它则在两个模型之间训练一个 bridge,把一个模型的 hidden states 转成另一个模型能理解的表示,两边模型本身都不用微调。 他们公开的实验用了 753B 的 GLM-5.2 和 4B 的 Qwen3.5,可以近似理解为大模型负责 prefill,小模型负责 decode。GLM-5.2 只读题,不生成 Token;内部状态直接交给 4B 小模型生成答案。Mostik 称,这样能把两者的性能差距缩小约一半;与达到相同准确率的中型单模型相比,计算量只有约 40%。不过最终效果仍然低于 753B 大模型本身。 Mostik 尚未公布 7.51% 的成绩到底用了什么模型和 Harness,上面的 753B+4B 只是另一组技术演示,不能当成夺榜配置。ARC-AGI-3 竞赛本身比的也是整套 Agent 系统,之前的阶段冠军只用了 Qwen 3.6 27B,却靠 Harness、工具和上下文管理拿到第一。 另一方面,这套技术要求读取模型 hidden states,Claude、GPT 这类云端模型目前用不了;Google DeepMind 工程师 Susan Zhang 也质疑,既然已经能控制模型内部状态,冻结两个模型再单独训练一座「桥」,是否真是最划算的工程方案。