ARC竞赛第一团队现身:Mostik给大小模型搭桥,省掉大模型生成成本
相关推荐
AI下一战不只卷大模型,ARC-AGI创作者看好整套Agent系统
据动察 Beating 监测,知名 AI 评测 ARC-AGI 的创作者 François Chollet 表示,今天的高性能 AI Agent,本质上已经是「模型 + 程序」组成的完整系统。大模型负责理解和判断,外层程序负责控制流程、调用工具和运行代码。 Chollet 把这种神经符号架构形容成「符号三明治」:程序驱动神经网络,神经网络再调用程序。他认为,大模型还会继续变强,但外层程序同样会越来越重要,复杂任务最终要靠两者配合完成。 更进一步,Chollet 预测,现在主要靠工程师手写的外层程序,未来也可能由 AI 自己学习和进化。未来 AI 比拼的可能不再只是模型,而是整套 Agent 系统。
ARC-AGI-4提前预告:下一代要测AI能不能自己搞发明
动察 Beating AI 快讯,非营利 AI 评测机构 ARC Prize 预告 ARC-AGI-4。下一代 benchmark 将重点测试「自主开放式创新」,看 AI 能不能自己探索、提出新想法,甚至做出新的发明和发现。 具体题目、评分方式和发布时间都还没公布。ARC Prize 只说,人类目前在开放式创新上仍明显领先 AI,这也是推动科学和技术进步最关键的能力之一。 这条预告还引用了 Dario Amodei 刚发布的 AI 减速文章。ARC Prize 强调,开源仍然是 AI 进步的基础,反对行业为了协调减速而减少开放、把前沿 AI 集中在少数机构手里。 ARC-AGI 一直被冠以全球最难 AGI 评测的称号。ARC-AGI-3 发布时,人类得分 100%,前沿 AI 只有 0.51%。最新 GPT-6 Astra 已经大幅追上,但在统一的 Standard harness 下也只有 62.7%;接入 OpenAI 自家的 Provider Adapter 后才冲到 99.9%。 ARC Prize 现在又准备把下一关推到「AI 能不能自己搞创新」。
微软收拢Agent研发:AI Frontiers从Research并入MAI
动察 Beating AI 快讯,微软把 AI Frontiers 从 Microsoft Research 调入 Mustafa Suleyman 领导的 Microsoft AI(MAI)。这支实验室 2023 年 10 月成立,主要研究小模型和 Agent。 AutoGen、FARA、Magentic-One、Magentic-UI、Phi 等项目都曾由这支团队参与开发。多 Agent 开源框架 AutoGen 后来与 AI 应用开发 SDK Semantic Kernel 一同汇入微软统一 Agent 开发框架 Microsoft Agent Framework。 AI Frontiers 接下来会继续做前沿 Agent 和模型研究。MAI 自己也在训练一系列模型,并组建了 Superintelligence 团队,目标是开发所谓「Humanist Superintelligence」。微软给它的定义是面向具体问题、保持在人类控制之下,并服务于人的高能力 AI。 AI Frontiers 原负责人 Ece Kamar 最近刚离开微软,结束 16 年任职。她把建立 AI Frontiers 称为自己微软生涯的亮点之一,目前还没有公布下一站。
前Yandex高管融资2600万美元,要把1000亿网页喂给AI Agent
动察 Beating AI 快讯,AI 搜索公司 Keenable 结束隐身,拿到 2600 万美元种子轮融资,由 Accel 领投、Conviction 参投。公司自建了超过 1000 亿篇网页的独立索引,Agent 可通过 API 或 MCP 搜索,并直接拿到整理后的网页正文。 创始人 Andrey Styskin 曾负责 Yandex 搜索和广告业务,后来又在 Amazon AGI 做 Web 基础设施。 Styskin 还宣布上线 Web Query Language(WQL)。简单说,它想让 Agent 不再一个个搜网页,而是直接把整个 Web 当数据库查。哪怕答案分散在不同网站,也能一次筛出来再拼到一起。可以把它理解成「给互联网加了一层类似 SQL 的查询接口」。Search API 和 WQL 免费开放到 9 月底。 Keenable 不是第一个做 Agent 搜索的。Exa 也自己维护约 1000 亿篇网页的索引。Keenable 现在一个直接优势是价格:每 1000 次搜索 4 美元,Exa 是 7 美元,便宜约 43%。
Grok视频Agent升到1.5:接入Image 2.0,多镜头连续性升级
动察 Beating AI 快讯,Grok Imagine 的视频创作 Agent 升级到 1.5 版。 这次容易和 6 月发布的 Grok Imagine Video 1.5 搞混。当时更新的是底层视频模型,现在更新的是 Agent 层。Grok Imagine Video 1.5 已于 6 月正式上线。 新版接入最新的 Image 2.0,重点提升生成质量、叙事和多镜头连续性。Grok 称,它更擅长把多个镜头连起来,让前后画面更连贯。目前已经上线 Grok 网页、iOS 和 Android。 Arena 的 Text-to-Video 榜单里,grok-imagine-video-1.5-agent 暂列第 5,得分 1491,高于 Seedance 2.5、Seedance 2.0 和 MiniMax H3。不过目前成绩仍是 Preliminary,排名还可能变化。
奥特曼闭门秀Astra:它将「真正发明新东西」,「这非常像AGI」
动察 Beating AI 快讯,OpenAI 最近办了一场 Astra 闭门预览,几十名重要客户的高管被请到旧金山新启用的 MB0 办公楼。Altman 刚从华盛顿回来,此前已经向美国官员闭门介绍过 Astra。门外则有人举牌要求「停止 AI 竞赛」,OpenAI 甚至推来一整面绿植墙,挡住玻璃门外的抗议者。 现场主要展示了两项能力。第一项是一道研究级数学题,16 个 AI Agent 自己把题目拆成多个子问题,分头求解、互相协调,最后拼出一个候选证明。 第二项是直接操作电脑。Astra 在多个常见桌面软件之间高速切换,自己创建和修改内容。Altman 说,看它以「超人级、非常快」的方式操作电脑,是 OpenAI 员工最近最震撼的体验之一。他说,Astra 将带来 persistent agents,也就是可以长时间持续工作的「虚拟同事」。 Astra 还达到了 OpenAI 内部的「AI 研究实习生」标准。给它一个实验想法,它能自己在 OpenAI 的代码库里实现、跑实验并返回结果;给它一篇论文,它能完成过去需要人类研究员花一周做的工作。 Altman 认为,Astra 更重要的能力是发现新知识。他当着这些客户的面说:「我预计,这会是第一个真正发明出有意义新东西的模型。」随后又补了一句:「这是非常像 AGI 的事情。」