返回 7*24 快讯
来源Blockbeats

ARC竞赛第一团队现身:Mostik给大小模型搭桥,省掉大模型生成成本

动察 Beating AI 快讯,ARC-AGI-3 Kaggle 竞赛暂列第一的 CSTL,就是刚刚公开的 AI 创业公司 Mostik,目前成绩 7.51%。团队共 15 人,包括 12 名博士和一位菲尔兹奖得主。不过比赛还没结束,第二次 Milestone 要到 9 月 30 日截榜,最终提交 11 月 2 日截止。 Mostik 做的是让不同 AI 模型直接交换内部状态。普通多 Agent 主要靠文字传话,它则在两个模型之间训练一个 bridge,把一个模型的 hidden states 转成另一个模型能理解的表示,两边模型本身都不用微调。 他们公开的实验用了 753B 的 GLM-5.2 和 4B 的 Qwen3.5,可以近似理解为大模型负责 prefill,小模型负责 decode。GLM-5.2 只读题,不生成 Token;内部状态直接交给 4B 小模型生成答案。Mostik 称,这样能把两者的性能差距缩小约一半;与达到相同准确率的中型单模型相比,计算量只有约 40%。不过最终效果仍然低于 753B 大模型本身。 Mostik 尚未公布 7.51% 的成绩到底用了什么模型和 Harness,上面的 753B+4B 只是另一组技术演示,不能当成夺榜配置。ARC-AGI-3 竞赛本身比的也是整套 Agent 系统,之前的阶段冠军只用了 Qwen 3.6 27B,却靠 Harness、工具和上下文管理拿到第一。 另一方面,这套技术要求读取模型 hidden states,Claude、GPT 这类云端模型目前用不了;Google DeepMind 工程师 Susan Zhang 也质疑,既然已经能控制模型内部状态,冻结两个模型再单独训练一座「桥」,是否真是最划算的工程方案。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-07 10:18

AI下一战不只卷大模型,ARC-AGI创作者看好整套Agent系统

据动察 Beating 监测,知名 AI 评测 ARC-AGI 的创作者 François Chollet 表示,今天的高性能 AI Agent,本质上已经是「模型 + 程序」组成的完整系统。大模型负责理解和判断,外层程序负责控制流程、调用工具和运行代码。 Chollet 把这种神经符号架构形容成「符号三明治」:程序驱动神经网络,神经网络再调用程序。他认为,大模型还会继续变强,但外层程序同样会越来越重要,复杂任务最终要靠两者配合完成。 更进一步,Chollet 预测,现在主要靠工程师手写的外层程序,未来也可能由 AI 自己学习和进化。未来 AI 比拼的可能不再只是模型,而是整套 Agent 系统。

09-13 02:57

ARC-AGI-4提前预告:下一代要测AI能不能自己搞发明

动察 Beating AI 快讯,非营利 AI 评测机构 ARC Prize 预告 ARC-AGI-4。下一代 benchmark 将重点测试「自主开放式创新」,看 AI 能不能自己探索、提出新想法,甚至做出新的发明和发现。 具体题目、评分方式和发布时间都还没公布。ARC Prize 只说,人类目前在开放式创新上仍明显领先 AI,这也是推动科学和技术进步最关键的能力之一。 这条预告还引用了 Dario Amodei 刚发布的 AI 减速文章。ARC Prize 强调,开源仍然是 AI 进步的基础,反对行业为了协调减速而减少开放、把前沿 AI 集中在少数机构手里。 ARC-AGI 一直被冠以全球最难 AGI 评测的称号。ARC-AGI-3 发布时,人类得分 100%,前沿 AI 只有 0.51%。最新 GPT-6 Astra 已经大幅追上,但在统一的 Standard harness 下也只有 62.7%;接入 OpenAI 自家的 Provider Adapter 后才冲到 99.9%。 ARC Prize 现在又准备把下一关推到「AI 能不能自己搞创新」。

09-03 08:07

微软收拢Agent研发:AI Frontiers从Research并入MAI

动察 Beating AI 快讯,微软把 AI Frontiers 从 Microsoft Research 调入 Mustafa Suleyman 领导的 Microsoft AI(MAI)。这支实验室 2023 年 10 月成立,主要研究小模型和 Agent。 AutoGen、FARA、Magentic-One、Magentic-UI、Phi 等项目都曾由这支团队参与开发。多 Agent 开源框架 AutoGen 后来与 AI 应用开发 SDK Semantic Kernel 一同汇入微软统一 Agent 开发框架 Microsoft Agent Framework。 AI Frontiers 接下来会继续做前沿 Agent 和模型研究。MAI 自己也在训练一系列模型,并组建了 Superintelligence 团队,目标是开发所谓「Humanist Superintelligence」。微软给它的定义是面向具体问题、保持在人类控制之下,并服务于人的高能力 AI。 AI Frontiers 原负责人 Ece Kamar 最近刚离开微软,结束 16 年任职。她把建立 AI Frontiers 称为自己微软生涯的亮点之一,目前还没有公布下一站。

08-26 11:15

前Yandex高管融资2600万美元,要把1000亿网页喂给AI Agent

动察 Beating AI 快讯,AI 搜索公司 Keenable 结束隐身,拿到 2600 万美元种子轮融资,由 Accel 领投、Conviction 参投。公司自建了超过 1000 亿篇网页的独立索引,Agent 可通过 API 或 MCP 搜索,并直接拿到整理后的网页正文。 创始人 Andrey Styskin 曾负责 Yandex 搜索和广告业务,后来又在 Amazon AGI 做 Web 基础设施。 Styskin 还宣布上线 Web Query Language(WQL)。简单说,它想让 Agent 不再一个个搜网页,而是直接把整个 Web 当数据库查。哪怕答案分散在不同网站,也能一次筛出来再拼到一起。可以把它理解成「给互联网加了一层类似 SQL 的查询接口」。Search API 和 WQL 免费开放到 9 月底。 Keenable 不是第一个做 Agent 搜索的。Exa 也自己维护约 1000 亿篇网页的索引。Keenable 现在一个直接优势是价格:每 1000 次搜索 4 美元,Exa 是 7 美元,便宜约 43%。

09-06 05:34

Grok视频Agent升到1.5:接入Image 2.0,多镜头连续性升级

动察 Beating AI 快讯,Grok Imagine 的视频创作 Agent 升级到 1.5 版。 这次容易和 6 月发布的 Grok Imagine Video 1.5 搞混。当时更新的是底层视频模型,现在更新的是 Agent 层。Grok Imagine Video 1.5 已于 6 月正式上线。 新版接入最新的 Image 2.0,重点提升生成质量、叙事和多镜头连续性。Grok 称,它更擅长把多个镜头连起来,让前后画面更连贯。目前已经上线 Grok 网页、iOS 和 Android。 Arena 的 Text-to-Video 榜单里,grok-imagine-video-1.5-agent 暂列第 5,得分 1491,高于 Seedance 2.5、Seedance 2.0 和 MiniMax H3。不过目前成绩仍是 Preliminary,排名还可能变化。

08-27 02:59

奥特曼闭门秀Astra:它将「真正发明新东西」,「这非常像AGI」

动察 Beating AI 快讯,OpenAI 最近办了一场 Astra 闭门预览,几十名重要客户的高管被请到旧金山新启用的 MB0 办公楼。Altman 刚从华盛顿回来,此前已经向美国官员闭门介绍过 Astra。门外则有人举牌要求「停止 AI 竞赛」,OpenAI 甚至推来一整面绿植墙,挡住玻璃门外的抗议者。 现场主要展示了两项能力。第一项是一道研究级数学题,16 个 AI Agent 自己把题目拆成多个子问题,分头求解、互相协调,最后拼出一个候选证明。 第二项是直接操作电脑。Astra 在多个常见桌面软件之间高速切换,自己创建和修改内容。Altman 说,看它以「超人级、非常快」的方式操作电脑,是 OpenAI 员工最近最震撼的体验之一。他说,Astra 将带来 persistent agents,也就是可以长时间持续工作的「虚拟同事」。 Astra 还达到了 OpenAI 内部的「AI 研究实习生」标准。给它一个实验想法,它能自己在 OpenAI 的代码库里实现、跑实验并返回结果;给它一篇论文,它能完成过去需要人类研究员花一周做的工作。 Altman 认为,Astra 更重要的能力是发现新知识。他当着这些客户的面说:「我预计,这会是第一个真正发明出有意义新东西的模型。」随后又补了一句:「这是非常像 AGI 的事情。」