谷歌让Agent学会「做梦」:复盘过去试错,下一轮自己少走弯路
相关推荐
又一条RSI路线出现:模型参数不动,Agent靠Memory持续进化
动察 Beating AI 快讯,UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。 这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。 系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。 在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。 它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。
Cursor上线Projects:一个Agent当项目经理,下面管数千个Agent
动察 Beating AI 快讯,Cursor 上线 Projects,把一个 Agent 干活升级成了「Agent 管 Agent」。每个项目都有一个协调 Agent,它自己不写代码,只负责拆任务、制定计划,再把活分给数千个子 Agent 并行完成。 Project 会长期保存代码库、研究结果和用户偏好,几个月后也能接着干。任务默认跑在云端,电脑关掉也不会停;需要本机测试时,再自动拉起本地 Agent。它还能盯着 Slack 和 PR,自动修 CI,有新任务就自己开工,不用等人再发 prompt。 这其实是 Cursor 此前多 Agent 实验的正式产品化。今年 1 月,它已经展示过数百个 Agent 同时协作,甚至从零写出一个超过 100 万行代码的浏览器。现在 Projects 已进入 beta,正逐步向所有用户开放。
谷歌给Gemini加视频Agent:成本最高降66%
动察 Beating AI 快讯,谷歌给 Gemini API 上线 Agentic Video Understanding。它让模型自己决定看哪段视频、怎么检查。普通模式默认按 1 FPS 固定抽帧,再一次性放进上下文。新模式会自己沿时间轴找片段,并按问题选择画面、音频或转录文本。碰到快速动作,还能提高帧率重新检查。 Google 自测称,Gemini 3.7 Flash 开启后,Token 消耗最高下降 88%,分析成本最高下降 66%,准确率相对提升最高约 7%。它能定位不到 1 秒的瞬间,也能在几小时的视频里找一个细节。 技术上是把开发者以前要自己搭的「先定位、再精看」流程塞进 Gemini 内部。现在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 都支持。上传视频和 YouTube 视频都能用,也不另收功能费。之后还会接入 Gemini App 和 YouTube 的 Ask YouTube。
Pear Protocol:Agent Pear 金库拟于 9 月 16 日开放,首期上限 100 万美元
Foresight News 消息,多空交易协议 Pear Protocol 发推表示,其将本周推出 Agent Pear 金库。用户存入后由代理按已公开信号自动开平配对交易,首期规模上限 100 万美元,存款计划于 9 月 16 日开放。金库为 HyperEVM 上经审计的 ERC-4626 合约,交易由受限代理钱包执行,该钱包无法提现或转出资金。首期 100 万美元免除进出费,盈利部分收 20% 业绩费,且仅对超过历史最高净值的新增利润收取。
DeepMind突传实现RSI:三个大写字母点燃社区
动察 Beating AI 快讯,AI 社区突然疯传 Google DeepMind 已经实现 RSI。 RSI 即递归自我改进,被很多人视为通往超级智能最关键的一步。AI 可以自己改进训练方法、代码和模型,造出更强的下一代,再让下一代继续升级。真正跑通后,AI 研发可能进入自我加速循环。 起因是爆料账号 lyra 给 Google DeepMind 发了一句「huge congRatulationS Indeed!」,其中三个异常大写字母正好拼成 RSI。随后 Lentils 又贴出一张疑似内部模型列表,里面出现 rsi-model-liverl-le。他还声称 Google 内部有 10 个同系列训练模型槽位,但没有贴出对应截图。 传闻也未必是假的。路透社 8 月报道,谷歌联合创始人 Sergey Brin 已要求 DeepMind 加快 Gemini 研发,并重点推动递归自我改进。DeepMind 6 月的官方报告也把「recursive improvement」列为 AGI 走向 ASI 的四条潜在路径之一。
Google推出Gemini 3.8 Flash推理模型,今日起向Pro与Ultra用户开放
PANews 9月2日消息,Google Gemini 宣布其最新 Gemini 3.8 Flash 模型今日起向 Pro 与 Ultra 用户开放。官方称,该模型在日常话题行动建议、文本分析和复杂编码等任务中,将提供更可靠、更全面的回答,以增强高频使用场景下的实用性与执行效率。