加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源Blockbeats

谷歌让Agent学会「做梦」:复盘过去试错,下一轮自己少走弯路

动察 Beating AI 快讯,谷歌研究团队发布 Dream-RSI,让 AI Agent 做完一轮任务后,把过去的成功和失败拿来「做梦」。系统会保存每次尝试和结果,再利用这些旧记录推演不同做法,比如先试哪条路、什么时候放弃、要不要同时多试几个方案。因为结果以前已经跑过,这些推演不用重新执行任务。 系统会从中选出表现更好的做法,直接用到下一轮。新一轮又会留下更多成功和失败,再拿来「做梦」、继续改策略。这样一轮接一轮,就是论文所谓的「递归自我改进」。目前底层模型本身不会变化,真正被改进的是 Agent「下一步怎么做」的方法。 论文在算法、数学优化和 GPU kernel 等 8 个任务上测试了这套方法。以 Gemini 3.1 Pro 的一个算法任务为例,相比固定做法,Agent 调用从 550 次降到 317 次,同时最终找到的程序运行得更快。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-15 11:03

又一条RSI路线出现:模型参数不动,Agent靠Memory持续进化

动察 Beating AI 快讯,UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。 这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。 系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。 在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。 它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。

09-11 04:27

Cursor上线Projects:一个Agent当项目经理,下面管数千个Agent

动察 Beating AI 快讯,Cursor 上线 Projects,把一个 Agent 干活升级成了「Agent 管 Agent」。每个项目都有一个协调 Agent,它自己不写代码,只负责拆任务、制定计划,再把活分给数千个子 Agent 并行完成。 Project 会长期保存代码库、研究结果和用户偏好,几个月后也能接着干。任务默认跑在云端,电脑关掉也不会停;需要本机测试时,再自动拉起本地 Agent。它还能盯着 Slack 和 PR,自动修 CI,有新任务就自己开工,不用等人再发 prompt。 这其实是 Cursor 此前多 Agent 实验的正式产品化。今年 1 月,它已经展示过数百个 Agent 同时协作,甚至从零写出一个超过 100 万行代码的浏览器。现在 Projects 已进入 beta,正逐步向所有用户开放。

09-02 04:03

谷歌给Gemini加视频Agent:成本最高降66%

动察 Beating AI 快讯,谷歌给 Gemini API 上线 Agentic Video Understanding。它让模型自己决定看哪段视频、怎么检查。普通模式默认按 1 FPS 固定抽帧,再一次性放进上下文。新模式会自己沿时间轴找片段,并按问题选择画面、音频或转录文本。碰到快速动作,还能提高帧率重新检查。 Google 自测称,Gemini 3.7 Flash 开启后,Token 消耗最高下降 88%,分析成本最高下降 66%,准确率相对提升最高约 7%。它能定位不到 1 秒的瞬间,也能在几小时的视频里找一个细节。 技术上是把开发者以前要自己搭的「先定位、再精看」流程塞进 Gemini 内部。现在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 都支持。上传视频和 YouTube 视频都能用,也不另收功能费。之后还会接入 Gemini App 和 YouTube 的 Ask YouTube。

09-15 07:45

Pear Protocol:Agent Pear 金库拟于 9 月 16 日开放,首期上限 100 万美元

Foresight News 消息,多空交易协议 Pear Protocol 发推表示,其将本周推出 Agent Pear 金库。用户存入后由代理按已公开信号自动开平配对交易,首期规模上限 100 万美元,存款计划于 9 月 16 日开放。金库为 HyperEVM 上经审计的 ERC-4626 合约,交易由受限代理钱包执行,该钱包无法提现或转出资金。首期 100 万美元免除进出费,盈利部分收 20% 业绩费,且仅对超过历史最高净值的新增利润收取。

09-12 01:43

DeepMind突传实现RSI:三个大写字母点燃社区

动察 Beating AI 快讯,AI 社区突然疯传 Google DeepMind 已经实现 RSI。 RSI 即递归自我改进,被很多人视为通往超级智能最关键的一步。AI 可以自己改进训练方法、代码和模型,造出更强的下一代,再让下一代继续升级。真正跑通后,AI 研发可能进入自我加速循环。 起因是爆料账号 lyra 给 Google DeepMind 发了一句「huge congRatulationS Indeed!」,其中三个异常大写字母正好拼成 RSI。随后 Lentils 又贴出一张疑似内部模型列表,里面出现 rsi-model-liverl-le。他还声称 Google 内部有 10 个同系列训练模型槽位,但没有贴出对应截图。 传闻也未必是假的。路透社 8 月报道,谷歌联合创始人 Sergey Brin 已要求 DeepMind 加快 Gemini 研发,并重点推动递归自我改进。DeepMind 6 月的官方报告也把「recursive improvement」列为 AGI 走向 ASI 的四条潜在路径之一。

09-02 15:44

Google推出Gemini 3.8 Flash推理模型,今日起向Pro与Ultra用户开放

PANews 9月2日消息,Google Gemini 宣布其最新 Gemini 3.8 Flash 模型今日起向 Pro 与 Ultra 用户开放。官方称,该模型在日常话题行动建议、文本分析和复杂编码等任务中,将提供更可靠、更全面的回答,以增强高频使用场景下的实用性与执行效率。