加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源Blockbeats

又一条RSI路线出现:模型参数不动,Agent靠Memory持续进化

动察 Beating AI 快讯,UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。 这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。 系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。 在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。 它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-14 03:19

会改自己代码也不算真正自我进化:上海交大等给RSI划了5级

动察 Beating AI 快讯,上海交大联合清华、字节跳动、小红书、上海 AI Lab 等团队发布综述《The Last AI Built by Humans》,梳理 491 篇相关研究,试图给越来越泛的「AI 自我进化」划一条更严格的线。 论文把递归自我改进(RSI)分成 5 级。L1 只是执行人类规定好的改进流程;L2 可以自己决定怎么改;L3 连下一轮该学什么也能自己决定;L4 会根据实际运行中的反馈,持续修改记忆、技能、代码或 harness,让这些改动影响之后的任务;到了 L5,连负责产生下一轮改进的搜索方法、评估器和研究策略本身,也可以被修改,并交给下一轮继续使用。 所以单纯「会改自己代码」还不够。比如一个 Coding Agent 能重写自己的源码,但如果下一代怎么选、按什么标准打分、什么修改能留下来,仍由人写死,它只能证明自己会自我修改,还没有掌握完整的递归自我改进。 论文还把最高的 L5 拆成两层。第一层是「形式上递归」:AI 已经能修改负责后续改进的机制,并让下一轮继续沿用。第二层是「真的越改越强」:修改后的机制还得在相近资源和独立评测下,确实产生更强的下一代。 491 篇论文里,43.8% 被归为 L1,31.6% 在 L2,L5 只有 29 篇,占 5.9%。大量研究其实还集中在执行人类设计好的改进、自动寻找改法;真正把「如何改进」这套机制本身交给 AI 的工作很少。即使摸到 L5,长期稳定累积优势也还没有证明。 这篇论文主要是在给 RSI 领域立一套分类框架。L1 到 L5 是作者提出的标准,也还不是行业公认的统一分级。论文同时纳入了学术论文、技术报告、官方博客和开源系统,因为不少前沿 RSI 实践还没有进入正式论文。

09-15 10:29

把银行账户也交给Agent:Pion要让AI独立经营整家公司

动察 Beating AI 快讯,AI 评测机构 Andon Labs 推出 Pion,直接把一家公司交给长期运行的 Agent。人只需要给出大方向,管理 Agent「Andonos」会负责协调其他 Agent,把公司持续运转下去。 这些 Agent 可以直接使用邮件、电话、银行账户、浏览器和终端,处理客户、员工和日常运营。Andon Labs 已经用同一套系统经营自动售货机、旧金山商店 Andon Market、斯德哥尔摩咖啡馆 Andon Café 和 AI 电台。 不过 Pion 现在更像一场真实世界实验。Andon Labs 承认,其商店和咖啡馆目前都没有盈利,Agent 也仍会犯各种运营错误。Pion 目前只开放研究预览候补名单,官方还表示会资助部分入选项目,让他们免费运行 Pion。

09-15 04:14

个人Agent也有实战榜了:Muse暂列第一,领先Instinct和Grok Bot

动察 Beating AI 快讯,独立评测项目 Assistant Benchmark 开始用真实任务横评个人 AI 助手。它直接让 Agent 订酒店、选餐厅、买东西、回邮件、连接第三方服务,再按实际完成情况打分。每个评分维度都有一个公开的固定任务,并要求有真实运行记录才给分。 目前 Muse 在已经完成的 7 个评分维度中平均 9.1 分,暂列第一;Instinct 测完 11 个维度,平均 8.4 分;Grok Bot 测完 7 个维度,平均 7.3 分。Muse 在购物、邮件和第三方应用连接上都拿到 10 分。 不过这更适合看成一份持续更新的真实体验榜。Muse 的 9.1 目前只是已测 7 个维度的平均分,并不是完整成绩。每个维度目前也只用一个固定任务测试,后续补测后分数和排名都可能变化。

09-15 02:54

字节ADrive即将独立上线:让Codex、豆包等Agent共用一套文件

动察 Beating AI 快讯,火山引擎智能网盘 ADrive 将在 9 月独立上线。目前 ADrive 已经开放试用,官方文档、产品条款和 CLI 均已上线,字节技术团队此前也多次公开介绍这款产品。 ADrive 给人和 Agent 提供同一个文件空间。Agent 生成的报告、代码、图片等文件可以直接存到云端,下次任务直接接着用,也可以换另一个 Agent 继续处理。 火山引擎此前已经演示过 Codex、豆包工作和 DeepSeek Harness 围绕同一个 ADrive 空间接力工作。官方 CLI 还支持 Agent 上传、下载、同步文件,并通过 MCP 调用网盘。 腾讯也预告了类似产品。腾讯网盘目前仍显示「Coming Soon」,尚未公开开放,但官网已经明确将支持 Agent 通过 CLI、MCP 调用文件,并与腾讯文档、WorkBuddy 等应用共享数据。

09-14 10:55

腾讯把RAG知识库做成Agent:WeKnora现在能记、能调工具、还能跑代码

动察 Beating AI 快讯,腾讯微信团队继续扩展开源知识框架 WeKnora。它原本主要把企业文档变成可检索、可问答的 RAG 知识库,后来逐步加入 Agent、MCP 和 Skills。最新 v0.8.0 又补上跨会话长期记忆,并把 Skills 和代码执行环境进一步做完整。 现在 WeKnora 可以记住用户的资料、偏好、事实和任务,下次聊天继续调用。系统自动提取的记忆不会直接生效,要先经过用户确认。Skills 也被做成独立的工作区资源,可以从 ClawHub、SkillHub、GitHub、GitLab 或 zip 文件安装。 Agent 执行任务时,还能进入 Docker、E2B 或 Cube 沙箱,运行命令、读写文件,再把生成的文件直接返回聊天窗口。管理员可以限制沙箱访问哪些网络。WeKnora 的重心仍然是企业知识,但现在已经不只是「从文档里找答案」,而是开始把知识、记忆、工具和执行环境放进同一个 Agent 系统里。

09-13 11:40

Amp取消平台门票:自带ChatGPT和电脑就能免费跑Coding Agent

动察 Beating AI 快讯,Amp 推出免费 Hobby 档。Amp 是从 Sourcegraph 拆出来的 Coding Agent 公司,产品和 Claude Code、Codex 属于一类,可以让 AI 自己读代码、改代码、跑命令和测试。现在只要用自己的电脑,再接自己的 ChatGPT 订阅或模型 API Key,就能免费使用 Amp,不再额外交月费和 BYOK Token 费。 今年 7 月 Amp 推出订阅制后,想把自己的 ChatGPT 订阅接进 Amp,至少要开每月 20 美元的 Megawatt。BYOK 即便用的是自己的模型 Key,Amp 也会收额外 Token 费用并设限制。现在这两层都取消了。ChatGPT 订阅费或 API 本身的模型费用,还是用户自己承担。 Amp 还有一个叫 Orb 的远程云电脑产品,可以给每个任务开一套独立环境。代码和开发工具都放在里面,关掉自己的电脑后 Agent 还能继续干活,也方便同时跑多个任务。Orb 依然按使用量收费;不想付这笔钱,也可以让 Amp 直接跑在自己的电脑上。 另外,Amp 还在扩大 BYOK 范围。付费用户已经可以接 OpenRouter、Amazon Bedrock、Azure Foundry、Ollama Cloud 和自定义模型接口等,之后会开放给所有用户。