OpenScience自测75.7%超过Codex:科研Agent开始自己循环跑实验
相关推荐
字节ADrive即将独立上线:让Codex、豆包等Agent共用一套文件
动察 Beating AI 快讯,火山引擎智能网盘 ADrive 将在 9 月独立上线。目前 ADrive 已经开放试用,官方文档、产品条款和 CLI 均已上线,字节技术团队此前也多次公开介绍这款产品。 ADrive 给人和 Agent 提供同一个文件空间。Agent 生成的报告、代码、图片等文件可以直接存到云端,下次任务直接接着用,也可以换另一个 Agent 继续处理。 火山引擎此前已经演示过 Codex、豆包工作和 DeepSeek Harness 围绕同一个 ADrive 空间接力工作。官方 CLI 还支持 Agent 上传、下载、同步文件,并通过 MCP 调用网盘。 腾讯也预告了类似产品。腾讯网盘目前仍显示「Coming Soon」,尚未公开开放,但官网已经明确将支持 Agent 通过 CLI、MCP 调用文件,并与腾讯文档、WorkBuddy 等应用共享数据。
LoopX升到1.0:一个页面管Codex、Claude Code等Agent长任务
动察 Beating AI 快讯,开源项目 LoopX 发布 1.0。它装在 Codex、Claude Code、Cursor 等 Agent 上层,把原本分散在不同会话里的长期任务统一收进一个工作台。 用户可以在一个页面看到所有已接入 LoopX 的任务。哪些正在执行、哪些等你确认、哪些在持续监控、哪些已经排期,都会集中显示。进入单个项目后,还能继续查看不同 Agent 的待办、完成记录、文件和运行状态。 这个工作台可以直接在浏览器打开,也提供 macOS 和 Windows 桌面版。两种入口共用同一套本地服务和任务状态。它不会自动读取电脑上所有 Agent,会显示的是已经注册并接入 LoopX 的 Agent 和任务。 多个 Agent 也可以一起完成同一个目标。它们能分别认领任务、并行工作和相互接力。比如一个 Agent 做完后留下后续任务,下一个 Agent 再接着做。这里的协作靠共享任务和状态完成,并不是让多个 Agent 在一个聊天室里自由对话。
Codex多Agent补上Luna:Sol当主管,便宜模型批量干活
据动察 Beating 监测,OpenAI 给 Codex 的多 Agent 功能补上了一个实用能力:Sol 现在可以直接把任务派给 Luna。 比如让能力最强的 Sol 负责拆任务和最后检查,再让多个更快、更便宜的 Luna 并行干活。 此前 Codex 已经支持一个 Agent 调用多个子 Agent,也能让不同模型分工。但 Luna 有特殊限制,只能自己执行任务,不能被 Sol 这类上层 Agent 直接拉进团队。这次 OpenAI 把这个限制解除了。 OpenAI 现在也明确推荐这种分工。Sol 适合复杂、开放式任务,Luna 则适合搜索、整理、提取、分类等明确又重复的工作。一个负责动脑和验收,一群负责批量执行。
Jevgrep让Coding Agent少自己找代码:SWE-bench主模型成本降29%
动察 Beating AI 快讯,开发者 David 基于 Jev 开源了一个专门给 Coding Agent 找代码的研究工具 Jevgrep。 用户只要问一句「登录校验写在哪里」,它就会用 TypeSafe 的决策模型 Jev 逐层搜索代码库,找出相关文件和源码片段,再交给 Claude Code、Codex 等 Agent 继续修改和测试。 它主要解决 Coding Agent 很费 token 的「找代码」环节。Jevgrep 不会先把整个仓库塞给模型,也不是只做一次语义搜索。它会先判断哪些目录值得继续找,再检查相关文件和代码声明,最后返回源码片段、行号和后续阅读线索。仓库还提供了 Skill,让 Agent 知道什么时候调用 `jg` 收集上下文。 最新 SWE-bench 实验用了 10 个 Python 任务。使用 Jevgrep 和不用 Jevgrep 都完成了 8 个,但 GPT-5.6 Sol 的总成本从 7.62 美元降到 5.44 美元,减少 28.63%。作者最初在 X 上写的是 40%,仓库随后更新实验结果,目前已经改成「约 30%」。 不过,这个数字只统计 Sol 的费用,没有把 Jev 算进去。实验日志中能够确认的 Jev 调用费用已经至少有 1.57 美元,部分调用缺少完整计费记录,实际总额未知。此外,这组实验只有 10 个任务,而且每题只跑了一次。
美团LongCat-2.5预览版上线:原生多模态,主攻长程Agent
动察 Beating AI 快讯,美团上线 LongCat-2.5-Preview。模型延续 LongCat-2.0 的 1.6T 总参数、约 48B 激活参数和 1M token 上下文,但加入了原生多模态能力,开始面向终端、浏览器、桌面软件、电子表格和设计工具等场景执行长流程任务。 LongCat-2.5-Preview 已接入官方 API,同时兼容 OpenAI 和 Anthropic 接口,最大输出长度为 128K tokens。官方还给出了 Codex、OpenCode、OpenClaw 和 CatPaw 的接入方法,现有 Agent 工具可以直接调用。 美团同时给所有老用户发放 500 万免费 tokens,用于体验新模型,原有 token 套餐也能继续使用。不过官方目前还没有公布 LongCat-2.5 的 benchmark,GUI 操作和长流程任务到底提升了多少,暂时没有公开数据可对比。
Ando融资2000万美元:重做Slack,让Agent直接当同事
动察 Beating AI 快讯,Ando 结束隐身并融资 2000 万美元,要从头做一个给人和 AI Agent 共用的「新 Slack」。本轮资金来自 Accel、Index Ventures 和 Emergence。 Ando 仍然有频道、私信、群聊和语音通话,但 Agent 有自己的身份、权限和收件箱。它们可以自己浏览和加入频道,不需要人类每次 @ 才工作,也可以主动找其他同事沟通。Codex、Claude、Grokbot、Devin 等不同 Agent 都能接入,没有现成 Agent 的团队也可以直接使用 Ando 托管的版本。 Ando 自己已经完全停用 Slack。比如有人在聊天里报 Bug 后,Agent 可以自己接单、把移动端任务转给另一个 Agent,再由第三个 Agent 审查代码;不同频道同时讨论同一个问题时,Agent 也能主动把相关人员拉到一起,并补齐上下文。 目前已有软件、房地产和金融等行业的团队在 15 个国家使用 Ando。