返回 7*24 快讯
来源MarsBit

字节OpenViking核心贡献者开源LoopX:让Agent连续跑200小时也不失忆、不跑偏

据动察 Beating 监测,字节跳动 AML 高级机器学习工程师、OpenViking 核心贡献者黄瑞腾开源了 LoopX。它是一套面向长程 Agent 的控制系统,让 Codex、Claude Code 等 Agent 在任务跨越多天、多次中断后,仍能接着原来的目标往下做。 LoopX 已公开两条跨越 220.7 和 272.9 小时的真实任务轨迹。期间经历多轮执行、等待、人工判断、模型切换和任务恢复,Agent 仍能找回当前目标、已有证据和下一步。 它把目标、待办、权限、证据和等待条件放到模型上下文之外。Agent 每次只做一小步,验证结果后再写回状态。换会话、换模型或程序重启,都能从最新进度继续。 黄瑞腾参与开发的 OpenViking 负责保存和检索 Agent 的记忆、资料与技能;LoopX 则管理任务做到哪里、下一步做什么、何时需要人来判断。前者像长期记忆,后者更像项目经理和可执行看板。目前,LoopX 已用于自动修复代码问题、AutoML 实验和长期研究。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-11 17:03

Spotify把Claude、Gemini和Codex塞进一个总控台,1300名工程师已在用

据动察 Beating 监测,Spotify 推出 AI 编程工具 Xirp。它把 Claude Code、Gemini CLI 和 Codex 接进同一个工作台,可以同时跑多个 Agent。中途换工具,项目上下文也能直接带过去。 Spotify 已经用 Xirp 跑了超过 3.6 万次 Agent 会话。官方称已有 1300 多名 Spotify 工程师使用。Xirp 可以同时协调 50 多个会话,每个任务单独放进一个 Git worktree,多个 Agent 能在同一代码库并行干活,互不干扰。 更核心的是「团队记忆」。接上 Spotify Portal 后,Agent 能直接读取服务架构、依赖关系、负责人和历史架构决策。一次会话积累的上下文也会存回 Portal,其他工程师或 Agent 可以接着做。 Xirp 更像一个 Coding Agent「总控台」。Spotify 不押注某一家模型,而是让 Claude、Gemini、Codex 随时可换。Spotify 此前已经把内部开发平台 Backstage 开源,又推出了商业版 Portal;现在 Xirp 再把多 Agent 调度接了进来。

08-01 14:54

Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍

据动察 Beating 监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。 Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。 按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。 Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。

07-29 18:04

阿里Qoder开源AI编程体检工具,Claude Code和Codex也能用

据动察 Beating 监测,阿里云旗下 AI 编程工具 Qoder 开源 Better Harness,并采用 MIT 许可证。它会检查一个代码项目有没有给 Coding Agent 准备好规则、工具和验证流程。 检查范围包括代码仓库、Agent 配置和真实任务记录。它会看项目能否正常启动,测试命令是否清楚,Agent 有没有权限限制,改完代码后是否真的跑了相关测试。 检查结束后,它会列出 Agent 容易出错的环节。每个问题都有证据、影响、修复范围和复验方法。用户可以直接让 Agent 修改,再重新检查。 Better Harness 已支持 Qoder、Claude Code、Codex、Cursor 和 Qwen Code。各平台能力还没有完全拉齐,Qoder 当前最完整。 Qoder 还用它检查了 Better Harness 自己的代码仓库,最终得到 58 分。这也说明它仍处于早期阶段,开源后还在快速修补问题。

07-22 11:09

Claude跟进Codex,录一遍屏就能生成可复用Skill

据动察 Beating 监测,Anthropic 给办公 Agent Claude Cowork 加入「Record a skill」。用户做一遍任务,并同步口述过程。Claude 会记录屏幕、点击、键盘输入和语音。系统随后把演示转成 Skill(可重复调用的工作流程)。下次遇到同类工作,可以直接运行,不用重新写步骤。 过去创建 Claude Skill,通常要手动编写 SKILL.md,再整理脚本、资料和模板。现在只需做给 Claude 看,非技术用户制作自动化流程的门槛明显降低。 不过 Claude 并非第一个。OpenAI 6 月 18 日已为 Codex 推出同类的 Record & Replay。两边连入口都叫「Record a skill」。 Claude 版本目前开放给 Pro、Max 和 Team 套餐,入口在桌面 App 的 Cowork「+」菜单。

08-16 14:40

Codex多Agent补上Luna:Sol当主管,便宜模型批量干活

据动察 Beating 监测,OpenAI 给 Codex 的多 Agent 功能补上了一个实用能力:Sol 现在可以直接把任务派给 Luna。 比如让能力最强的 Sol 负责拆任务和最后检查,再让多个更快、更便宜的 Luna 并行干活。 此前 Codex 已经支持一个 Agent 调用多个子 Agent,也能让不同模型分工。但 Luna 有特殊限制,只能自己执行任务,不能被 Sol 这类上层 Agent 直接拉进团队。这次 OpenAI 把这个限制解除了。 OpenAI 现在也明确推荐这种分工。Sol 适合复杂、开放式任务,Luna 则适合搜索、整理、提取、分类等明确又重复的工作。一个负责动脑和验收,一群负责批量执行。

07-15 08:44

甲骨文发布AI原生代理应用开发平台,支持Codex与Claude Code接入

火星财经消息 7月15日消息,甲骨文当地时间7月14日宣布,为Oracle AI Agent Studio for Fusion Applications推出全新AI原生开发体验,允许客户和合作伙伴在Oracle Fusion云应用中构建并运行“Fusion Agentic Applications(代理式应用)”。新平台同时支持无代码、低代码和专业代码开发,并新增AI Studio Skill,开发者可使用Visual Studio Code、命令行工具、Git,以及OpenAI Codex、Claude Code等AI编程助手进行开发。(广角观察)