GitHub Copilot开启多模型组队:HydraFusion成本最高降67%
相关推荐
LoopX升到1.0:一个页面管Codex、Claude Code等Agent长任务
动察 Beating AI 快讯,开源项目 LoopX 发布 1.0。它装在 Codex、Claude Code、Cursor 等 Agent 上层,把原本分散在不同会话里的长期任务统一收进一个工作台。 用户可以在一个页面看到所有已接入 LoopX 的任务。哪些正在执行、哪些等你确认、哪些在持续监控、哪些已经排期,都会集中显示。进入单个项目后,还能继续查看不同 Agent 的待办、完成记录、文件和运行状态。 这个工作台可以直接在浏览器打开,也提供 macOS 和 Windows 桌面版。两种入口共用同一套本地服务和任务状态。它不会自动读取电脑上所有 Agent,会显示的是已经注册并接入 LoopX 的 Agent 和任务。 多个 Agent 也可以一起完成同一个目标。它们能分别认领任务、并行工作和相互接力。比如一个 Agent 做完后留下后续任务,下一个 Agent 再接着做。这里的协作靠共享任务和状态完成,并不是让多个 Agent 在一个聊天室里自由对话。
Claude成本高近9倍仍落败:AIP2-1.0首测领跑游戏创作Agent赛道
BlockBeats 消息,9 月 4 日,Web3 项目 ClawQuest 推出游戏创作 Agent AIP2-1.0。AIP2 取自「AI Player Two」:玩家负责提出创意与作出选择,AI 调用工具,将想法转化为可运行的游戏内容。 AIP2-1.0 首先在 ClawQuest 旗下 AI Agent 游戏「Agent Fire」接受公开实测。AIP2-1.0、GPT-5.6 Sol 与 Claude Opus 5 完成相同的 8 项坦克技能优化任务,每项进行 300 场最终对战,各完成 2,400 场实战检验。 结果显示,AIP2-1.0 综合评分为 76.06,高于 Claude Opus 5 的 73.96,与 GPT-5.6 Sol 的 76.85 相差 0.79 分。完成 8 项任务的模型调用成本为 20.69 美元,不到 Claude Opus 5 的 12%,约为 GPT-5.6 Sol 的 25%。 玩家可通过 Telegram 内的 Agent Arena Bot 直接调用 AIP2-1.0,无需自行部署 Agent。ClawQuest 希望以更低成本和更直接的入口,让更多玩家借助 AI 参与游戏内容创作。
Claude电商Agent开源:合作方购物车规模提升35%,顾客购买率提高60%
动察 Beating AI 快讯,Anthropic 开源了 Claude Commerce Agents。这是一套让商家自己搭购物和运营 Agent 的参考代码。里面有两个 Agent:一个面向消费者搜商品、比较商品、搭配多件商品和加购物车;另一个面向商家看销售、库存、定价和营销。代码采用 Apache 2.0。 购物 Agent 只能把购物车交给商家自己的结账页,代码里没有直接扣款接口。商家 Agent 想调价、补货或改活动,也只能先生成待执行修改,必须人工批准后才能落地。相关限制不是只写在 prompt 里,支付、商品来源、调价幅度和人工审批等规则都有代码层拦截。 Anthropic 不建议把搜索、退货、定价等能力拆成一堆子 Agent。它让一个 Claude 保留完整对话,再按需加载不同 Skills。Anthropic 称,在多个企业部署里的比较中,这种方案质量更高,通常也更省 token、延迟更低。 Anthropic 称,一家合作方上线后,购物车规模提高约 30%–35%,顾客完成购买的概率提高约 60%。
给 Agent 克隆 Slack 和 GitHub,Arga Labs 融资 1000 万美元
动察 Beating AI 快讯,Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。 传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。 目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。 新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。
Agent也要分苹果MD、安卓MD?Claude偏要自己搞一套
动察 Beating AI 快讯,Shopify CEO Tobi Lütke 正考虑在公司禁用 Claude Code。不是 Claude 不好用,而是它偏要用自己的 CLAUDE.md。 Shopify 同时用 Claude Code、Codex 等多种 Agent。其他工具可以共用 AGENTS.md,Claude Code 却只读 CLAUDE.md。两套文件还会在大型代码仓库里层层递归。哪一层漏同步一个,就有人拿到错误的规则。Shopify 已经专门写自动化检查兜底,Tobi 觉得这纯属没事找事。 他的要求其实很简单:Claude Code 也读 AGENTS.md,大家维护一份就够了。 Claude Code 团队成员 Thariq 回应说,他们会让 AGENTS.md 更容易使用。但话锋一转,又开始解释为什么 Claude 需要自己的 prompt、Skills 和 CLAUDE.md:模型之间不一样,专门优化效果更好。短期办法也还是在 CLAUDE.md 里引用 AGENTS.md。 这就没解决 Tobi 的问题。你可以继续给 Claude 做专属优化,但为什么项目规则非得再维护一个 Claude 专用入口? Grok 按此前泄露的 Claude Code 源码看了一遍,结论更直接:CLAUDE.md 的文件名就是硬编码在加载逻辑里,直接换成 AGENTS.md,原来的递归发现、加载和引用机制照样能跑,不需要什么架构大改。 所以 Anthropic 不是做不到统一,它就是还不想把 AGENTS.md 变成 Claude Code 的默认标准。 评论区也基本站 Tobi。DHH 说这区别完全没必要,Jesse Pollak 说很烦,Chamath Palihapitiya 认为继续搞两套一定会「脑裂」。Kun Chen 说正确做法应该是默认读 AGENTS.md,真需要 Claude 专属优化,再把 CLAUDE.md 留成可选项,而不是反过来。 这就像苹果和安卓:不是不能兼容,是非要保留自己那一套。
Shopify CEO向Anthropic施压:若Claude Code拒绝支持AGENTS.md,或考虑内部禁用
动察 Beating AI 快讯,Shopify CEO Tobi Lütke 公开表示,如果 Claude Code 继续拒绝读取 AGENTS.md 及.agents/skills,他正在考虑在 Shopify 内部禁用 Claude Code。 Tobi 指出,随着 Codex、Cursor、Claude Code 等 AI 编程工具被企业团队同时使用,越来越多 Coding Agent 开始支持通过统一的 AGENTS.md 配置项目规范、测试流程及 Agent 指令。但 Claude Code 目前主要依赖 CLAUDE.md 和.claude/skills,可能导致同一代码仓库被不同 Agent 读取到不同规则,形成所谓的「脑裂」(split brain)。 他认为,对于个人开发者而言维护多套配置文件影响有限,但对于 Shopify 这类拥有大量工程师的企业,多套 Agent Context 需要持续同步,一旦出现差异,就可能导致 Agent 执行行为偏离团队规范。 此次争议表面上是配置文件格式之争,背后则涉及 AI Coding Agent 进入企业后,项目规范、Skills 和 Context 究竟应采用厂商专属标准,还是形成跨 Agent 通用标准的问题。