返回 7*24 快讯
来源Blockbeats

GitHub Copilot开启多模型组队:HydraFusion成本最高降67%

动察 Beating AI 快讯,GitHub 给 Copilot 加了一个多模型编排系统 HydraFusion。它先判断任务该怎么做,再调用不同模型。 目前有三种方式:简单任务交给一个模型直接完成;复杂任务先让成本更低的模型尝试,结果不过关再升级到更强模型;需要复核时,则让一个模型先做,另一个不同家族的模型专门挑错,再让第一个模型修改。 GitHub 在三个编程 Agent 基准上拿它和 Claude Opus 5 对比。TerminalBench 2.1 高出 4.9 个百分点,DeepSWE 低 1.5 个百分点,CheckpointBench 只低 0.1 个百分点,基本持平;成本则分别降低 67%、36% 和 65%。 这个思路很像 Sakana AI 的 Fugu。两者都是把「选哪个模型」进一步变成「怎么组织多个模型」。区别是 Fugu 本身就是一个训练出来的指挥模型,会学习怎么调用不同 Agent,甚至能递归调用自己;HydraFusion 目前仍然是在 Single、Cascade、Critique 三种固定执行模式里选择,更像把多模型调度直接塞进 Copilot。 HydraFusion 已向所有 GitHub Copilot 套餐开放研究预览,目前需要在 Copilot CLI 的实验功能中开启。GitHub 也提醒,现阶段最适合一次说清楚的单轮编程任务,多轮长任务还在继续优化。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-07 05:07

LoopX升到1.0:一个页面管Codex、Claude Code等Agent长任务

动察 Beating AI 快讯,开源项目 LoopX 发布 1.0。它装在 Codex、Claude Code、Cursor 等 Agent 上层,把原本分散在不同会话里的长期任务统一收进一个工作台。 用户可以在一个页面看到所有已接入 LoopX 的任务。哪些正在执行、哪些等你确认、哪些在持续监控、哪些已经排期,都会集中显示。进入单个项目后,还能继续查看不同 Agent 的待办、完成记录、文件和运行状态。 这个工作台可以直接在浏览器打开,也提供 macOS 和 Windows 桌面版。两种入口共用同一套本地服务和任务状态。它不会自动读取电脑上所有 Agent,会显示的是已经注册并接入 LoopX 的 Agent 和任务。 多个 Agent 也可以一起完成同一个目标。它们能分别认领任务、并行工作和相互接力。比如一个 Agent 做完后留下后续任务,下一个 Agent 再接着做。这里的协作靠共享任务和状态完成,并不是让多个 Agent 在一个聊天室里自由对话。

09-04 11:00

Claude成本高近9倍仍落败:AIP2-1.0首测领跑游戏创作Agent赛道

BlockBeats 消息,9 月 4 日,Web3 项目 ClawQuest 推出游戏创作 Agent AIP2-1.0。AIP2 取自「AI Player Two」:玩家负责提出创意与作出选择,AI 调用工具,将想法转化为可运行的游戏内容。 AIP2-1.0 首先在 ClawQuest 旗下 AI Agent 游戏「Agent Fire」接受公开实测。AIP2-1.0、GPT-5.6 Sol 与 Claude Opus 5 完成相同的 8 项坦克技能优化任务,每项进行 300 场最终对战,各完成 2,400 场实战检验。 结果显示,AIP2-1.0 综合评分为 76.06,高于 Claude Opus 5 的 73.96,与 GPT-5.6 Sol 的 76.85 相差 0.79 分。完成 8 项任务的模型调用成本为 20.69 美元,不到 Claude Opus 5 的 12%,约为 GPT-5.6 Sol 的 25%。 玩家可通过 Telegram 内的 Agent Arena Bot 直接调用 AIP2-1.0,无需自行部署 Agent。ClawQuest 希望以更低成本和更直接的入口,让更多玩家借助 AI 参与游戏内容创作。

09-03 09:50

Claude电商Agent开源:合作方购物车规模提升35%,顾客购买率提高60%

动察 Beating AI 快讯,Anthropic 开源了 Claude Commerce Agents。这是一套让商家自己搭购物和运营 Agent 的参考代码。里面有两个 Agent:一个面向消费者搜商品、比较商品、搭配多件商品和加购物车;另一个面向商家看销售、库存、定价和营销。代码采用 Apache 2.0。 购物 Agent 只能把购物车交给商家自己的结账页,代码里没有直接扣款接口。商家 Agent 想调价、补货或改活动,也只能先生成待执行修改,必须人工批准后才能落地。相关限制不是只写在 prompt 里,支付、商品来源、调价幅度和人工审批等规则都有代码层拦截。 Anthropic 不建议把搜索、退货、定价等能力拆成一堆子 Agent。它让一个 Claude 保留完整对话,再按需加载不同 Skills。Anthropic 称,在多个企业部署里的比较中,这种方案质量更高,通常也更省 token、延迟更低。 Anthropic 称,一家合作方上线后,购物车规模提高约 30%–35%,顾客完成购买的概率提高约 60%。

08-27 11:03

给 Agent 克隆 Slack 和 GitHub,Arga Labs 融资 1000 万美元

动察 Beating AI 快讯,Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。 传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。 目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。 新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。

08-26 05:06

Agent也要分苹果MD、安卓MD?Claude偏要自己搞一套

动察 Beating AI 快讯,Shopify CEO Tobi Lütke 正考虑在公司禁用 Claude Code。不是 Claude 不好用,而是它偏要用自己的 CLAUDE.md。 Shopify 同时用 Claude Code、Codex 等多种 Agent。其他工具可以共用 AGENTS.md,Claude Code 却只读 CLAUDE.md。两套文件还会在大型代码仓库里层层递归。哪一层漏同步一个,就有人拿到错误的规则。Shopify 已经专门写自动化检查兜底,Tobi 觉得这纯属没事找事。 他的要求其实很简单:Claude Code 也读 AGENTS.md,大家维护一份就够了。 Claude Code 团队成员 Thariq 回应说,他们会让 AGENTS.md 更容易使用。但话锋一转,又开始解释为什么 Claude 需要自己的 prompt、Skills 和 CLAUDE.md:模型之间不一样,专门优化效果更好。短期办法也还是在 CLAUDE.md 里引用 AGENTS.md。 这就没解决 Tobi 的问题。你可以继续给 Claude 做专属优化,但为什么项目规则非得再维护一个 Claude 专用入口? Grok 按此前泄露的 Claude Code 源码看了一遍,结论更直接:CLAUDE.md 的文件名就是硬编码在加载逻辑里,直接换成 AGENTS.md,原来的递归发现、加载和引用机制照样能跑,不需要什么架构大改。 所以 Anthropic 不是做不到统一,它就是还不想把 AGENTS.md 变成 Claude Code 的默认标准。 评论区也基本站 Tobi。DHH 说这区别完全没必要,Jesse Pollak 说很烦,Chamath Palihapitiya 认为继续搞两套一定会「脑裂」。Kun Chen 说正确做法应该是默认读 AGENTS.md,真需要 Claude 专属优化,再把 CLAUDE.md 留成可选项,而不是反过来。 这就像苹果和安卓:不是不能兼容,是非要保留自己那一套。

08-25 16:39

Shopify CEO向Anthropic施压:若Claude Code拒绝支持AGENTS.md,或考虑内部禁用

动察 Beating AI 快讯,Shopify CEO Tobi Lütke 公开表示,如果 Claude Code 继续拒绝读取 AGENTS.md 及.agents/skills,他正在考虑在 Shopify 内部禁用 Claude Code。 Tobi 指出,随着 Codex、Cursor、Claude Code 等 AI 编程工具被企业团队同时使用,越来越多 Coding Agent 开始支持通过统一的 AGENTS.md 配置项目规范、测试流程及 Agent 指令。但 Claude Code 目前主要依赖 CLAUDE.md 和.claude/skills,可能导致同一代码仓库被不同 Agent 读取到不同规则,形成所谓的「脑裂」(split brain)。 他认为,对于个人开发者而言维护多套配置文件影响有限,但对于 Shopify 这类拥有大量工程师的企业,多套 Agent Context 需要持续同步,一旦出现差异,就可能导致 Agent 执行行为偏离团队规范。 此次争议表面上是配置文件格式之争,背后则涉及 AI Coding Agent 进入企业后,项目规范、Skills 和 Context 究竟应采用厂商专属标准,还是形成跨 Agent 通用标准的问题。