Anthropic:多智能体协作或成AI下一阶段趋势,但复杂任务仍存在明显协调难题
相关推荐
Claude Fable 5.1 正式登陆 B.AI API,专为高难度推理与 Agent 工作流打造
ChainCatcher 消息,B.AI 平台宣布 Anthropic 最新 Mythos 级通用模型 Claude Fable 5.1 现已正式接入 API。 该模型与 Claude Mythos 5.1 采用相同底层模型,专为高强度代码编写、长期 Agent 工作流与复杂知识任务深度优化,在 CursorBench 3.2.0 测试中以最高运算强度取得 73.4% 的优异表现。 API 接入现已开放,开发者可享专属优惠——官方渠道低至 8.5 折,自选服务商低至 6 折。B.AI 持续引入全球顶尖模型,为开发者提供更强大、更具性价比的 AI 能力选择。
Claude电商Agent开源:合作方购物车规模提升35%,顾客购买率提高60%
动察 Beating AI 快讯,Anthropic 开源了 Claude Commerce Agents。这是一套让商家自己搭购物和运营 Agent 的参考代码。里面有两个 Agent:一个面向消费者搜商品、比较商品、搭配多件商品和加购物车;另一个面向商家看销售、库存、定价和营销。代码采用 Apache 2.0。 购物 Agent 只能把购物车交给商家自己的结账页,代码里没有直接扣款接口。商家 Agent 想调价、补货或改活动,也只能先生成待执行修改,必须人工批准后才能落地。相关限制不是只写在 prompt 里,支付、商品来源、调价幅度和人工审批等规则都有代码层拦截。 Anthropic 不建议把搜索、退货、定价等能力拆成一堆子 Agent。它让一个 Claude 保留完整对话,再按需加载不同 Skills。Anthropic 称,在多个企业部署里的比较中,这种方案质量更高,通常也更省 token、延迟更低。 Anthropic 称,一家合作方上线后,购物车规模提高约 30%–35%,顾客完成购买的概率提高约 60%。
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
Anthropic发布对Claude网络入侵事件的对齐评估:揭示模型“偏置推理”和“鲁莽”问题
PANews 9月10日消息,Anthropic在对约4.81亿条模型交互记录审查中,确认4起Claude模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。Anthropic将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中Claude Mythos 5曾在认为处于“模拟环境”前提下向PyPI上传恶意包、利用泄露凭证访问安全厂商真实数据库。
谷歌14年工程老将Addy Osmani加入Anthropic,参与Claude Code开发
动察 Beating AI 快讯,Addy Osmani 宣布加入 Anthropic,接下来会参与 Claude Code 开发,重点改善开发者体验。 Osmani 在谷歌工作超过 14 年,长期负责 Chrome 开发者体验,后来转到 Google Cloud AI。他负责过 Cloud AI 开发者体验和技术布道,也参与 Agent Platform、Agent CLI、Agent Studio 等产品上线。 他近一年一直在研究 Coding Agent 和 Agent 工作流,也长期公开使用和分析 Claude Code。
Anthropic预览Function Hooks:Claude Code插件能直接改界面
动察 Beating AI 快讯,Anthropic 正在测试 Claude Code 的新扩展机制 Function Hooks,目前还没有上线。它允许插件直接用 TypeScript 函数接入 Claude Code,甚至修改 React 界面的组件、显示内容和交互。现有 Hooks 则主要是在特定事件发生时调用命令、HTTP、MCP、Prompt 或子 Agent。 Function Hooks 的工作方式类似 Express、Koa 的中间件,可以让多个插件层层嵌套。插件通过一个受控的 $ 对象执行操作,管理员还能收走其中某些能力,让后面的插件无法调用。一个 Hook 也可以监听所有事件和插件通过 $ 发出的操作,用来统一记录审计日志。 最大的变化是,Claude Code 插件的能力开始深入到界面和交互层。官方演示里,Claude 可以一句话生成一个插件,在工具输出进入模型前自动遮掉密码等敏感信息。另一个插件可以直接修改 Claude Code Desktop 的显示,把敏感内容藏起来,鼠标移上去才显示。