Agent 协作可能正在从「系统能力」变成「模型能力」
相关推荐
DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化
动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。
CREAO再融千万美元:让Agent从每次失败里自己改Harness
动察 Beating AI 快讯,企业 Agent 平台 CREAO 完成新一轮千万级美元战略融资,累计融资超过 3000 万美元。CREAO 现在重点做的是 Harness 自我迭代,也就是让 Agent 根据真实任务里的错误和反馈,持续调整自己的执行系统。 Harness 是模型外面控制 Agent 怎么干活的一层,包括任务规划、工具调用、记忆、模型选择和出错后的处理方式。CREAO 已经跑通其中一部分自动纠错:Agent 完成任务后,系统会自动检查结果;发现问题后生成工单,AI 再调查原因、写修复、验证结果。新版本先用少量真实流量测试,效果变差就自动回滚。CREAO 官方此前已经公开过这套系统。 下一步,CREAO 准备把这种改进扩大到更多 Harness 环节。例如,同一类 Agent 反复在某个工具或任务流程上出错,平台可以根据大量真实任务的数据调整整套执行方式,新创建的同类 Agent 也能直接用上这些改进。 再往后,CREAO 还准备把一部分经验训进模型。它计划基于开源模型做垂直场景的后训练,让常见任务更多由成本较低的专用模型完成,复杂任务再调用前沿模型。
DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装
据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。
阿里云:Token Plan个人版升级,新增12类Agent Harness工具
火星财经消息 9月11日,阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。(广角观察)
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
开源Agent框架Pi突破10万星,v2也要来了
动察 Beating AI 快讯,Pi 的 GitHub 仓库突破 10 万星,官方同时预告 Pi v2 即将推出。Pi 是一个开源 Agent harness,也提供终端 Coding Agent。 过去一个多月,Pi 一直在重写最底层的 Agent 运行框架。7 月底先提出 Harness v2,重点加入任务持久化、崩溃恢复和多条执行 lane。8 月初这套设计刚进入正式 API,团队很快又开始 Harness v3,把存储和运行状态重新设计了一遍。随后 v3 又被收敛进现在统一的 harness.md。 新版 Harness 的目标是让 Agent 跑到一半即使进程挂掉,也能从上一次安全状态继续;多个 Agent 任务还能在同一会话历史上并行执行。当前 dev 分支仍有数百个 main 尚未包含的提交,新 Harness 还在快速推进。