返回 7*24 快讯
来源Blockbeats

CREAO再融千万美元:让Agent从每次失败里自己改Harness

动察 Beating AI 快讯,企业 Agent 平台 CREAO 完成新一轮千万级美元战略融资,累计融资超过 3000 万美元。CREAO 现在重点做的是 Harness 自我迭代,也就是让 Agent 根据真实任务里的错误和反馈,持续调整自己的执行系统。 Harness 是模型外面控制 Agent 怎么干活的一层,包括任务规划、工具调用、记忆、模型选择和出错后的处理方式。CREAO 已经跑通其中一部分自动纠错:Agent 完成任务后,系统会自动检查结果;发现问题后生成工单,AI 再调查原因、写修复、验证结果。新版本先用少量真实流量测试,效果变差就自动回滚。CREAO 官方此前已经公开过这套系统。 下一步,CREAO 准备把这种改进扩大到更多 Harness 环节。例如,同一类 Agent 反复在某个工具或任务流程上出错,平台可以根据大量真实任务的数据调整整套执行方式,新创建的同类 Agent 也能直接用上这些改进。 再往后,CREAO 还准备把一部分经验训进模型。它计划基于开源模型做垂直场景的后训练,让常见任务更多由成本较低的专用模型完成,复杂任务再调用前沿模型。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-10 06:43

DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化

动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。

08-13 12:52

DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装

据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。

09-11 06:28

阿里云:Token Plan个人版升级,新增12类Agent Harness工具

火星财经消息 9月11日,阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。(广角观察)

09-11 11:01

英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%

动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。

09-01 13:53重要

开源Agent框架Pi突破10万星,v2也要来了

动察 Beating AI 快讯,Pi 的 GitHub 仓库突破 10 万星,官方同时预告 Pi v2 即将推出。Pi 是一个开源 Agent harness,也提供终端 Coding Agent。 过去一个多月,Pi 一直在重写最底层的 Agent 运行框架。7 月底先提出 Harness v2,重点加入任务持久化、崩溃恢复和多条执行 lane。8 月初这套设计刚进入正式 API,团队很快又开始 Harness v3,把存储和运行状态重新设计了一遍。随后 v3 又被收敛进现在统一的 harness.md。 新版 Harness 的目标是让 Agent 跑到一半即使进程挂掉,也能从上一次安全状态继续;多个 Agent 任务还能在同一会话历史上并行执行。当前 dev 分支仍有数百个 main 尚未包含的提交,新 Harness 还在快速推进。

08-27 07:02

Agent 协作可能正在从「系统能力」变成「模型能力」

动察 Beating AI 快讯,Agent 之间的分工、协调和长期协作,可能不再需要人类提前设计一整套复杂系统,而正在变成模型自己能够学会的能力。 如果最强模型只需要一个共享空间、足够长的运行时间和大量算力,就能自己分工、共享经验、调整组织方式,那么今天很多复杂的 Multi-Agent Harness,可能只是模型还不够聪明时的过渡脚手架。 科研可能是最直接的应用。大量 Agent 可以同时提出假设、跑实验、交换结果,再继续探索。真正不可替代的东西,可能不是 Planner、Manager 和各种固定工作流,而是共享状态、真实实验环境、权限边界,以及一个不会被骗的客观评分器。 虽然这还不是递归自我改进,但关键零件已经越来越齐:AI 能长期工作、自动科研、大规模并行运行,也开始展现跨 Agent 协作能力。如果这些能力最终能够闭环,AI 的进步方式可能就不再只是「单个模型越来越聪明」,而是「越来越多 AI 一起把下一代 AI 做出来」。