Meta确认将推Harness工具,开源模型也在路上
相关推荐
DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装
据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。
MetaMask推出自托管AI钱包Agent Wallet,支持AI代理自主执行链上交易
PANews 8月7日消息,据Decrypt报道,加密钱包服务商MetaMask宣布推出“Agent Wallet”自托管AI钱包,允许AI代理(AI Agent)在用户设定的权限范围内自主执行链上交易,进一步布局AI驱动的加密交易基础设施。 MetaMask表示,Agent Wallet面向使用AI代理进行市场监控、机会识别和自动交易的交易者与开发者。
马斯克取关Scale AI创始人Alexandr Wang
PANews 7月12日消息,据市场消息,马斯克在 X 平台取关 Scale AI 创始人 Alexandr Wang。
Meta新模型连夺三榜第一,法律Agent反超Grok 4.5
据动察 Beating 监测,AI 评测机构 Vals AI 公布 Muse Spark 1.1 成绩。模型在医疗文书、税务问答和法律 Agent 三项评测中排名第一,得分分别为 88.89%、79.72% 和 20.00%。 在税务评测 TaxEval v2 中,它超过 Fable 5、Opus 4.8 和 GPT-5.5。该评测包含超过 1200 道未公开测试题,既检查答案,也检查推理过程。头部模型差距较小,前十名相差不到 3 个百分点。 法律 Agent 评测中,Muse Spark 1.1 得分 20.00%,超过 Grok 4.5 的 12.92% 和 Fable 5 的 11.25%。测试要求模型使用文档、表格和文件工具完成真实法律工作。 它在网页应用编程评测中得分 72.16%,超过 GPT-5.5、Grok 4.5 和 GPT-5.4,但仍落后于 Fable 5 和多款 Claude 模型。
Meta TBD Lab成员Jiahui Yu宣布离职创业
PANews 8月14日消息,Jiahui Yu在X平台宣布将离开Meta并创办一家新公司。他表示,曾与Mark Zuckerberg、Alexandr Wang共同建设TBD Lab,并参与多模态团队在Muse Spark、Voice Mode、Muse Image和Muse Video等项目上的工作。Jiahui Yu称,他正转向一个对人类未来意义重大、但目前尚未得到充分探索的问题,更多细节将在相关工作逐步成形后公布。
Pi重构Agent执行层:长任务开始走向持久化运行
据动察 Beating 监测,Pi 正在重做 Agent Harness。最新 Harness v3 规范已经写完,正在做最终审计。它重做了任务执行和存储,让 Agent 即使跑到一半进程崩溃,甚至 Harness 自己升级,也能从中断处继续。 Pi 是 Mario Zechner 创建的开源 Agent Harness,最早因为 OpenClaw 使用它而出圈。项目今年被 Earendil 收购,Mario 也加入公司继续负责开发。现在 Pi 已有超过 6 万 GitHub Star,MiniMax 最新的 MiniMax Code 也明确基于 OpenCode 和 Pi 搭建 Harness。 v3 这次直接重做了底层架构。模型请求和工具调用前都会先保存执行状态,完成后再写入结果。重启后,Pi 能知道哪些已经做完、哪些可以重跑、哪些有副作用不能再执行一次。对话、运行状态和 Token 成本也改成分开保存,并加入跨版本状态迁移。 Claude Code、Codex 都在把 Agent 往更长的任务推。OpenAI 已经专门研究怎么让 Codex 持续完成长时间工作,Anthropic 也称 Claude Code 正越来越多地被用于长时间运行的 Agent 任务。Agent 能连续干几小时以后,前面几小时就不能因为一次崩溃全部白干。