返回 7*24 快讯
来源MarsBit

DeepSeek V4 Pro跑5套Harness:Pi成功率第一,DSH最省钱

动察 Beating AI 快讯,Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。 通过率: 1. Pi Agent:21/30 2. DeepSeek Harness:20/30 3. Claude Code:19/30 4. OpenCode:19/30 5. Hermes Agent:18/30 30 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。 速度排名: 1. Claude Code:181.8 秒 2. DeepSeek Harness:252.1 秒 3. Hermes Agent:273.6 秒 4. OpenCode:280.6 秒 5. Pi Agent:362.9 秒 单次成功成本: 1. DeepSeek Harness:0.028 美元 2. Pi Agent:0.031 美元 3. OpenCode:0.032 美元 4. Hermes Agent:0.037 美元 5. Claude Code:0.074 美元 Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。 Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-15 11:14

DeepSeek-V4-Pro被曝「一个API三个模型」?社区测试揭示背后或是Agent环境差异

BlockBeats 消息,8 月 15 日,近日 AI 社区热议 DeepSeek-V4-Pro 疑似存在多个版本。有用户发现,同样调用 deepseek-v4-pro 接口,在更换 IP 或重新创建会话后,模型会出现三种不同的「推理风格」: 一类频繁以「Let me」开头,接近此前 V4 Pro Preview;一类常出现「The user wants me」,类似 V4 Flash;另一类大量使用「we」,被部分用户称为能力更强的「神版 V4 Pro」。 由于同一会话一旦进入某种模式后,后续表现通常保持稳定,社区一度猜测 DeepSeek 是否在 API 背后隐藏了多个模型,并通过路由机制分发。不过,进一步分析 DeepSeek Harness 源码后,出现了另一种解释:差异可能并非来自不同模型权重,而是来自 Agent 运行环境。 社区发现,8 月 10 日,DeepSeek Harness 官方仓库更新了一条关键 commit: 「fix(preset): align minimal agent with RL composition」 该更新旨在让 Minimal Agent 与强化学习(RL)训练时使用的 Agent 环境保持一致。 官方文档显示,Minimal preset 包含极简 system prompt、persistent Bash 环境、指定编辑工具、RL 训练使用的 compaction policy,并移除了额外身份提示、Web 提示及工具说明。 这意味着,DSH Minimal 可能并不是 Standard 版本的「阉割版」,而是在模拟模型训练阶段真实接触的 Agent 环境。 社区测试也支持这一观点。同一个 DeepSeek V4 Pro 在不同 Harness 环境下表现: DSH Standard:91 分; DSH PTC:92 分; DSH Minimal:99/96 分。 随后,测试者开发「Anchored Standard」插件:首次请求模拟 Minimal 环境,只开放 shell 和 read 工具,完成首次工具调用后再恢复 Standard 完整工具集,结果连续获得 98/99 分。 测试者认为,决定 V4 Pro Agent 能力发挥的关键,可能并非最终拥有多少工具,而是模型首次看到的:System Prompt + Tool Schema + Agent

08-13 20:52

DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装

据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。

08-11 14:09

DeepSeek版Claude Code越来越近,Harness团队开通官方公众号

据动察 Beating 监测,DeepSeek Harness 团队已经开通独立微信公众号,并获得企业认证。此前这个团队主要通过招聘信息和成员个人账号对外露面。 Harness 是模型外的 Agent 执行层,负责上下文、工具调用和任务执行。DeepSeek 7 月 31 日发布 V4-Flash 正式版时,已经用 DeepSeek Harness 极简模式跑公开 Code Agent 基准,并标注「即将发布」。 团队近期也开始公开招募 Harness 内测用户,申请者需要有相关开源项目经历,并提交 GitHub ID 和代表作。

07-28 18:04

网传DeepSeek Harness本周开启内测,对标Claude Code

BlockBeats 消息,7 月 28 日,据 Max For AI 爆料,名为「Harness」的 DeepSeek 版 Claude Code 即将开始内测。社群疯传的内测招募截图显示,DeepSeek Harness 计划于本周晚些时候开启内测,首批用户将从小范围群聊中筛选。入选者需要提交个人资料、签署《保密承诺函》,并获得产品访问权限。 更值得注意的是,图里还明确提醒:一旦泄密,不仅会被取消资格,还会影响之后 DeepSeek 各类模型、产品内测以及合作机会的入选。如果消息属实,V4 正式版和 Harness 将很快公布。 动察 Beating 稍早前报道,DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。Harness 封闭测试结束后约 1 至 2 周会开放 V4,发布时间可能在 8 月 10 日至 20 日之间。如果消息属实,DeepSeek V4 上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。

08-15 09:20

DeepSeek V4 Pro正式版+Harness上线国家超算互联网

火星财经消息,8月14日,国家超算互联网宣布上线 DeepSeek V4 Pro正式版,以及智能体框架DeepSeek Harness,并依托全国首个十万卡级超智融合算力资源池,为科研院所、科创企业及开发者提供大模型全生命周期算力支撑。目前超算互联网AI社区已汇聚1700余款开源大模型,用户可一站式完成模型部署、微调训练与适配优化等全流程AI开发工作。

08-13 15:14

「韩模之光」Solar Pro4智能指数冲到42分,但还是打不过DeepSeek V4Flash

据动察 Beating 监测,韩国 AI 公司 Upstage 发布旗舰推理模型 Solar Pro 4。Artificial Analysis 最新评测中,它的智能指数从上一代 Solar Pro 3 的 14 分冲到 42 分,主要提升来自 Agent 和长上下文能力。 其中 Terminal-Bench v2.1 从 12% 升到 57%,长上下文推理从 31 升到 71。GDPval-AA v2 也从 498 Elo 升到 1277,超过 1000 的人类基线。Solar Pro 4 已经是韩国模型冲击全球前列的一张代表牌。 但放到 DeepSeek V4 Flash 0731 面前,还是不够看。同一套 Artificial Analysis 智能指数里,DeepSeek 拿到 52 分,比 Solar Pro 4 高 10 分。DeepSeek 每秒输出约 122 个 Token,Solar Pro 4 约 65 个,前者接近快一倍。 价格差距更大。Solar Pro 4 每百万 Token 输入、输出分别要 0.30 和 1.20 美元,DeepSeek 只要 0.14 和 0.28 美元。Solar 的输出价格超过 DeepSeek 的 4 倍。 至少按这套综合评测和 API 性价比,「韩模之光」还没追上 DeepSeek。