DeepSeek Harness官方桌面端偷跑:没官宣,但Mac、Windows已经能装
相关推荐
DeepSeek Harness官方桌面端要来了:完整App已进主仓
动察 Beating AI 快讯,DeepSeek Harness 官方桌面端已经出现在官方仓库主分支。它基于 Electron,直接把现有 Harness Web UI 做成独立 App,用户不用再自己启动 Web 服务。 代码已经包含 macOS 和 Windows 的安装包构建、签名、公证、自动更新和上传流程,生产更新地址也已经指向 `download.deepseek.com`。最近的提交主要在修打包、公证和启动恢复等问题。 官方目前还没公布发布时间,GitHub Release 里也没有安装包。但从代码完成度看,桌面端已经进入发布前收尾阶段。
DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化
动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。
阶跃星辰开源Step Code:自测追平DeepSeek Harness,token更省
动察 Beating AI 快讯,阶跃星辰开源 AI 编程工具 Step Code v0.1.0,采用 MIT 许可证。它直接跑在终端里,可以读写代码、跑测试和执行开发任务,还支持 MCP、Agent Skills 和 Claude Code 插件。内置的 StepPage 可以一条命令把本地静态网站发布到线上。 Step Code 主打少用 token。在阶跃自己的 Terminal-Bench 2.1 横评中,它完成 72/89 个任务,得分 80.9%,与 DeepSeek Harness 并列最高,但 token 用量更低。 阶跃自建的 Multi-Frame 长任务测试共有 150 道题,Step Code 完成 110 道,得分 73.3%,平均每题消耗 509 万 token,在对比的 6 款 harness 中同时拿到最高通过率和最低 token 用量。 不过阶跃没有公布这轮横评具体用了哪个底层模型,也没有拆解这些 token 是怎么省下来的。官方只提到 Step Code 与 Step 系列模型一起针对 token 消耗做过调优。 源码里也能看到不少「节流」设计:文件读取和命令输出会限长,搜索尽量缩小返回范围,长对话默认会压缩上下文,system prompt 也要求能直接调用工具就不要额外开 Agent。 还有一套更激进的 contextProjection,可以裁掉旧工具输出、重复结果和历史 reasoning,不过默认关闭。 综合来看,它的 token 优势来自模型和 harness 多处优化叠加。
DeepSeek Harness补上Browser Use和Computer Use:现在能操作网页,也能接管本机App
动察 Beating AI 快讯,DeepSeek Harness 最新的 v0.1.6-alpha.1 同时新增实验性 Browser Use 和 Computer Use。模型现在既能直接操作网页,也能查看并控制本地桌面。 Browser Use 支持 Playwright MCP、Chrome DevTools MCP 和 Stagehand,可以直接操作网页。Computer Use 则接入 Cua Driver,可找到具体 App 和窗口、获取当前界面截图,再根据界面元素或坐标执行点击和输入。官方提供 MCP 和原生两种 Computer Use 接入方式。 两项能力目前都属于实验性功能,需要手动启用。Computer Use 还需要给实际运行它的应用授予屏幕读取和电脑操作权限。
DeepSeek V4 Pro跑5套Harness:Pi成功率第一,DSH最省钱
动察 Beating AI 快讯,Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。 通过率: 1. Pi Agent:21/30 2. DeepSeek Harness:20/30 3. Claude Code:19/30 4. OpenCode:19/30 5. Hermes Agent:18/30 30 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。 速度排名: 1. Claude Code:181.8 秒 2. DeepSeek Harness:252.1 秒 3. Hermes Agent:273.6 秒 4. OpenCode:280.6 秒 5. Pi Agent:362.9 秒 单次成功成本: 1. DeepSeek Harness:0.028 美元 2. Pi Agent:0.031 美元 3. OpenCode:0.032 美元 4. Hermes Agent:0.037 美元 5. Claude Code:0.074 美元 Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。 Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。
DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装
据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。