DeepSeek V4 Pro跑5套Harness:Pi成功率第一,DSH最省钱
相关推荐
DeepSeek Harness底座Cordis有了Rust实现:DimAgent准备用它重构
动察 Beating AI 快讯,DimAgent 创始人 Han Cheng 开源插件运行时 Rutis,并表示接下来会用它支撑 DimAgent 的新架构。Rutis 用 Rust 重新实现了 Cordis 的核心设计,后者正是 DeepSeek Harness 使用的底层插件框架。 DeepSeek Harness 用 Cordis 管理模型、工具、会话、Agent Loop 等组件。每个组件都可以做成插件,只声明自己需要和提供哪些服务,Cordis 负责启动、卸载、依赖变化和资源清理。 Rutis 把这套机制搬到了 Rust,同时支持 TypeScript、JavaScript 和 Python 插件。不同语言的插件可以互相调用,也可以分布在不同进程和机器上运行。现有 Cordis 插件也可以直接接入,不需要全部重写。
阶跃星辰开源Step Code:自测追平DeepSeek Harness,token更省
动察 Beating AI 快讯,阶跃星辰开源 AI 编程工具 Step Code v0.1.0,采用 MIT 许可证。它直接跑在终端里,可以读写代码、跑测试和执行开发任务,还支持 MCP、Agent Skills 和 Claude Code 插件。内置的 StepPage 可以一条命令把本地静态网站发布到线上。 Step Code 主打少用 token。在阶跃自己的 Terminal-Bench 2.1 横评中,它完成 72/89 个任务,得分 80.9%,与 DeepSeek Harness 并列最高,但 token 用量更低。 阶跃自建的 Multi-Frame 长任务测试共有 150 道题,Step Code 完成 110 道,得分 73.3%,平均每题消耗 509 万 token,在对比的 6 款 harness 中同时拿到最高通过率和最低 token 用量。 不过阶跃没有公布这轮横评具体用了哪个底层模型,也没有拆解这些 token 是怎么省下来的。官方只提到 Step Code 与 Step 系列模型一起针对 token 消耗做过调优。 源码里也能看到不少「节流」设计:文件读取和命令输出会限长,搜索尽量缩小返回范围,长对话默认会压缩上下文,system prompt 也要求能直接调用工具就不要额外开 Agent。 还有一套更激进的 contextProjection,可以裁掉旧工具输出、重复结果和历史 reasoning,不过默认关闭。 综合来看,它的 token 优势来自模型和 harness 多处优化叠加。
DeepSeek Harness官方桌面端偷跑:没官宣,但Mac、Windows已经能装
动察 Beating AI 快讯,DeepSeek Harness 的官方桌面端已经偷跑。DeepSeek 还没有正式官宣,官网也没有公开下载入口,但 macOS 和 Windows 安装包已经出现在官方服务器上,实测可以正常安装使用。 桌面端基于 Electron,把 Harness 原来的 Web 版封装成独立 App。用户可以登录 DeepSeek 账号或填写 API Key,再选择本地文件夹作为工作区,不需要自己先启动 Web 服务。 官方仓库最近也在密集补齐桌面端功能。最新的 dsh v0.1.7-rc.2 加入首次使用引导、快捷键管理和后台运行任务,还修复了 Windows 安装包启动和 macOS 窗口等问题。 目前能找到的官方安装包只有 macOS Apple Silicon 和 Windows x64。Mac 版使用杭州深度求索的 Developer ID 签名,并已通过 Apple 公证。
Claude Code像素级抄袭Cursor,连Projects都懒得改名
动察 Beating AI 快讯,Anthropic 重做 Claude Projects,结果和 Cursor 一周前推出的同名功能几乎一个模子。 Cursor 让一个总控 Agent 当项目经理,自己不写代码,只负责拆任务、定计划,再把活分给多个 Agent 并行完成。任务长期跑在云端,关电脑也不停;所有 Agent 共享项目上下文,需要时还能自动拉起本地 Agent。 Claude 新 Projects 基本照着这套来。也是总控 Agent 拆任务、验结果,下面同时跑多个 Claude Code 会话;每个会话独立改代码、跑测试、提交 PR,共享项目记忆,电脑关了照样干。 Cursor Projects 9 月 10 日上线,Claude Projects 9 月 17 日才发布。现在甚至还是 Cursor 功能更多,看来 7 天只够 Claude 抄个七七八八。
Antigravity终于上Claude 5.5:仅限付费Pro订阅及Ultra,旧模型11月退场
动察 Beating AI 快讯,Google 的 AI 编程工具 Antigravity 已接入 Claude Opus 5.5 和 Sonnet 5.5。两款模型向 Google AI Ultra 和 Pro 开放,但 Pro 仅限正式订阅,仍处于免费试用期的用户无法使用。Free 和 Google AI Plus 暂时拿不到 5.5。Antigravity 支持为模型选择 Low、Medium、High 三档思考强度。 Google 同时开始清理旧模型。Claude Opus 4.6、Sonnet 4.6 和 GPT-OSS-120b 都将在 11 月 2 日移除。按当前模型表,如果没有新模型补位,Free 和 Google AI Plus 届时将没有 Claude 或 GPT-OSS 可选,只剩 Gemini 系列。 Google 没有公布 Claude 5.5 的具体额度,只说明 Pro 额度每 5 小时刷新,同时受周额度限制。Gemini 与 Claude、GPT 使用两套独立额度。已经有多名 Pro 用户反馈,Opus 5.5 跑一次任务就可能快速消耗五小时和周额度,有用户称运行约 9 分钟就用掉了一半周额度。
MiniMax把OpenAI新Agents API做成开源版,Codex、Claude Code都能接
动察 Beating AI 快讯,MiniMax 开源 OpenAgentCore,做了一套兼容 OpenAI Agents API 的自托管实现。开发者可以继续使用 OpenAI 官方 SDK,只需要换掉 API 地址,后台运行的 Agent 可以选择 Codex、Claude Code 或 MiniMax Code。 Agents API 可以理解成一套「调用 Agent 的统一接口」。普通模型 API 主要负责一问一答。Agent 要连续干几个小时甚至几天,还要管理上下文、调用工具、协调子 Agent、保存任务进度。OpenAI 的 Agents API 把这些能力放到一个长期运行的 Session 里统一管理。 OpenAI 官方版本使用 OpenAI 托管的 Codex 执行框架。开发者可以自己选择代码在哪运行,但 Agent 的任务编排、上下文管理和运行状态仍由 OpenAI 负责。OpenAgentCore 则把这套后端也交给开发者自己部署。