阶跃星辰开源Step Code:自测追平DeepSeek Harness,token更省
相关推荐
DeepSeek Harness补上Browser Use和Computer Use:现在能操作网页,也能接管本机App
动察 Beating AI 快讯,DeepSeek Harness 最新的 v0.1.6-alpha.1 同时新增实验性 Browser Use 和 Computer Use。模型现在既能直接操作网页,也能查看并控制本地桌面。 Browser Use 支持 Playwright MCP、Chrome DevTools MCP 和 Stagehand,可以直接操作网页。Computer Use 则接入 Cua Driver,可找到具体 App 和窗口、获取当前界面截图,再根据界面元素或坐标执行点击和输入。官方提供 MCP 和原生两种 Computer Use 接入方式。 两项能力目前都属于实验性功能,需要手动启用。Computer Use 还需要给实际运行它的应用授予屏幕读取和电脑操作权限。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
DeepSeek V4 Pro跑5套Harness:Pi成功率第一,DSH最省钱
动察 Beating AI 快讯,Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。 通过率: 1. Pi Agent:21/30 2. DeepSeek Harness:20/30 3. Claude Code:19/30 4. OpenCode:19/30 5. Hermes Agent:18/30 30 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。 速度排名: 1. Claude Code:181.8 秒 2. DeepSeek Harness:252.1 秒 3. Hermes Agent:273.6 秒 4. OpenCode:280.6 秒 5. Pi Agent:362.9 秒 单次成功成本: 1. DeepSeek Harness:0.028 美元 2. Pi Agent:0.031 美元 3. OpenCode:0.032 美元 4. Hermes Agent:0.037 美元 5. Claude Code:0.074 美元 Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。 Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。
DeepSeek Harness官方桌面端要来了:完整App已进主仓
动察 Beating AI 快讯,DeepSeek Harness 官方桌面端已经出现在官方仓库主分支。它基于 Electron,直接把现有 Harness Web UI 做成独立 App,用户不用再自己启动 Web 服务。 代码已经包含 macOS 和 Windows 的安装包构建、签名、公证、自动更新和上传流程,生产更新地址也已经指向 `download.deepseek.com`。最近的提交主要在修打包、公证和启动恢复等问题。 官方目前还没公布发布时间,GitHub Release 里也没有安装包。但从代码完成度看,桌面端已经进入发布前收尾阶段。
字节ADrive即将独立上线:让Codex、豆包等Agent共用一套文件
动察 Beating AI 快讯,火山引擎智能网盘 ADrive 将在 9 月独立上线。目前 ADrive 已经开放试用,官方文档、产品条款和 CLI 均已上线,字节技术团队此前也多次公开介绍这款产品。 ADrive 给人和 Agent 提供同一个文件空间。Agent 生成的报告、代码、图片等文件可以直接存到云端,下次任务直接接着用,也可以换另一个 Agent 继续处理。 火山引擎此前已经演示过 Codex、豆包工作和 DeepSeek Harness 围绕同一个 ADrive 空间接力工作。官方 CLI 还支持 Agent 上传、下载、同步文件,并通过 MCP 调用网盘。 腾讯也预告了类似产品。腾讯网盘目前仍显示「Coming Soon」,尚未公开开放,但官网已经明确将支持 Agent 通过 CLI、MCP 调用文件,并与腾讯文档、WorkBuddy 等应用共享数据。
DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化
动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。