Poolside开源1180亿参数代码模型,自测压过1.6万亿参数DeepSeek
相关推荐
DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装
据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。
DeepSeek便宜到离谱:OpenCode两个月狂跑90万亿Token,账单仅92万美元
据 动察 Beating 监测,AI 编程工具 OpenCode 数据显示,6 月 10 日至 8 月 4 日,DeepSeek V4 Flash 在 OpenCode Go 上累计处理 90 万亿个 Token,总支出约 91.7 万美元。平均每 1 亿 Token 只需约 1.02 美元。 低成本主要来自缓存。该模型 96% 的输入 Token 命中缓存,平均每次会话处理 870 万个 Token,成本仅约 0.09 美元。
DeepSeek V4Flash在OpenCode爆量:单日跑掉8万亿Token
据动察 Beating 监测,AI 编程工具 OpenCode 披露,接入 DeepSeek V4 Flash 当天,OpenCode 用户跑了 8 万亿个 Token,其中 5 万亿来自免费计划,3 万亿来自付费订阅 OpenCode Go。 过去一周,它已占 OpenCode 全部 Token 用量的 55%,排名第一。
DeepSeek涨价首日全球分叉:国内大厂跟价分三派,海外厂商还在打折
据动察 Beating 监测,DeepSeek 今天正式启用 V4 新价格,每天有 7 个小时按高峰价收费,其余 17 个小时半价。 涨价第一天,国内外渠道正式分叉:国内有人直接跟、有人晚几天再涨、有人继续卖低价;海外不少平台还比 DeepSeek 原厂便宜。 1. 阿里云、腾讯云:直接跟涨。两家的 V4 Flash、V4 Pro 正式版都已经同步 DeepSeek 新价格,峰时、闲时也跟原厂一致。 2. 华为云、火山引擎:晚几天再涨。华为 8 月 20 日调整,而且自己划分昼夜,夜间打 7 折;火山引擎 8 月 21 日才涨,今天仍按旧价收费。 3. 快手万擎、百度:继续走自己的价格体系。快手万擎的 V4 Flash 目前还是输入 1 元、输出 2 元,比 DeepSeek 闲时都便宜;百度 Token Plan 也没照搬原厂峰谷价,DeepSeek 夜间仍是 2 折起。 4. OpenRouter:还在打折。V4 Flash 当前页面甚至挂着 33% 折扣,输入/输出约 0.06/0.12 美元。不过它会动态切换不同供应商,这个价格随时可能变。 5. OpenCode:按量版跟涨,订阅版直接砍额度。Zen 已完全同步 DeepSeek 峰谷价;Go 月费仍是首月 5 美元、之后 10 美元,但 V4 Flash 的单模型月额度从此前页面的 60 美元降到 15 美元,缩水 75%。注意,Go 整个套餐的月度上限仍是 60 美元,被砍的是 DeepSeek Flash 这一款模型的额度。 6. Command Code:套餐不砍,涨价直接传给用户。月费和 Credits 都不变,但 DeepSeek 现在更贵,所以同样的 Credits 能跑的请求变少;官方称高峰期大约只能跑闲时一半的量。 7. DeepInfra、RunInfra、GMI Cloud、Novita:海外低价继续。V4 Flash 目前分别约为 0.08/0.18、0.13/0.27、0.14/0.28、0.14/0.28 美元,都是全天固定价,没有照搬 DeepSeek 峰谷定价。 国内已经分成同步涨、延后涨、继续低价三派;海外 API 平台大多还在压价,Coding Agent 则开始从套餐额度里消化涨价。 现在从不同入口买,DeepSeek 模型的价格和用量已经能差出几倍。
DeepSeek-V4-Pro被曝「一个API三个模型」?社区测试揭示背后或是Agent环境差异
BlockBeats 消息,8 月 15 日,近日 AI 社区热议 DeepSeek-V4-Pro 疑似存在多个版本。有用户发现,同样调用 deepseek-v4-pro 接口,在更换 IP 或重新创建会话后,模型会出现三种不同的「推理风格」: 一类频繁以「Let me」开头,接近此前 V4 Pro Preview;一类常出现「The user wants me」,类似 V4 Flash;另一类大量使用「we」,被部分用户称为能力更强的「神版 V4 Pro」。 由于同一会话一旦进入某种模式后,后续表现通常保持稳定,社区一度猜测 DeepSeek 是否在 API 背后隐藏了多个模型,并通过路由机制分发。不过,进一步分析 DeepSeek Harness 源码后,出现了另一种解释:差异可能并非来自不同模型权重,而是来自 Agent 运行环境。 社区发现,8 月 10 日,DeepSeek Harness 官方仓库更新了一条关键 commit: 「fix(preset): align minimal agent with RL composition」 该更新旨在让 Minimal Agent 与强化学习(RL)训练时使用的 Agent 环境保持一致。 官方文档显示,Minimal preset 包含极简 system prompt、persistent Bash 环境、指定编辑工具、RL 训练使用的 compaction policy,并移除了额外身份提示、Web 提示及工具说明。 这意味着,DSH Minimal 可能并不是 Standard 版本的「阉割版」,而是在模拟模型训练阶段真实接触的 Agent 环境。 社区测试也支持这一观点。同一个 DeepSeek V4 Pro 在不同 Harness 环境下表现: DSH Standard:91 分; DSH PTC:92 分; DSH Minimal:99/96 分。 随后,测试者开发「Anchored Standard」插件:首次请求模拟 Minimal 环境,只开放 shell 和 read 工具,完成首次工具调用后再恢复 Standard 完整工具集,结果连续获得 98/99 分。 测试者认为,决定 V4 Pro Agent 能力发挥的关键,可能并非最终拥有多少工具,而是模型首次看到的:System Prompt + Tool Schema + Agent
「韩模之光」Solar Pro4智能指数冲到42分,但还是打不过DeepSeek V4Flash
据动察 Beating 监测,韩国 AI 公司 Upstage 发布旗舰推理模型 Solar Pro 4。Artificial Analysis 最新评测中,它的智能指数从上一代 Solar Pro 3 的 14 分冲到 42 分,主要提升来自 Agent 和长上下文能力。 其中 Terminal-Bench v2.1 从 12% 升到 57%,长上下文推理从 31 升到 71。GDPval-AA v2 也从 498 Elo 升到 1277,超过 1000 的人类基线。Solar Pro 4 已经是韩国模型冲击全球前列的一张代表牌。 但放到 DeepSeek V4 Flash 0731 面前,还是不够看。同一套 Artificial Analysis 智能指数里,DeepSeek 拿到 52 分,比 Solar Pro 4 高 10 分。DeepSeek 每秒输出约 122 个 Token,Solar Pro 4 约 65 个,前者接近快一倍。 价格差距更大。Solar Pro 4 每百万 Token 输入、输出分别要 0.30 和 1.20 美元,DeepSeek 只要 0.14 和 0.28 美元。Solar 的输出价格超过 DeepSeek 的 4 倍。 至少按这套综合评测和 API 性价比,「韩模之光」还没追上 DeepSeek。