DHH横测编程模型:DeepSeek23美元跑完,Fable约550美元
相关推荐
DeepSeek V4强得像Fable 5,社区怀疑API偷偷换了模型
据动察 Beating 监测,爆料博主 leo 质疑,DeepSeek V4 Pro 的官方 API 会把部分复杂编程请求转给 Claude Fable 5。目的可能是收集输出,用于模型蒸馏,也就是用强模型的答案训练另一个模型。 测试者通过 OpenCode 让模型生成 3D 游戏。部分结果与 Fable 5 高度相似,推理方式也突然改变。加入网络安全和生物问题后,游戏质量明显下降,知识范围也退回 DeepSeek 原本的水平。 这个测试利用了 Fable 5 的真实机制。Anthropic 会把部分网络安全、生物和蒸馏请求转给 Opus 4.8。测试者因此怀疑,请求先被转给 Fable 5,触发分类器后才回退到 DeepSeek。 但现有证据只够证明 API 行为异常。它无法确认实际回答者,也无法证明这些输出进入了训练数据。混合 prompt、未公开更新或 DeepSeek 自己的模型路由,都可能造成类似差异。
网传DeepSeek Harness本周开启内测,对标Claude Code
BlockBeats 消息,7 月 28 日,据 Max For AI 爆料,名为「Harness」的 DeepSeek 版 Claude Code 即将开始内测。社群疯传的内测招募截图显示,DeepSeek Harness 计划于本周晚些时候开启内测,首批用户将从小范围群聊中筛选。入选者需要提交个人资料、签署《保密承诺函》,并获得产品访问权限。 更值得注意的是,图里还明确提醒:一旦泄密,不仅会被取消资格,还会影响之后 DeepSeek 各类模型、产品内测以及合作机会的入选。如果消息属实,V4 正式版和 Harness 将很快公布。 动察 Beating 稍早前报道,DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。Harness 封闭测试结束后约 1 至 2 周会开放 V4,发布时间可能在 8 月 10 日至 20 日之间。如果消息属实,DeepSeek V4 上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
接连指控中国模型蒸馏后,Anthropic藏起Fable 5思考摘要
据动察 Beating 监测,Fable 5 已不再在网页端、桌面端和移动端展示思考摘要。模型仍在后台推理,用户只能看到最终答案。Anthropic 尚未解释原因,但这很可能是反蒸馏的最新措施。 今年 2 月,Anthropic 指控 DeepSeek、月之暗面和 MiniMax 使用约 2.4 万个虚假账号,与 Claude 交互超过 1600 万次。月之暗面被指专门提取并重建 Claude 的推理轨迹。 6 月,Anthropic 又指控阿里及千问关联操作者通过近 2.5 万个虚假账号,与 Claude 交互超过 2880 万次。7 月,Anthropic 国家安全负责人 Tarun Chhabra 首次点名智谱,称 GLM-5.2 蒸馏了 Claude 和 OpenAI 模型。Kimi K3 发布后,白宫科技政策办公室主任 Michael Kratsios 又指控月之暗面用 Fable 开发 K3。 Fable 5 已内置「推理提取」分类器,专门拦截套取思考摘要的请求。现在 Anthropic 又把聊天界面的思考摘要直接隐藏,外界只能拿到最终答案,更难批量收集模型的解题过程用于蒸馏。代价是普通用户也看不到模型正在做什么,长任务走偏时更难发现,也更难及时纠正或叫停。
DeepSeek开源推理加速框架DeepSpec,上线DSpark让V4模型速度提升最高85%
据动察 Beating 监测,DeepSeek 联合北京大学发布投机采样加速框架 DSpark 的技术报告,并开源了全栈代码库 DeepSpec。目前 DSpark 已部署于 DeepSeek-V4 线上业务。在保证输出无损的前提下,DSpark 将 Flash 版单用户生成速度提升 60% 至 85%,Pro 版速度提升 57% 至 78%。DSpark 表现超越了原有的单 Token 多分支预测(MTP-1)基线,在严格时延约束下显著拉高了系统整体吞吐量。 此前,多 Token 投机采样难以在线上生产环境落地。自回归草稿模型生成太慢,而并行草稿模型由于各位置独立预测,导致长序列的后半截接受率极低。若在高并发下盲目验证多 Token 草稿,大模型会浪费大量算力去验证注定被拒绝的错字,导致系统整体吞吐量严重崩溃,因此业界在线上多局限于单 Token 预测(MTP-1)。 DSpark 克服了高并发下的吞吐退化瓶颈。DSpark 首先采用 DFlash 并行主干网生成隐藏状态,再追加极其轻量的马尔可夫头。马尔可夫头通过查表与一次矩阵乘法,以极低成本串行注入相邻词的关联。同时,系统集成置信度预测头与后验校准算法。为了完美兼容生产环境的零开销调度并防止未来信息泄漏,调度器采用异步机制,利用两步前的历史预测来动态决定候选词裁剪长度,彻底防止大模型在重负载下验证高风险的尾部错字。 除了 DSpark,DeepSeek 这次开源的 DeepSpec 代码库内置支持 Qwen3 与 Gemma 等开源大模型。DeepSpec 提供了从下载提示词、重建大模型缓存、训练草稿模型到基准评估的完整 Python 工具链。开发者可以直接利用开源脚本,在本地为不同的开源大模型定制并部署专属的加速模块。
Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍
据动察 Beating 监测,评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。 在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。 模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。 作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。
OpenRouter推出Fusion复合模型:多模型并联合成,半价匹敌Fable 5
据动察 Beating 监测,OpenRouter 推出 Fusion 复合模型接口,支持将用户提示词并行分发给多个大语言模型,再通过裁判模型与合成模型输出最终解答。在 Perplexity AI 发布的 DRACO 深度研究基准测试中,基于 Fusion 的多种模型组合展现出对传统单模型的压制力。在各项配置中,将 Fable 5 与 GPT-5.5 组成面板并在 Opus 4.8 的合成下取得了 69.0% 的最高分,显著超越了 Fable 5 单模型运行的 65.3% 成绩。测试表明,由于不同厂商模型的底层训练与逻辑差异,多模型混搭的多样性在复杂任务中能带来更强的视角互补。 即使是同一种模型进行左右互搏也表现出明显增幅,将 Opus 4.8 与自身组成双面板进行自我合成,得分能从独立运行的 58.8% 提升至 65.5%。对于高性价比需求,由 Gemini 3 Flash、Kimi K2.6 与 DeepSeek V4 Pro 组成的低成本面板同样在合成下取得了 64.7% 的分数,在调用成本减半的情况下,与 Fable 5 的差距缩短至 0.6 个百分点。 基准测试包含 10 个维度的 100 项复杂研究任务。为了防止模型在检索中意外访问到在线评测标准导致得分失真,OpenRouter 在服务端配置了过滤检索域名列表。目前 Fusion 已对 API 用户开放,默认标识符为 openrouter/fusion,用户也可在网页端自定义参与合成的模型面板。