DeepSeek V4.1 Flash即将上线,官方称全面超过V4 Pro
相关推荐
「韩模之光」Solar Pro4智能指数冲到42分,但还是打不过DeepSeek V4Flash
据动察 Beating 监测,韩国 AI 公司 Upstage 发布旗舰推理模型 Solar Pro 4。Artificial Analysis 最新评测中,它的智能指数从上一代 Solar Pro 3 的 14 分冲到 42 分,主要提升来自 Agent 和长上下文能力。 其中 Terminal-Bench v2.1 从 12% 升到 57%,长上下文推理从 31 升到 71。GDPval-AA v2 也从 498 Elo 升到 1277,超过 1000 的人类基线。Solar Pro 4 已经是韩国模型冲击全球前列的一张代表牌。 但放到 DeepSeek V4 Flash 0731 面前,还是不够看。同一套 Artificial Analysis 智能指数里,DeepSeek 拿到 52 分,比 Solar Pro 4 高 10 分。DeepSeek 每秒输出约 122 个 Token,Solar Pro 4 约 65 个,前者接近快一倍。 价格差距更大。Solar Pro 4 每百万 Token 输入、输出分别要 0.30 和 1.20 美元,DeepSeek 只要 0.14 和 0.28 美元。Solar 的输出价格超过 DeepSeek 的 4 倍。 至少按这套综合评测和 API 性价比,「韩模之光」还没追上 DeepSeek。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。
DeepSeek V4.1 Flash上线App:快速、专家、识图三合一
动察 Beating AI 快讯,DeepSeek V4.1 Flash 开始上线 App,原来的「快速」「专家」「识图」三个模式合并成一个入口。用户不用再手动选模式,一个模型同时处理日常对话、图片理解和复杂问题。 V4.1 Flash 原生支持多模态。DeepSeek 此前称,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro,并将在 V4.1 Pro 上线前接管所有 V4 Pro 请求。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
DeepSeek V4 Pro跑5套Harness:Pi成功率第一,DSH最省钱
动察 Beating AI 快讯,Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。 通过率: 1. Pi Agent:21/30 2. DeepSeek Harness:20/30 3. Claude Code:19/30 4. OpenCode:19/30 5. Hermes Agent:18/30 30 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。 速度排名: 1. Claude Code:181.8 秒 2. DeepSeek Harness:252.1 秒 3. Hermes Agent:273.6 秒 4. OpenCode:280.6 秒 5. Pi Agent:362.9 秒 单次成功成本: 1. DeepSeek Harness:0.028 美元 2. Pi Agent:0.031 美元 3. OpenCode:0.032 美元 4. Hermes Agent:0.037 美元 5. Claude Code:0.074 美元 Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。 Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。
DeepSeek V4 Pro API调用服务将不会下架
PANews 9月11日消息,据科创板日报报道,为响应广大用户的需求,DeepSeek决定在2026年9月14日之后继续提供DeepSeek V4 Pro的API调用服务,计费方式保持不变。此前,DeepSeek计划于北京时间2026年9月14日12:00下线V4 Pro服务,届时DeepSeek V4 Pro将会路由到V4.1 Flash并按V4.1 Flash计费。