DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
相关推荐
DeepSeek V4.1 Flash即将上线,官方称全面超过V4 Pro
动察 Beating AI 快讯,DeepSeek 计划在 9 月 10 日前后正式发布 V4.1 Flash。官方称,经过内部和外部测试,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro。 V4.1 Flash 上线后,在 V4.1 Pro 发布之前,所有发往 V4 Pro 的请求都会自动切到 V4.1 Flash,并按更便宜的 Flash 价格计费。用户不需要修改原来的 V4 Pro 调用方式。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
GLM-5.3、DeepSeek-V4-Pro正式版接入千问AI平台
火星财经消息,8月21日,据阿里云消息,阿里云MaaS扩充模型服务矩阵,GLM-5.3和DeepSeek-V4-Pro正式版现已接入千问AI平台,相关API服务同步开放,开发者可直接调用。据介绍,DeepSeek-V4-Pro、Qwen3.8-Max和Qwen-Audio系列模型已陆续开放订阅使用,用户订阅套餐后,可在Qoder、Codex等AI工具中按需切换模型。
GLM-5.3智能指数暴涨到60:追平Kimi K3,API单价没涨
据动察 Beating 监测,智谱正式开放 GLM-5.3 API。此前模型发布时,API 没有立即上线。与此同时,Artificial Analysis 的独立评测也出炉了:Intelligence Index 从 GLM-5.2 的 53 暴涨到 60,追平 Kimi K3,只比 GPT-5.6 Sol 低 1 分。等权重按计划公开后,它将和 Kimi K3 并列 AA 评分最高的开放权重模型。 涨得最猛的是 Agent。GDPval-AA v2 的 Elo 从 1524 跳到 1770,一次涨了 246 分,排所有模型第二,仅次于 Claude Opus 5 的 1855,也比 Kimi K3 的 1668 高出 100 多分。 API 单价没有跟着涨。输入仍是每百万 Token 1.40 美元,输出 4.40 美元,缓存输入 0.26 美元,和 GLM-5.2 完全一样。 不过 5.3 明显更能花 Token。AA 测得它每项任务平均输出约 1.87 万 Token,比 5.2 多 20%。因此单任务实际成本从 0.44 美元涨到 0.68 美元,贵了约 55%。即便如此,同档模型里仍比 Kimi K3 的 0.84 美元和 GPT-5.6 Sol 的 1.23 美元便宜。
“千问办公”首发上线GLM-5.3、DeepSeek V4 Pro两款模型
火星财经消息,8月15日,阿里巴巴旗下Agent产品“千问办公”首发上线GLM-5.3和DeepSeek V4 Pro两款前沿模型。即日起,用户可在产品首页的“前沿模型”档位直接选用。加上此前首发上线的Qwen3.8-Max,千问办公目前已支持三款国产旗舰模型。
DeepSeek V4.1 Flash上线App:快速、专家、识图三合一
动察 Beating AI 快讯,DeepSeek V4.1 Flash 开始上线 App,原来的「快速」「专家」「识图」三个模式合并成一个入口。用户不用再手动选模式,一个模型同时处理日常对话、图片理解和复杂问题。 V4.1 Flash 原生支持多模态。DeepSeek 此前称,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro,并将在 V4.1 Pro 上线前接管所有 V4 Pro 请求。