返回 7*24 快讯
来源MarsBit

DeepSeek-V4.1-Flash上线千问AI平台

火星财经消息 9月14日,阿里云宣布,DeepSeek-V4.1-Flash正式上线千问AI平台,相关API服务与Token Plan同步开放。(广角观察)
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-01 07:37

FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。

09-10 16:19

B.AI 宣布 DeepSeek-V4.1-Flash 多模态模型上线

ChainCatcher 消息,B.AI 平台宣布 DeepSeek 原生多模态 MoE 大模型 DeepSeek-V4.1-Flash 正式上线。该模型采用 5520 亿参数主干与 Causal Encoder-Decoder 架构,输入与输出采用非对称计算规模。模型支持 100 万 Token 上下文与 384K Output,面向长周期编程 Agent、多模态工作流与高并发 Agent 系统。目前 Web Chat 与 API 双端接入均已开放。

09-08 23:57

DeepSeek将于明日下调Flash系列API价格

PANews 9月9日消息,据DeepSeek开放平台公告,DeepSeek将于北京时间9月10日12时起下调Flash系列模型调用价格。其中,缓存命中、缓存未命中及输出价格最高降幅分别为60%、33.33%和11.11%。

08-23 14:42重要

DeepSeek-V4-Flash-Vision-Exp 登陆 B.AI,全量免费开放

ChainCatcher 消息,B.AI 平台上线 DeepSeek 全新多模态实验旗舰模型 DeepSeek-V4-Flash-Vision-Exp,目前 API 官方组已率先完成全量接入并面向所有用户免费开放。 该模型在延续 V4-Flash 顶尖纯文本与代码 Agent 能力的基础上,正式解锁原生图像理解能力,多模态 Agent 综合表现已接近 Claude Opus-4.8 旗舰水平。 新模型支持图文混合输入与 1M 超长上下文,可轻松驾驭多模态 PPT 生成、复杂 UI 重构及前端特效等硬核场景,图片输入按 token 计费,单张图片最高仅 384 tokens。现所有用户登录 B.AI 平台即可零门槛免费调用这一最新多模态模型能力,让顶尖算力为创意与生产力加速落地。

09-11 11:41

DeepSeek V4 Pro API调用服务将不会下架

PANews 9月11日消息,据科创板日报报道,为响应广大用户的需求,DeepSeek决定在2026年9月14日之后继续提供DeepSeek V4 Pro的API调用服务,计费方式保持不变。此前,DeepSeek计划于北京时间2026年9月14日12:00下线V4 Pro服务,届时DeepSeek V4 Pro将会路由到V4.1 Flash并按V4.1 Flash计费。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。