返回 7*24 快讯
来源Blockbeats

DeepSeek开始直接对接大规模部署:有2000张GPU可以找官方

动察 Beating AI 快讯,DeepSeek 在 V4.1 Flash 开源公告里罕见地直接向大规模部署方喊话:如果有 2000 张 GPU 和存储集群,可以直接联系 DeepSeek。 但这并不是新的商业授权门槛。V4.1 Flash 仍按 MIT License 开源,没有按照公司营收或业务规模设置额外授权条件。有资源的企业可以自己部署,联系 DeepSeek 更像是针对超大规模场景的直接技术合作。DeepSeek 目前也没有宣布正式的私有化部署产品或收费服务。 过去 DeepSeek 开源模型后,部署适配更多由 SGLang、TensorRT-LLM 等推理框架和硬件厂商完成。这次官方主动留下大规模部署的直接联系方式,并表示会继续支持开源社区做新模型的推理适配,尝试进一步扩大部署范围。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-01 07:37

FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。

08-01 03:37

DeepSeek没把新版能力锁在API,V4-Flash正式版权重开源

据动察 Beating 监测,DeepSeek 已在 Hugging Face 放出 V4-Flash-0731 正式版权重,并继续采用 MIT 许可证。开发者可以自行部署、微调和商用,不必只能通过 DeepSeek 官方 API 使用。 这次开放的是刚完成后训练升级的正式版。它在多项 Agent 测试中超过 V4-Pro-Preview,相关能力现在也能由第三方独立部署和复测。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。

09-10 06:43

DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化

动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。

09-10 02:40

DeepSeek V4.1 Flash上线App:快速、专家、识图三合一

动察 Beating AI 快讯,DeepSeek V4.1 Flash 开始上线 App,原来的「快速」「专家」「识图」三个模式合并成一个入口。用户不用再手动选模式,一个模型同时处理日常对话、图片理解和复杂问题。 V4.1 Flash 原生支持多模态。DeepSeek 此前称,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro,并将在 V4.1 Pro 上线前接管所有 V4 Pro 请求。

09-09 07:23

DeepSeek V4.1 Flash即将上线,官方称全面超过V4 Pro

动察 Beating AI 快讯,DeepSeek 计划在 9 月 10 日前后正式发布 V4.1 Flash。官方称,经过内部和外部测试,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro。 V4.1 Flash 上线后,在 V4.1 Pro 发布之前,所有发往 V4 Pro 的请求都会自动切到 V4.1 Flash,并按更便宜的 Flash 价格计费。用户不需要修改原来的 V4 Pro 调用方式。