返回 7*24 快讯
来源Blockbeats

智谱推出对标DeepSeek的轻量旗舰模型,由10万国产卡支持

动察 Beating AI 快讯,智谱发布旨在对标 DeepSeek V4 Flash 的轻量级旗舰模型 GLM-5.3 Flash,调用超过 10 万张国产芯片集群用于该模型推理服务。 据了解,其算力供应商或来自华为、摩尔线程与海光,智谱官方没有评论这一信息。智谱在技术文档中表示,其集群「硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平」,但没有明确具体型号。(晚点)
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-01 07:37

FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。

08-21 03:45

DeepSeek Flash 涨价后流量腰斩,留下近 10 万亿 Token 日缺口

火星财经消息,OpenCode CEO Jay V 表示,DeepSeek V4 Flash 自 8 月 1 日上线后,在 OpenCode 上的日 Token 消耗量从约 3 万亿飙升至 18 万亿,两周内增长 6 倍,接近 OpenRouter 全平台日处理量。其定价约为 Fable 的 1/350、GPT-5.6 Sol 的 1/175、Claude Sonnet 的 1/70,被用户视为“便宜到无需计量的 AI”。8 月 16 日 DeepSeek 将高峰时段价格上调 5 倍(非高峰时段 2.5 倍)后,模型日 Token 消耗量从峰值回落超过 50%。Jay V 认为涨价系应对 GPU 成本上升的被动之举。目前 OpenCode 正寻找能以原价承接流量的供应商,约需 1000 块 B300 才能支撑当前需求。DeepSeek Flash 暴露了 AI 模型市场的“不可能三角”——便宜、强大、大规模稳定供应难以兼得。涨价后,OpenCode Go 已将配额从 60 美元降至 15 美元后又恢复至 30 美元,并引入峰谷费率机制。

08-28 07:15重要

商汤大装置为智谱 GLM-5.3-Flash 提供国产算力与 Token 服务

火星财经消息,据证券时报,8月 27 日,记者从商汤获悉,商汤大装置为智谱近日上线并开源的 GLM -5.3- Flash 提供国产算力支持与 Token 服务,这被认为是国产算力规模化商用的又一个标杆。据透露,商汤大装置7月日均 Token 服务量已达到2.42万亿,预计2026年年底突破日均10万亿。

08-18 14:49重要

B.AI 平台免费开放 DeepSeek V4 Flash,Token 吞吐量突破 769 亿

ChainCatcher 消息,B.AI 平台自开放 DeepSeek V4 Flash 免费访问以来,最新 24 小时数据出炉:Token 吞吐量突破 769 亿,累计新增注册用户达 206 万,单日新注册峰值录得 5468 人。B.AI 平台凭借稳定高并发基础设施,开发者可零成本调用顶级 LLM 聚合服务,支撑生产级 AI 工作流。 目前,网页聊天与 API 接口已同步解锁,开发者即日起即可零门槛接入,开启从原型验证到大规模部署的全链路 AI 开发体验。B.AI 正以“免费+高性能”的组合拳,加速重构大模型服务市场格局。

09-10 07:17

DeepSeek开始直接对接大规模部署:有2000张GPU可以找官方

动察 Beating AI 快讯,DeepSeek 在 V4.1 Flash 开源公告里罕见地直接向大规模部署方喊话:如果有 2000 张 GPU 和存储集群,可以直接联系 DeepSeek。 但这并不是新的商业授权门槛。V4.1 Flash 仍按 MIT License 开源,没有按照公司营收或业务规模设置额外授权条件。有资源的企业可以自己部署,联系 DeepSeek 更像是针对超大规模场景的直接技术合作。DeepSeek 目前也没有宣布正式的私有化部署产品或收费服务。 过去 DeepSeek 开源模型后,部署适配更多由 SGLang、TensorRT-LLM 等推理框架和硬件厂商完成。这次官方主动留下大规模部署的直接联系方式,并表示会继续支持开源社区做新模型的推理适配,尝试进一步扩大部署范围。