中科曙光发布scaleFabric Token加速技术体系
相关推荐
观点:廉价开源模型泛用导致H100GPU现货租赁价格下跌及token价格指数回落
火星财经消息,6 月 27 日,投研机构 Silicon Data 发布数据指出,廉价开源模型泛用导致 H100 GPU 现货租赁价格下跌及 token 价格指数回落,但该机构认为这并不代表 AI 整体需求减弱,并指出用户大规模转向廉价开源模型反而推动整体计算消耗增加,维持了对高端计算资源的需求。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
DeepSeek Flash 涨价后流量腰斩,留下近 10 万亿 Token 日缺口
火星财经消息,OpenCode CEO Jay V 表示,DeepSeek V4 Flash 自 8 月 1 日上线后,在 OpenCode 上的日 Token 消耗量从约 3 万亿飙升至 18 万亿,两周内增长 6 倍,接近 OpenRouter 全平台日处理量。其定价约为 Fable 的 1/350、GPT-5.6 Sol 的 1/175、Claude Sonnet 的 1/70,被用户视为“便宜到无需计量的 AI”。8 月 16 日 DeepSeek 将高峰时段价格上调 5 倍(非高峰时段 2.5 倍)后,模型日 Token 消耗量从峰值回落超过 50%。Jay V 认为涨价系应对 GPU 成本上升的被动之举。目前 OpenCode 正寻找能以原价承接流量的供应商,约需 1000 块 B300 才能支撑当前需求。DeepSeek Flash 暴露了 AI 模型市场的“不可能三角”——便宜、强大、大规模稳定供应难以兼得。涨价后,OpenCode Go 已将配额从 60 美元降至 15 美元后又恢复至 30 美元,并引入峰谷费率机制。
Cerebras发布CS-4 AI加速器,称推理速度最高达GPU方案30倍
当地时间8月18日,Cerebras发布新一代AI加速器CS-4,称其推理速度最高可达基于GPU方案的30倍。CS-4采用三颗新型WSE-3 Turbo晶圆级引擎,AI算力达750PFLOPS,内存带宽达129.6PB/s。Cerebras表示,在GPT-OSS-120B测试中,CS-4每用户每秒生成超过440个Token,最高达到GPU方案的30倍;其每瓦吞吐量最高为CS-3的10倍,并可支持超过50万亿参数的模型。CS-4预计将于今年第三季度开始出货。(界面)
Token价格加速探底,创年内新低,算力过剩隐忧浮现
火星财经消息,8 月 10 日,Token 支出价格指数已跌至 1.1635,自 5 月末见顶(5 月 28 日高点 2.0651)以来持续走低,两个月内累计跌幅达 43.7%。该价格已跌破 2025 年末的 1.2446,正式创下年内新低,标志着 AI 算力定价回归至本轮扩张周期起点。 注:出售 Token 是目前 AI 产业的重要变现源头,其价格是衡量目前算力供需状况的信号之一,若 Token 价格保持在高位,云服务商就有动力增购更多 GPU、DRAM 内存并扩建数据中心,反之就要小心 AI 企业「消费降级」,成为本轮硬件狂欢周期结束的领先指标。Token 价格数据来源于 OpenAI、Anthropic、DeepSeek 等全球顶尖 AI 模型。
高端算力持续涨价,头部企业探索“Token工厂”新模式
最新公告显示,行云科技此前签订的算力服务大单不仅迎来加单与提价,还迎来收费模式的变革——新增了“Token(词元)收入相关的固定服务费”。记者梳理发现,今年以来,已有润建股份、弘信电子、行云科技、超讯科技、南威软件等10多家上市公司宣布探索“Token工厂”业务。“眼下,算力行业在商业模式上迎来了一大新变化,开始从‘堆硬件’转向‘卖Token’,也就是从按硬件出租向按Token交付演进,探索‘Token工厂’新模式。”7月30日,一位算力行业人士向记者表示,这意味着,算力行业竞争焦点从“拥有GPU”转向TaaS(Token-as-a-Service,Token即服务,按Token计费),商业模式从“卖资源”向“卖服务”升级。(上证报)