Delphi Digital:中国 AI 实验室正改变智能经济学
相关推荐
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
DeepSeek Flash 涨价后流量腰斩,留下近 10 万亿 Token 日缺口
火星财经消息,OpenCode CEO Jay V 表示,DeepSeek V4 Flash 自 8 月 1 日上线后,在 OpenCode 上的日 Token 消耗量从约 3 万亿飙升至 18 万亿,两周内增长 6 倍,接近 OpenRouter 全平台日处理量。其定价约为 Fable 的 1/350、GPT-5.6 Sol 的 1/175、Claude Sonnet 的 1/70,被用户视为“便宜到无需计量的 AI”。8 月 16 日 DeepSeek 将高峰时段价格上调 5 倍(非高峰时段 2.5 倍)后,模型日 Token 消耗量从峰值回落超过 50%。Jay V 认为涨价系应对 GPU 成本上升的被动之举。目前 OpenCode 正寻找能以原价承接流量的供应商,约需 1000 块 B300 才能支撑当前需求。DeepSeek Flash 暴露了 AI 模型市场的“不可能三角”——便宜、强大、大规模稳定供应难以兼得。涨价后,OpenCode Go 已将配额从 60 美元降至 15 美元后又恢复至 30 美元,并引入峰谷费率机制。
DeepSeek开始直接对接大规模部署:有2000张GPU可以找官方
动察 Beating AI 快讯,DeepSeek 在 V4.1 Flash 开源公告里罕见地直接向大规模部署方喊话:如果有 2000 张 GPU 和存储集群,可以直接联系 DeepSeek。 但这并不是新的商业授权门槛。V4.1 Flash 仍按 MIT License 开源,没有按照公司营收或业务规模设置额外授权条件。有资源的企业可以自己部署,联系 DeepSeek 更像是针对超大规模场景的直接技术合作。DeepSeek 目前也没有宣布正式的私有化部署产品或收费服务。 过去 DeepSeek 开源模型后,部署适配更多由 SGLang、TensorRT-LLM 等推理框架和硬件厂商完成。这次官方主动留下大规模部署的直接联系方式,并表示会继续支持开源社区做新模型的推理适配,尝试进一步扩大部署范围。
美国指控DeepSeek、Moonshot AI等中国AI企业“大规模恶意蒸馏”美国技术
PANews 9月9日消息,据路透社报道,美国执法和情报官员指控DeepSeek、Moonshot AI及阿里巴巴等6家中国AI企业,通过“蒸馏”方式利用OpenAI、Anthropic、Google及SpaceX等美国企业模型训练自身产品,并称相关行为可能在中国政府知情下进行,同时警告其可能增强中国军事及网络攻击能力。
天猫上线Token充值中心,首批接入阿里云、智谱、Kimi、MiniMax
火星财经消息,9月3日,天猫正式上线AI 空间站( Token充值中心)。页面显示,该充值中心集合了阿里云、智谱、Kimi、MiniMax等国内大模型厂商的订阅服务,在售商品包括按周期订阅的Token Plan、Coding Plan以及按用量付费的充值方案,支持卡密或直充两种交付方式。
MiniMax 7月Token消耗量飙至年初20倍 8月ARR冲破8亿美元
火星财经消息,MiniMax 8月26日晚在2026年中期业绩会上披露,公司8月年度经常性收入(ARR)已超过8亿美元,第二季度收入较第一季度环比增长81.8%,7月Token消耗量已达到1月的20倍,B端业务在整体ARR中的贡献已超过80%。MiniMax称,在算力上,公司是国内最早建立规模化、长期稳定基础设施体系的两家独立大模型公司之一。基础设施已能独立支撑最大的训练任务,ETTR(EffectiveTrainingTimeRatio,有效训练时间比例)已经达到97%。(财联社)