返回 7*24 快讯
来源MarsBit

开源模型大翻盘:Vercel Token份额两个月从28%增至62%

动察 Beating AI 快讯,Vercel CEO Guillermo Rauch 公布,8 月 22 日,开源模型已占 AI Gateway Token 流量的 62%。6 月 24 日还只有 28.4%,两个月多了一倍多;闭源模型同期从 71.6% 降到 38%。 Vercel AI Gateway 统计的是自家平台上的实际模型调用量,不能代表整个 AI 市场。 与此同时,Vercel 上的 AI 用量也在暴涨。7 月 Token 总量环比增长 59%,开源模型占比已超过三分之一。DeepSeek 还超过 Google,成为 Token 消耗量第二大的模型厂商。 OpenAI 和 Anthropic 的合计 Token 量同样在加速增长。 但钱还是被闭源模型赚走了。7 月开放权重模型占约 36% Token,却只占 8.6% 的支出;Anthropic 用约 30% Token,拿走了 65.1% 的支出。 未来闭源前沿模型可能只占 15% 到 25% Token,却拿走 60% 到 90% 的经济价值。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-01 07:37

FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。

08-28 07:32

腾讯混元Hy4重做底层:DeepSeek稀疏注意力+智谱IndexCache一起上

动察 Beating AI 快讯,腾讯混元 Hy4 preview 这次除了把模型做大,底层架构也大改了一轮。上一代 Hy3 使用传统全注意力,Hy4 改成了 Gated DSA,也就是 DeepSeek Sparse Attention 的门控版本。模型面对超长文本时,不再把前面所有内容都重新算一遍,而是先挑出最相关的部分重点处理。 Hy4 还给 DSA 加上了 IndexCache。模型每一层原本都要重新判断「哪些内容最重要」,现在部分层可以直接复用前面已经挑好的结果,少做很多重复计算。 腾讯明确表示,这套设计受到 DeepSeek 和 GLM 启发。 另一处变化是残差结构。传统 Transformer 可以粗略理解成只有一条信息主干,Hy4 用 iHC 把它扩成了 4 条,让模型在很深的网络里能同时保留更多信息。MoE 专家数量也从 Hy3 的 192 个增加到 256 个路由专家 + 1 个共享专家,每个 Token 选择 8 个路由专家,同时始终经过共享专家。

08-26 19:42

智谱推出对标DeepSeek的轻量旗舰模型,由10万国产卡支持

动察 Beating AI 快讯,智谱发布旨在对标 DeepSeek V4 Flash 的轻量级旗舰模型 GLM-5.3 Flash,调用超过 10 万张国产芯片集群用于该模型推理服务。 据了解,其算力供应商或来自华为、摩尔线程与海光,智谱官方没有评论这一信息。智谱在技术文档中表示,其集群「硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平」,但没有明确具体型号。(晚点)

08-24 11:38

AI开始影响考勤:有公司为省Token让程序员倒班,以降低高峰时段额度消耗

动察 Beating AI 快讯,一家十来人的创业公司开始让程序员倒班,原因不是服务器要 24 小时值守,而是想省 AI Token。员工在 V2EX 发帖称,公司大量使用 DeepSeek、智谱等 Coding 服务,模型在部分高峰时段收费或额度消耗更高,公司索性开始跟着便宜时段排班。 新考勤要求员工每周工作日休一天、周末再休一天,可以自由组合,但要提前排班。工作日午休也被推迟到 14:00 以后。发帖人随后透露,公司只有十来个人,目前同时购买了 MiniMax、GLM、DeepSeek 和火山引擎等多套 Coding Plan。 DeepSeek 新一轮 API 定价把工作日高峰价定为低谷价的两倍,8 月 23 日又把周末改成全天低谷价。智谱的 Coding Plan 也按时间算额度,非高峰时段内,模型调用按基础积分消耗的 50% 抵扣。 原帖下面有人吐槽,人类居然开始主动配合 AI 的价格时段工作;也有网友称,自己公司的老板已经听说类似做法,还在考虑要不要跟。

09-12 02:10

熵旋芯智雷坤:MRAM存算一体芯片可使AI推理Token成本降低约10倍

火星财经消息 9月12日,熵旋芯智创始人兼CEO雷坤在2026算力中国AI与算力产业展览会科创路演活动上表示,基于MRAM的存算一体架构能耗比SRAM低近10倍,可使AI推理Token成本降低约10倍。三星8纳米MRAM已成熟量产,明年将推进至5纳米。目前公司已完成两轮融资(英诺、海贝、君杉),第三轮融资接近收尾。 (财联社)