返回 7*24 快讯
重要来源MarsBit

华尔街机构:Kimi K3并非「DeepSeek时刻」再现,反而强化算力需求

火星财经消息,7 月 21 日,Kimi K3 发布后,美股半导体板块因市场担忧出现「DeepSeek 时刻 2.0」而下跌,但瑞银、野村、美银证券和花旗均认为,这款模型并未削弱算力需求,反而可能推动 AI 基础设施需求进一步扩张。 Kimi K3 拥有 2.8 万亿参数、100 万 token 上下文窗口,并支持常开推理、原生多模态及 MoE 架构。机构认为,其规模和长上下文将增加 KV 缓存占用,并推高 HBM、服务器 DDR5、企业级固态硬盘、云基础设施及高速互联需求。花旗将这一趋势称为「又一次杰文斯悖论」,即模型效率和价格改善可能带来更多应用与 token 消耗。 瑞银指出,开源模型通常因上下文窗口更长而更加依赖内存和存储;花旗认为,K3 大规模部署或需要由 64 块以上 GPU 组成的超节点。野村则认为,全球大模型竞争将促使前沿实验室和超大规模云平台继续投入,利好台积电、英伟达、存储厂商、光模块供应商及数据中心运营商等 AI 基础设施环节。 不过,美银证券提示,若模型效率提升速度持续超过工作负载增长,而实际使用量未能同步扩张,AI 基础设施建设仍可能出现一定回落。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-10 12:17

DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用

据动察 Beating 监测,过去两年,大模型推理优化一直在拿 KV Cache 开刀。它是模型读完上下文后留下的中间计算结果,内容越长,越吃显存和带宽。DeepSeek-V2 借助 MLA,相比 DeepSeek 67B 将 KV Cache 减少 93.3%;Kimi Linear 相比全 MLA 又最多减少 75%。大家都在让长上下文更便宜。 但这些方案都有一道墙:缓存通常只能在同一个模型内部复用。Agent 从小模型切到大模型后,目标模型还得把前面几万甚至几十万 Token 重新计算一遍。模型路由越频繁,这笔重复计算越难忽略。 英伟达最新论文开始拆这堵墙。团队发现,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显的线性关系。用 500 段、每段 1024 Token 的文本校准一次,就能拟合出一套映射,把一个模型算好的 KV Cache 转给另一个模型继续用。 Qwen3-14B 切到 32B 时,32K 上下文重新计算约需 7 秒,转换缓存只要约 0.28 秒,快约 25 倍。换句话说,以后甚至可以先让小模型负责「读」:把长上下文算成 KV Cache;真正需要更强能力时,再把缓存转给大模型,让大模型直接开始「想」和生成。 这会让模型路由省下更多算力。现在让简单任务跑小模型,主要省的是生成成本;一旦切到大模型,长上下文往往还得由大模型重新算一遍。跨模型 KV Cache 如果做成熟,连这部分 prefill 都能交给小模型完成。Agent 可以长期用便宜模型维护上下文,碰到难题才叫醒大模型,而且不用每次都从头「读档」。

08-11 17:07重要

上海:围绕高性能计算芯片(GPU/NPU)、量子芯片(QPU)、高速光互连(CPO)、高带宽内存(HBM)及异构服务器等核心环节 推动自主芯片与主流大模型深度融合

火星财经消息,上海市经济和信息化委员会印发《上海市软件和信息服务业发展“十五五”规划》。其中提到,攻坚下一代模型架构,推动基于状态空间模型、循环神经网络变体、液态神经网络等非Transformer架构的多技术路线探索。加快布局物理智能、世界模型、量子智能、类脑智能等前沿基础模型技术体系。攻关超大规模智能算力集群组网技术,围绕高性能计算芯片(GPU/NPU)、量子芯片(QPU)、高速光互连(CPO)、高带宽内存(HBM)及异构服务器等核心环节,提升智算硬件的供给能力,推动自主芯片与主流大模型深度融合。聚焦新型存储检索、数模协同等,突破高精度异构处理、原生多模态融合及动态价值对齐等关键技术,建设覆盖语料全生命周期的自动化复杂推理。(财联社)

08-08 14:24

2.78万亿参数Kimi K3实现8GB内存运行,开发者开源轻量C推理引擎

BlockBeats 消息,8 月 8 日,有开发者近日开源项目 kimi-k3-in-c,尝试让拥有 2.78 万亿参数的 Kimi K3 模型在仅 8GB 内存的设备上运行。该项目仅 176KB,采用纯 C99 编写,不依赖 GPU、CUDA、PyTorch 或 BLAS,仅通过 CPU 即可完成模型推理。 该方案利用 Kimi K3 的 MoE(混合专家)架构特性。虽然模型总参数规模达到 2.78T,但每层 896 个专家中仅激活 16 个,因此开发者没有将完整约 1.56TB 模型权重加载进内存,而是将大部分专家权重存储在 NVMe 硬盘中,根据推理需求实时读取;同时,部分密集层(dense trunk)也采用逐层流式加载方式。 不过,该方案目前仍存在明显性能限制。在 8GB 内存模式下,模型生成一个 token 大约需要 32.7 秒,同时需要接近 1.7TB 高速存储空间支持。 开发者表示,这一方案目前更像是对大模型推理基础设施优化方向的一次实验探索,并不具备实际生产使用价值,但其通过「硬盘流式加载+MoE 稀疏激活」的方式,为未来低成本运行超大规模模型提供了一种新思路。

08-07 00:19

英伟达考虑降低Rubin Ultra GPU配置,以缓解HBM供应短缺

PANews 8月7日消息,据The Information报道,英伟达正在考虑调整下一代Rubin Ultra GPU的设计方案,通过减少高带宽内存(HBM)配置来应对先进HBM芯片供应紧张问题。 知情人士透露,过去几周英伟达已测试至少三种不同版本的Rubin Ultra GPU,其中部分版本搭载的显存容量低于公司此前公布的规划。英伟达考虑推出低显存版本,主要原因是市场可能无法获得足够数量的先进HBM芯片。 HBM是AI加速器的关键组件,能够提供更高的数据传输速度,成为训练和推理大型AI模型的重要基础。随着AI算力需求快速增长,HBM供应已成为限制高端AI芯片产能的重要因素之一。

08-05 12:40

Cursor重排GPU流水线,MoE模型训练提速41%

据动察 Beating 监测,Cursor 开源 Mixture-of-Kittens(MoK),用于加速 MoE 大模型训练。它把原本分开的 GPU 数据传输和计算,合进一个 kernel(直接在 GPU 上运行的底层程序)。 MoE 会把模型拆成大量「专家」,每次只调用其中一部分。专家分散在不同 GPU 上,数据需要频繁搬运,有时会占掉一半以上的训练时间。 MoK 让 GPU 一边传数据,一边做计算,减少等待。在 512 块 GB300 GPU 的实际训练中,整体吞吐提高 41%。单独测试 MoE 层时,最高比公开方案快 2.37 倍。 MoK 已用于 Cursor 数万块 GPU 的 Composer 训练,并以 Apache 2.0 开源。目前只支持英伟达 Blackwell GPU,主要面向拥有 GB200、GB300 NVL72 集群的机构。

08-04 20:41重要

美股盘前要闻一览:光通信、存储板块盘前大涨;全球最小GPU芯片通过实测;机构称英伟达评估下调Rubin Ultra平台的HBM配置

火星财经消息,投资者需重点关注的美股市场财经要闻如下:1、美三大股指期货集体上行。道琼斯指数期货涨1.25%,标普500指数期货涨0.35%,纳斯达克100指数期货涨1.11%。2、国际油价集体下挫。WTI原油期货价格跌3.33%,报77.663美元/桶;布伦特原油期货价格跌2.57%,报81.621美元/桶。消息面上,美财长贝森特称,美国可能明日与伊朗达成协议以开放霍尔木兹海峡。3、国际金银现货集体走高。现货黄金价格涨0.43%,报4072.67美元/盎司;现货白银价格涨2.72%,报59.74美元/盎司。4、欧洲三大股指集体上涨。英国富时100指数涨0.34%,法国CAC40指数涨0.32%,德国DAX30指数涨0.82%。5、美股光通信板块盘前大幅拉升,Coherent涨超13%,Lumentum涨超12%,康宁、迈威尔科技涨近8%。存储股普涨,闪迪涨超5%,美光科技、SK海力士涨超4%。6、AI应用股Palantir盘前大涨15%。公司二季度营收19.4亿美元,高于市场预期,并上调全年营收指引至81.5亿-81.6亿美元。7、全球最小GPU芯片TinyGPU v2.0据悉通过实机测试。该芯片约有24万个晶体管,具备4-bit双缓冲,以及存储在QSPI RAM中的8-bit深度缓冲。8、SpaceX正在设计其卫星系统,以适应由人工智能、机器学习和边缘计算驱动的数据需求的爆炸式增长,其目标是部署一个最多达一百万颗卫星的系统。与此同时,SpaceX将于今晚美股盘后交出其上市后的首份成绩单。9、集邦咨询表示,DRAM供不应求格局将延续至2027年,英伟达评估下调Rubin Ultra平台的HBM配置。部分云端服务供应商也正考虑调降下一代自研ASIC的HBM容量设计。10、马斯克7月单月身价缩水3630亿美元,这一缩水幅度超过了全球第2至第10大富豪中任何一人的全部身家。(财联社)