Citrini观点:英伟达护城河依然深厚,HBM4成本翻倍推升Rubin售价,高毛利与强定价权未受动摇
相关推荐
Citrini分析师:Rubin Ultra下调HBM堆叠层数未必利空,或扩大HBM总需求
火星财经消息,8 月 30 日,Citrini 分析师 Jukan 发文表示,据其消息来源,英伟达 Rubin Ultra 所采用的 HBM 规格可能由 12 层 HBM4E 下调至 8 层,OpenAI 和 Anthropic 等客户甚至曾要求采用 4 层产品,但遭存储厂商拒绝,目前降规可能止步于 8 层。其认为,降规主要源于良率及成本压力:若采用 12 层 HBM4E 并计入涨价,内存成本可能占 Rubin Ultra 整体物料成本的约 70%。 模型量化、MLA 以及计算任务拆分等软件优化,正将低频访问的 KV 缓存和模型状态转移至 LPDDR、CXL 及 NAND,HBM 主要保留当前计算所需的工作集。因此,在满足最低容量后,客户对 HBM 带宽的重视程度开始超过容量。 其认为,降低堆叠层数可提高封装良率、增加 HBM 及 AI 加速器出货量,反而可能扩大 HBM 总需求;更高带宽要求还会降低晶圆中通过速度分档的芯片比例,进一步消耗 DRAM 晶圆产能。长期来看,HBM 终将被新架构替代,最终方向可能是存储与逻辑芯片融合,未来两年将成为存储厂商能否向逻辑领域扩张的关键阶段。
中科曙光发布scaleFabric Token加速技术体系
火星财经消息,近日,中科曙光发布scaleFabric Token加速技术体系,实现IBGDA技术在国内首次规模化应用。该体系以原生无损RDMA高速网络为基础,构建“算存传”三级紧耦合的Token加速超级通道,其中,支持GPU直接发起网络通信的IBGDA技术实现在国内的首次规模化落地,已在十万卡级大规模集群中完成验证。目前,scaleFabric已经完成DeepEP等通信框架适配,并通过IBGDA、存储直通等技术提升Token流转效率,为国产大模型提供新的高速互连选择。
Nscale达成超60亿美元战略协议,潜在部署10万颗英伟达GPU
Odaily星球日报讯 AI 算力公司 Nscale 宣布与 Figure 签署多年战略合作伙伴关系,规模扩大至超过 60 亿美元。该交易代表了部署多达 10 万颗英伟达 Vera Rubin 平台 GPU 的潜力。(pressreleasehub)
观点:LLM Token价格腰斩并不意味着AI需求转弱,GPU算力租赁市场仍显示需求强劲
BlockBeats 消息,9 月 24 日,专业数据机构 Silicon Data 发文称,市场近期频繁引用其 LLM Token Index 作为看空 AI 交易的依据,但该指标下跌并不意味着 AI 需求或模型层利润正在走弱。 Silicon Data 表示,其 LLM Token Index 衡量的是样本中 API 用户每百万 Token 实际支付的价格,即「使用量加权价格」,并非 Token 使用量或总支出。该指数从 5 月 28 日的 2.07 美元降至 9 月 21 日的 1 美元,下降 52%,但今年 1 月至 5 月高点期间曾上涨 67%,因此价格变化本身不能直接作为 AI 行业景气度指标。 该机构指出,指数近期下跌主要反映更多任务被分配给廉价、快速的模型,同时 AI 实验室持续推出更多中端模型。由于 Token 并不能完全代表 AI 能力,该指标也无法单独区分模型替代与更高效的 Agent 路由。 相比之下,GPU 算力租赁市场仍显示需求强劲。Silicon Data 数据显示,非超大规模云厂商 H200 租赁价格从 6 月平均 2.87 美元升至目前 3.29 美元,9 月 19 日一度达到 3.32 美元;B200 目前为 5.76 美元,较同期上涨 7%,年初至今上涨 31%;B300 自 4 月底推出以来上涨 44%。 Silicon Data 认为,随着 Agent 大规模应用,未来绝大多数 Token 可能来自廉价、快速模型,因此 Token 价格可以持续下降,同时总 Token 使用量仍大幅增长。该机构表示,真正高价值的任务仍可能集中在前沿模型上,而 AI 全面普及意味着对算力的需求可能「更多,而不是更少」。
消息称英伟达Rubin Ultra芯片拟改用8层HBM
火星财经消息,据业界消息,英伟达正考虑将下一代Rubin Ultra人工智能加速器的高带宽内存(HBM)方案,从此前的12层堆叠调整为8层。在存储成本不断上涨的背景下,英伟达更加重视单位带宽成本以及整机系统的经济性。 (台湾电子时报)
招商策略:AI芯片市场正在形成GPU与定制ASIC并行发展的格局
火星财经消息,招商策略称,本周海外大模型竞争再度明显升温:OpenAI于9月4日发布GPT-6 Astra,Anthropic于9月2日推出Claude Fable 5.1与Claude Mythos 5.1,谷歌在同日发布Gemini 3.8 Flash,三家头部厂商在极短时间内完成新一轮旗舰或主力模型更新。从三个模型的共性趋势看,实际生产效率成为衡量前沿模型价值的重要标准,科研能力是旗舰模型最关注的细分方向之一。与此同时,不同厂商的产品路线也进一步分化:OpenAI强化计算机操作能力,Anthropic继续深耕Agent,谷歌则依靠Flash系列强化性能、速度与成本之间的平衡。ASIC放量重塑算力格局。博通最新财报进一步确认,AI算力正在加速重构,定制芯片成为AI算力扩张的重要环节。FY2026 Q3公司营收创历史新高,并给出未来两个财年的AI半导体收入指引,定制ASIC进入规模化部署阶段,并逐步成为头部模型厂商和云厂商优化推理成本、能耗和系统效率的重要选择。随着谷歌、Anthropic、OpenAI、Meta等客户推进多代XPU项目,AI芯片市场正在形成GPU与定制ASIC并行发展的格局。(财联社)