SemiAnalysis拆解AI推理:内存带宽比容量更重要,调度层成关键
相关推荐
Citrini Research被SemiAnalysis收购,创始人拟成立新基金
动察 Beating AI 快讯,「AI 末日报告」发布机构 Citrini Research 创始人 James van Geelen 已将公司出售给芯片及 AI 研究机构 SemiAnalysis,交易金额尚未披露。Van Geelen 暂时将继续担任 Citrini CEO,并计划筹建一只新基金。 Citrini 目前在 Substack 拥有约 26 万名订阅者,今年 2 月因发布《2028 全球智能危机》报告走红。该报告设想 AI 快速取代白领岗位,引发市场对 AI 冲击就业和经济的讨论,并一度对软件股造成明显影响。 SemiAnalysis 由 Dylan Patel 于 2020 年创立,长期专注半导体和 AI 基础设施研究。Patel 表示,此次收购旨在扩大研究规模,并探索投资研究在 AI 时代的新形态。 Van Geelen 本人未透露新基金具体信息。此次交易也意味着 Citrini 在快速扩大影响力后,将与 SemiAnalysis 的半导体、AI 研究能力进一步结合。
Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和
动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。
SemiAnalysis:HBF 非 HBM 替代,成本与散热仍存不确定性
火星财经消息,P Equity Research 与 SemiAnalysis 研究员 Nick Doyle 等在 X Space 讨论高带宽闪存 HBF。Nick 表示,目前判断 HBF 相对 HBM 的成本溢价能缩小多少仍为时过早,现有数据多为厂商说法,如 Sandisk 称每比特成本约为 HBM 的八分之一。良率、测试等会随规模改善,但 TSV、堆叠及 pSLC 模式等结构性成本永久存在,耐久性是关键未知数,若磨损超预期将推高成本。HBF 应用场景狭窄,仅面向 AI 推理,尤其是低 batch、长上下文的 MoE 模型,并非 HBM 替代品。实际带宽目标约 1.6 TB/s,属 HBM3E 级别,适合顺序读取以加载模型权重,更匹配本地或私有企业少量 GPU 的容量需求,而非超大规模带宽场景。散热可靠性尚未解决,闪存在 GPU 旁高温下会加速劣化,UCIe 分离与每日刷新等缓解措施仍未获验证。制造方面,Sandisk/Kioxia 具备 3D NAND 经验,SK Hynix 补充 HBM 式堆叠能力,但量产仍待证实。整体来看,存储正转向分层专业化市场,NAND 短缺预计持续至 2028 年,HBF 可能进一步影响供需。
SemiAnalysis创始人:2028年AI大部分算力只属于两家公司
动察 Beating AI 快讯,SemiAnalysis 创始人 Dylan Patel 在最新播客中预测,到 2028 年,OpenAI 与 Anthropic 或将占据全球 70% 至 80% 的新增 AI 算力,合计算力规模可能超过 100GW。Patel 称,两家公司目前已占全球年度新增算力约 30%,且这一比例仍在快速上升。 Patel 指出,前沿 AI 实验室的商业模式正在发生变化,AI 算力产出效率大幅提升,Anthropic 当前每兆瓦算力对应的收入已达约 5000 万美元,并可能进一步升至 1 亿美元。这使 OpenAI、Anthropic 能够以每兆瓦 2500 万至 5000 万美元的高价采购或租赁算力。 更值得关注的是,Patel 预计 2024 年至 2029 年全球 AI 相关资本开支将达到约 11 万亿美元,其中超过 5 万亿美元需要通过债务融资完成。由于 AI 基础设施的潜在回报率远高于传统行业,科技巨头可能接受更高融资成本,从而推升整体信贷利率,并对传统资产估值及高负债经济体形成挤压。 此外,Patel 认为,未来新增算力未必主要用于对外提供模型推理服务,而可能更多流向 AI 实验室内部研发和模型自我改进。
Cursor重排GPU流水线,MoE模型训练提速41%
据动察 Beating 监测,Cursor 开源 Mixture-of-Kittens(MoK),用于加速 MoE 大模型训练。它把原本分开的 GPU 数据传输和计算,合进一个 kernel(直接在 GPU 上运行的底层程序)。 MoE 会把模型拆成大量「专家」,每次只调用其中一部分。专家分散在不同 GPU 上,数据需要频繁搬运,有时会占掉一半以上的训练时间。 MoK 让 GPU 一边传数据,一边做计算,减少等待。在 512 块 GB300 GPU 的实际训练中,整体吞吐提高 41%。单独测试 MoE 层时,最高比公开方案快 2.37 倍。 MoK 已用于 Cursor 数万块 GPU 的 Composer 训练,并以 Apache 2.0 开源。目前只支持英伟达 Blackwell GPU,主要面向拥有 GB200、GB300 NVL72 集群的机构。
SemiAnalysis:英伟达Rubin Ultra主线版本HBM或降至192GB,数据中心供电与HBM供应成关键约束
BlockBeats 消息,8 月 3 日,研究机构 SemiAnalysis 发布报告称,英伟达向关键客户预览的 Rubin Ultra 规格低于此前市场预期。报告称,Rubin Ultra 主线 SKU 仍将采用 HBM4,理论峰值 FLOPs 保持不变,但 HBM 配置降至 8-Hi、192GB,低于此前 Rubin 的 12-Hi、288GB。芯片级功耗约为 1800W,与初期 Rubin 出货版本相近。 报告指出,Rubin Ultra 当前路线图的主要升级点集中在 NVL576 级别的规模化互联。其中一个系统形态为 8 个 72 GPU 机架互联,并采用 NPO 实现交换机间跨机架连接。SemiAnalysis 认为,该形态是目前较具可能性的候选方案之一。 SemiAnalysis 表示,英伟达仍可能提供 2600W 至 2800W 的 Max-P 高功耗版本,另有面向 token decode 等较低计算负载的 1200W 版本。1800W Max-Q 版本则更符合当前数据中心供电受限环境,在 FLOPs/Watt 维度更具部署效率。 SemiAnalysis 认为,英伟达调整 Rubin Ultra 规格,核心原因在于 HBM 供应紧张及数据中心供电约束。降低 HBM 容量和功耗规格,有助于提升客户部署可行性,降低物料成本,并缓冲明年 HBM 涨价压力。