报告:中国数据中心容量达24GW,超EMEA与亚洲其他地区总和
相关推荐
SemiAnalysis:TTFT被高估?大模型推理瓶颈在于权衡交互性与吞吐
PANews 7月11日消息,SemiAnalysis发文指出,大模型推理中常被引用的“首token延迟”(TTFT, time-to-first-token)可能被市场过度关注,推理系统的核心维度并非“越快越好”,而是在“单用户交互速度(tok/s/user)”与“整体吞吐效率(tok/s/GPU)”之间的权衡。在多数场景中,TTFT对体验影响有限,但生成阶段的Token速度才是关键变量。 SemiAnalysis总结称,仅约10%–20%的推理任务真正受限于延迟,其余大部分场景更依赖吞吐与成本效率优化。
SemiAnalysis拆解AI推理:内存带宽比容量更重要,调度层成关键
动察 Beating AI 快讯,研究机构 SemiAnalysis 发布报告,系统拆解大模型推理服务的底层架构。报告认为,随着 MoE 模型成为主流,AI 推理已从单一计算任务演变为由预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)组成的复杂流水线,不同阶段对算力、内存带宽和网络的需求存在明显差异。 在多数推理场景下,内存带宽比容量更具经济价值。高带宽内存可提升 Token 生成效率,而闲置的 HBM 只会增加成本。SemiAnalysis 预计,2027 年单个流水线阶段可能需要约 400 至 500GB 本地快速内存,但已完成处理的 KV 缓存应及时迁移至 CPU DRAM 及更低成本的网络存储,避免占用稀缺的 HBM 资源。 调度层将成为 AI 推理基础设施的关键环节。预填充和中间填充的处理时间相对可预测,而解码时长存在较大波动,容易造成任务积压和「延迟反馈震荡」。因此,稳定的缓冲机制、跨时间尺度的调度和 KV 缓存分级管理,将直接影响推理集群的吞吐效率。 在架构选择上,报告比较了聚合式和分离式两种方案:前者将 Prefill 和 Decode 集中在同一设备上,可减少 KV 缓存跨节点传输,但要求硬件同时具备高计算密度和高内存带宽;后者则针对不同阶段配置专用节点,能够实现硬件优化,但会增加数据搬运和网络开销。SemiAnalysis 认为,两种架构的取舍最终取决于未来能否出现兼具高算力和高内存带宽的「全能型」加速器。 报告还通过模拟器预测 Kimi K3 在英伟达 B200、B300 和 GB200 系统上的表现。结果显示,GB200 在部分低延迟场景具备优势,而多数前沿配置的单 GPU HBM 峰值驻留量低于 80GB,进一步凸显内存带宽和存储编排的重要性。
SemiAnalysis 今年营收预计超 1 亿美元
火星财经消息,据 Substrate 9 月 18 日报道,半导体与 AI 基础设施研究机构 SemiAnalysis 今年营收预计超过 1 亿美元,员工规模约 100 人。其创始人 Dylan Patel 于 2020 年以 WordPress 博客起步,2023 年营收达到七位数,订阅收入不到总营收的 5%,绝大部分来自数据模型、机构研究产品 Core Research 与咨询业务。目前公司拥有 12 个模型,覆盖网络、晶圆厂设备、代工、能源等领域,分析师约 50 人。SemiAnalysis 的客户涵盖全球多数大型科技公司,Nvidia 首席执行官黄仁勋、AMD 首席执行官苏姿丰、Meta 首席执行官扎克伯格、微软首席执行官纳德拉及 OpenAI 首席执行官奥特曼均为其读者。其 CoWoS 与 HBM 供应链模型曾预测 Nvidia 每季度出货 40 万颗 H100,OpenAI 在 Hot Chips 发布自研芯片 Jalapeño 时采用其 InferenceX 作为第三方基准。Dylan Patel 近期募集了 5 亿美元的 SemiAnalysis Capital Fund I,用于早期初创投资。公司计划向能源领域扩张,分析师将实地接触不同电网与公用事业相关方。
Citrini Research被SemiAnalysis收购,创始人拟成立新基金
动察 Beating AI 快讯,「AI 末日报告」发布机构 Citrini Research 创始人 James van Geelen 已将公司出售给芯片及 AI 研究机构 SemiAnalysis,交易金额尚未披露。Van Geelen 暂时将继续担任 Citrini CEO,并计划筹建一只新基金。 Citrini 目前在 Substack 拥有约 26 万名订阅者,今年 2 月因发布《2028 全球智能危机》报告走红。该报告设想 AI 快速取代白领岗位,引发市场对 AI 冲击就业和经济的讨论,并一度对软件股造成明显影响。 SemiAnalysis 由 Dylan Patel 于 2020 年创立,长期专注半导体和 AI 基础设施研究。Patel 表示,此次收购旨在扩大研究规模,并探索投资研究在 AI 时代的新形态。 Van Geelen 本人未透露新基金具体信息。此次交易也意味着 Citrini 在快速扩大影响力后,将与 SemiAnalysis 的半导体、AI 研究能力进一步结合。
Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和
动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。
SemiAnalysis:三星目前拥有最好的HBM4技术,海力士和美光面临挑战
火星财经消息,8 月 31 日,SemiAnalysis 发布最新一期播客节目,其中指出,SK 海力士和美光在实现最高的 HBM4 速度方面一直面临挑战。特别是 SK 海力士不得不重新设计其基础芯片,导致 HBM4 供应给 NVIDIA Rubin 平台的交付延后。 三星目前拥有最好的 HBM4 技术。博通传统上高度依赖三星为其 HBM 供应。三星在 HBM3E 一代的表现不佳,这对博通的 ASIC 构成了劣势。然而,现在三星凭借 HBM4 领先于其竞争对手,这种相同的供应链关系已成为 Jalapeño 的优势。