返回 7*24 快讯
来源Blockbeats

SemiAnalysis拆解企业AI预算:Meta曾单月消耗70万亿tokens,但真正的风险不是客户不用AI了

BlockBeats 消息,7 月 1 日,企业 AI 使用正在从「尽量多用」转向「有额度地用」。SemiAnalysis 在 7 月 1 日发布的 Token Budgeting 报告中称,年初一度流行的 tokenmaxxing,也就是鼓励员工尽可能多消耗 AI token 以提升生产力,正在被更现实的预算制度取代。但该机构认为,媒体关于企业削减 AI 支出的叙事被夸大了,OpenAI 和 Anthropic 的 API 业务在今年下半年并未面临实质性预算风险。 SemiAnalysis 团队称,他们通过 Slack、电话以及 Databricks AI Summit 与 50 多家企业客户交流后发现,大多数公司确实开始设置 AI 使用上限,但并没有形成统一标准。低端预算可能只有每人每月 250 至 500 美元,高端预算则可达到每月 2000 美元甚至数万美元。一家美国大型航空航天与国防制造商把部分员工的月度额度设在 250 美元,一家大型制药公司设在 500 美元;Workday、Stripe 等技术更前沿的企业,部分员工预算约为每月 2000 美元。 这与年初的「token 最大化」形成对比。报告提到,Meta 和 Salesforce 等公司曾鼓励员工大量使用 AI 工具。Meta 内部甚至出现过一个名为「Claudeconomics」的仪表盘,对公司前 250 名重度用户进行排名。数据显示,Meta 员工在 30 天内消耗超过 60 万亿 tokens,单个最高用户消耗约 2800 亿 tokens。该仪表盘在相关报道后两天被关闭。Uber 也被报道称在四个月内消耗完 Claude Code 和 Codex 的年度预算,随后设置了每人每月 1500 美元的限额,超额申请需逐案审批。 但 SemiAnalysis 认为,这些极端案例更多反映激励机制和管理松散,而不是企业 AI 支出整体见顶。报告称,前 10% 高消费客户贡献了 AI 实验室大部分收入,这些客户在今年剩余时间削减 API 支出的风险很低。即便 Meta 在 2 月每月消耗约 70 万亿 tokens,并且按标价计算每名员工每年花费接近 5 万美元,SemiAnalysis 估计其仍只占 Anthropic 收入的 3% 至 5%。 企业支出分布也高度不均。SemiAnalysis 引用 Ramp 数据称,前 1% 客户每名员工年均 A
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-04 07:37

SemiAnalysis:AMD股价若涨至600至700美元,Meta与OpenAI的GPU资本成本或降至零

BlockBeats 消息,8 月 4 日,半导体与 AI 独立研究机构 SemiAnalysis 发文表示,AMD 于去年末及今年初分别与 Meta、OpenAI 达成协议,向两家公司提供与业绩挂钩的认股权证。相关权证将根据最多 6GW AMD Instinct GPU 的采购及部署进度归属,同时还取决于 AMD 股价能否跨越多个门槛,最高门槛为 600 美元。 AMD 股价已由 2026 年初约 200 美元升至目前约 500 至 600 美元。假设与股价相关的权证归属大致呈线性变化,且 6GW 容量全部完成部署,Meta 与 OpenAI 每颗 GPU 的小时资本成本将分别由约 2.15 美元和 2.50 美元,降至约 1.60 美元和 1.75 美元。 SemiAnalysis 表示,若 AMD 股价升至 600 至 700 美元区间,两家公司仅就 GPU 而言的资本成本可能实际降至零。若 AMD 持续改善软件栈、获得更多大型客户订单,并推动股价升至 1000 美元以上,则包括服务器设备、网络及 CPU 在内的整个集群资本成本,理论上也可能降至接近零。

08-14 08:58

OpenAI把GPT-5.6 Sol提速14倍:750 token/s先上API

据动察 Beating 监测,OpenAI 开始预览 GPT-5.6 Sol 的 Ultrafast 模式。它由 Cerebras 提供算力,最高输出速度达到 750 token/s,最高是 Standard 模式的 14 倍。目前只向少量 API 客户开放。 OpenAI 已在故障排查、研究、客服、金融分析和开发 Agent 等场景中测试 Ultrafast。对于需要连续多次调用模型的 Agent,单次响应提速也能直接缩短整个任务的执行时间。 这比 OpenAI 7 月底推出的 Fast 模式又快了一档。Fast 模式最高是 Standard 的 2.5 倍,Ultrafast 则把上限推到 14 倍。OpenAI 暂未公布 Ultrafast 的价格,也没有宣布何时进入 ChatGPT。

08-06 10:58

Meta推出首款AI编程智能体

火星财经消息 8月6日,Meta正式发布首款AI编程智能体Muse Code,基于其最新的AI模型Muse Spark 1.2构建,定位为竞争对手产品的低价替代方案。据悉,这款编程智能体与Anthropic的Claude和OpenAI的Codex助手类似,使用户能够在单一界面内更轻松地构建应用程序,同时管理大量支持软件开发流程的AI数字智能体。Meta人工智能负责人Alexandr Wang表示:“你可以通过一条命令安装它,然后使用它来完成各种用例下的完整软件工程任务,包括规划变更、编写代码、验证结果。”目前,Muse Code以测试版或预览版形式提供,可与Muse Spark 1.2协同工作。开发者可通过按需付费模式使用该智能体,其API定价与Muse Spark 1.1版本类似,每百万输入tokens 1.25美元,每百万输出tokens 4.25美元。(广角观察)

08-10 00:13

SemiAnalysis:SpaceX 2027年新增算力或超10GW,年度经常性收入有望达3000亿美元

BlockBeats 消息,8 月 10 日,SemiAnalysis 最新报告指出,在对 SpaceX 所有适建站点及可用燃气发电设备进行评估后,该机构认为,SpaceX 在 2027 年底前新增超过 10GW 算力的目标具备可行性。马斯克此前在 SpaceX 首次业绩发布会上表示,公司「保守」目标是在 2027 年单年新建并交付 6 至 8GW 增量算力,上行空间可能超过 10GW。按每 GW 约 500 亿美元资本开支计算,对应 2027 年资本支出或达 3000 亿至 5000 亿美元。 SemiAnalysis 认为,AI 推理业务的高利润率是算力需求扩张的重要驱动力。其模型显示,OpenAI 和 Anthropic 在 GB300 集群上提供 API 推理服务时,每 GW 每年可产生超过 1000 亿美元收入;若按每 GPU 每小时 3 美元的租赁价格计算,每 GW 年成本约 120 亿美元,推理毛利率超过 60%,部分旗舰模型可超过 85%。 微软的算力缺口可能为 SpaceX 带来大额订单。SemiAnalysis 估算,微软 2025 年 10 月与 OpenAI 签署的 2500 亿美元基础设施即服务协议对应约 7GW 算力,并称微软今年迄今已通过租赁、自建及长期购电协议等方式签署超过 10GW 的绑定合同。该机构认为,微软与 SpaceX 签署约 3GW、总价值约 1500 亿美元算力合同「并非不可能」,其中一个原因是 SpaceX 可提供 90 天取消条款,从而降低微软的财务风险。 报告同时指出,SpaceX 的优势在于快速建设算力基础设施,例如 Colossus 1 的 300MW 设施在 122 天内建成,Southaven 电厂容量在数月内由约 495MW 扩张至 1.7GW。SemiAnalysis 预计,若 SpaceX 2027 年新增算力中有一半用于商业推理,其余用于 Grok 和 Cursor 团队训练,公司年度经常性收入到 2027 年底可能达到 3000 亿美元。

08-03 14:37

SemiAnalysis:英伟达Rubin Ultra主线版本HBM或降至192GB,数据中心供电与HBM供应成关键约束

BlockBeats 消息,8 月 3 日,研究机构 SemiAnalysis 发布报告称,英伟达向关键客户预览的 Rubin Ultra 规格低于此前市场预期。报告称,Rubin Ultra 主线 SKU 仍将采用 HBM4,理论峰值 FLOPs 保持不变,但 HBM 配置降至 8-Hi、192GB,低于此前 Rubin 的 12-Hi、288GB。芯片级功耗约为 1800W,与初期 Rubin 出货版本相近。 报告指出,Rubin Ultra 当前路线图的主要升级点集中在 NVL576 级别的规模化互联。其中一个系统形态为 8 个 72 GPU 机架互联,并采用 NPO 实现交换机间跨机架连接。SemiAnalysis 认为,该形态是目前较具可能性的候选方案之一。 SemiAnalysis 表示,英伟达仍可能提供 2600W 至 2800W 的 Max-P 高功耗版本,另有面向 token decode 等较低计算负载的 1200W 版本。1800W Max-Q 版本则更符合当前数据中心供电受限环境,在 FLOPs/Watt 维度更具部署效率。 SemiAnalysis 认为,英伟达调整 Rubin Ultra 规格,核心原因在于 HBM 供应紧张及数据中心供电约束。降低 HBM 容量和功耗规格,有助于提升客户部署可行性,降低物料成本,并缓冲明年 HBM 涨价压力。

07-31 23:18

OpenAI:活跃用户超10亿,将通过全栈建设降低AI成本

BlockBeats 消息,7 月 31 日,OpenAI 发文表示,AI 基础设施的价值不在于规模本身,而在于以更低成本向更多用户提供更强大的智能。公司正在构建覆盖基础设施、模型、平台与产品的完整体系,通过更强模型推动采用增长,再以收入、真实反馈和需求数据支持下一代研究及基础设施投资。 OpenAI 昨日将 GPT-5.6 Luna 价格下调 80%,输入与输出价格分别降至每百万 Token 0.20 美元和 1.20 美元;GPT-5.6 Terra 降价 20%,分别为 2 美元和 12 美元。GPT-5.6 Sol 的 Fast 模式可在智能水平不变的情况下,将处理速度提高至多 2.5 倍,价格为标准模式的两倍。 公司表示,GPT-5.6 Sol 已协助优化模型生产服务软件,使端到端服务成本下降 20%,并将推测解码效率提高逾 15%。目前,OpenAI 模型覆盖超过 10 亿活跃用户及 200 多万家企业。目标并非单纯建设更多算力或更大的模型,而是在可信需求基础上部署适当容量,让有用智能变得更强、更便宜,并惠及更广泛的用户。