谷歌开源文本扩散模型DiffusionGemma:单卡超千Token每秒,速度提升4倍
相关推荐
Cursor重排GPU流水线,MoE模型训练提速41%
据动察 Beating 监测,Cursor 开源 Mixture-of-Kittens(MoK),用于加速 MoE 大模型训练。它把原本分开的 GPU 数据传输和计算,合进一个 kernel(直接在 GPU 上运行的底层程序)。 MoE 会把模型拆成大量「专家」,每次只调用其中一部分。专家分散在不同 GPU 上,数据需要频繁搬运,有时会占掉一半以上的训练时间。 MoK 让 GPU 一边传数据,一边做计算,减少等待。在 512 块 GB300 GPU 的实际训练中,整体吞吐提高 41%。单独测试 MoE 层时,最高比公开方案快 2.37 倍。 MoK 已用于 Cursor 数万块 GPU 的 Composer 训练,并以 Apache 2.0 开源。目前只支持英伟达 Blackwell GPU,主要面向拥有 GB200、GB300 NVL72 集群的机构。
预测市场Kalshi推出GPU价格预测市场,覆盖Nvidia B200、H200和A100芯片
火星财经消息,7 月 15 日,预测市场 Kalshi 宣布推出 GPU 计算前向曲线,覆盖 Nvidia B200、H200 和 A100 芯片,提供市场预期的未来计算价格预测。
观点:廉价开源模型泛用导致H100GPU现货租赁价格下跌及token价格指数回落
火星财经消息,6 月 27 日,投研机构 Silicon Data 发布数据指出,廉价开源模型泛用导致 H100 GPU 现货租赁价格下跌及 token 价格指数回落,但该机构认为这并不代表 AI 整体需求减弱,并指出用户大规模转向廉价开源模型反而推动整体计算消耗增加,维持了对高端计算资源的需求。
英伟达正式开源旗舰级550B模型Nemotron 3 Ultra:首创Mamba-Transformer混合MoE架构,专为长程智能体而生
据动察 Beating 监测,英伟达于 6 月 4 日正式开源 5500 亿参数、激活 550 亿的旗舰大语言模型 Nemotron 3 Ultra,针对复杂规划、推理和工具调用等长程智能体任务进行了优化。在第三方基准平台 Artificial Analysis 的智能指数中,Nemotron 3 Ultra 得分 48 分,是目前美国本土性能最强的开源权重模型,仅次于月之暗面得分 54 分的 Kimi K2.6。 技术架构上,模型采用 Mamba-Transformer 混合专家架构 MoE,通过交替使用 Mamba-2 状态空间模型层与 Transformer 自注意力层,规避了超长上下文下 KV 缓存呈二次方增长的内存瓶颈,在极低内存开销下支持 100 万 token 的上下文窗口。相比同规模 dense 模型,混合架构在智能体任务下提升了 5 倍吞吐量,并降低了 30% 的推理成本。 生态配套上,英伟达同步发布了包含 NemoClaw 编排蓝图与 OpenShell 运行时的智能体工具包 Agent Toolkit。开源内容直接包含模型权重、数据集与训练配方。模型已在 Hugging Face、NVIDIA NIM 及 OpenRouter 上线,企业级 AI 搜索服务商 Glean 等已宣布接入,用作商业闭源大模型的替代方案。
Cohere开源Command A+:218B参数MoE大模型,主打企业级Agent与数据主权
据动察 Beating 监测,Cohere 正式开源 2180 亿参数的稀疏混合专家模型 Command A+,采用 Apache 2.0 协议支持企业级 Agent 构建与私有化部署。新模型专为关键基础设施的数据主权需求设计,支持企业在无厂商锁定的情况下进行物理隔离部署。 新模型总参数量为 2180 亿(218B),但单次推理仅激活 250 亿(25B)参数,实现了计算效率与生成性能的平衡。优化后的推理效率使其仅需两张 NVIDIA H100 或单张 B200 GPU 即可运行,Hugging Face 也同步上线了 W4A4 等低精度量化版本,进一步降低了部署门槛。 Command A+ 原生支持多模态图文输入,提供 12.8 万(128K)Token 的输入上下文窗口以及 6.4 万 Token 的输出长度。它针对复杂的逻辑推理、自主工具调用、数据库查询等 Agentic 工作流以及长文档处理进行了深度优化,并支持包含所有欧盟官方语言在内的 48 种语言。
AMD发布全开源MoE大模型Instella-MoE,16B参数规模挑战主流开源模型
火星财经消息,7 月 25 日,AMD 宣布推出全开源混合专家模型(MoE)Instella-MoE,该模型拥有 160 亿总参数,每个 Token 激活 28 亿参数,号称在同规模开源语言模型中具备领先性能。 AMD 表示,Instella-MoE 完全基于自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 软件栈从零训练完成,并采用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架构创新,以提升训练和推理效率。 性能测试显示,Instella-MoE-16B-A3B 基础模型平均得分达到 76.7 分,在全开源模型中排名领先,超过 SmolLM3-3B、OLMo-3-7B 等模型,并在仅激活 28 亿参数的情况下,与更大规模模型竞争。 此外,该模型支持 64K Token 长上下文处理,并完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等完整训练流程。 AMD 此次同步公开 Instella-MoE 全部模型权重、训练配置、数据配比、中间检查点及推理代码,推动开放 AI 模型研究与复现。 AMD 表示,Instella-MoE 展示了基于 AMD 硬件和开放软件生态进行大规模 MoE 模型训练的能力,未来将继续推进更大规模、更强推理能力和更高效率的开源语言模型研发。