返回 7*24 快讯
来源MarsBit

谷歌开源文本扩散模型DiffusionGemma:单卡超千Token每秒,速度提升4倍

据动察 Beating 监测,谷歌发布实验性开源大模型 DiffusionGemma,采用基于扩散(diffusion)的全新文本生成机制,打破了传统大语言模型逐词顺序生成的限制。DiffusionGemma 拥有 26B 总参数量,在混合专家(MoE)架构下每次前向传播仅激活 3.8B 参数,通过并行生成整块文本,在本地 GPU 推理中实现高达 4 倍的速度提升。 与传统的「打字机式」逐词生成不同,DiffusionGemma 的工作原理类似于图像生成,先在画布上生成随机占位符,再通过多轮时间步迭代擦除噪点并锁定正确文本。每次前向传播可并行生成 256 个 Token,使所有 Token 均能实现双向注意力交互。双向注意力机制在代码填充、行内编辑和数学公式生成等非线性生成任务中具有显著优势,但 DiffusionGemma 的整体输出质量目前仍低于标准 Gemma 4。 在硬件测试与推理速度表现上,单张 NVIDIA H100 显卡可实现每秒 1000 个以上的 Token 生成速度,消费级 NVIDIA GeForce RTX 5090 显卡也超过 700 个 Token。经过 4-bit 浮点(NVFP4)量化后,推理显存占用可降至 18GB 以内,显著降低了本地部署门槛。 DiffusionGemma 权重已在 Hugging Face 开源,并获得 MLX、vLLM、Unsloth 及 NVIDIA NeMo 等主流开发工具支持。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-05 12:40

Cursor重排GPU流水线,MoE模型训练提速41%

据动察 Beating 监测,Cursor 开源 Mixture-of-Kittens(MoK),用于加速 MoE 大模型训练。它把原本分开的 GPU 数据传输和计算,合进一个 kernel(直接在 GPU 上运行的底层程序)。 MoE 会把模型拆成大量「专家」,每次只调用其中一部分。专家分散在不同 GPU 上,数据需要频繁搬运,有时会占掉一半以上的训练时间。 MoK 让 GPU 一边传数据,一边做计算,减少等待。在 512 块 GB300 GPU 的实际训练中,整体吞吐提高 41%。单独测试 MoE 层时,最高比公开方案快 2.37 倍。 MoK 已用于 Cursor 数万块 GPU 的 Composer 训练,并以 Apache 2.0 开源。目前只支持英伟达 Blackwell GPU,主要面向拥有 GB200、GB300 NVL72 集群的机构。

07-15 13:03

预测市场Kalshi推出GPU价格预测市场,覆盖Nvidia B200、H200和A100芯片

火星财经消息,7 月 15 日,预测市场 Kalshi 宣布推出 GPU 计算前向曲线,覆盖 Nvidia B200、H200 和 A100 芯片,提供市场预期的未来计算价格预测。

06-27 11:08重要

观点:廉价开源模型泛用导致H100GPU现货租赁价格下跌及token价格指数回落

火星财经消息,6 月 27 日,投研机构 Silicon Data 发布数据指出,廉价开源模型泛用导致 H100 GPU 现货租赁价格下跌及 token 价格指数回落,但该机构认为这并不代表 AI 整体需求减弱,并指出用户大规模转向廉价开源模型反而推动整体计算消耗增加,维持了对高端计算资源的需求。

06-04 23:47

英伟达正式开源旗舰级550B模型Nemotron 3 Ultra:首创Mamba-Transformer混合MoE架构,专为长程智能体而生

据动察 Beating 监测,英伟达于 6 月 4 日正式开源 5500 亿参数、激活 550 亿的旗舰大语言模型 Nemotron 3 Ultra,针对复杂规划、推理和工具调用等长程智能体任务进行了优化。在第三方基准平台 Artificial Analysis 的智能指数中,Nemotron 3 Ultra 得分 48 分,是目前美国本土性能最强的开源权重模型,仅次于月之暗面得分 54 分的 Kimi K2.6。 技术架构上,模型采用 Mamba-Transformer 混合专家架构 MoE,通过交替使用 Mamba-2 状态空间模型层与 Transformer 自注意力层,规避了超长上下文下 KV 缓存呈二次方增长的内存瓶颈,在极低内存开销下支持 100 万 token 的上下文窗口。相比同规模 dense 模型,混合架构在智能体任务下提升了 5 倍吞吐量,并降低了 30% 的推理成本。 生态配套上,英伟达同步发布了包含 NemoClaw 编排蓝图与 OpenShell 运行时的智能体工具包 Agent Toolkit。开源内容直接包含模型权重、数据集与训练配方。模型已在 Hugging Face、NVIDIA NIM 及 OpenRouter 上线,企业级 AI 搜索服务商 Glean 等已宣布接入,用作商业闭源大模型的替代方案。

05-21 09:17

Cohere开源Command A+:218B参数MoE大模型,主打企业级Agent与数据主权

据动察 Beating 监测,Cohere 正式开源 2180 亿参数的稀疏混合专家模型 Command A+,采用 Apache 2.0 协议支持企业级 Agent 构建与私有化部署。新模型专为关键基础设施的数据主权需求设计,支持企业在无厂商锁定的情况下进行物理隔离部署。 新模型总参数量为 2180 亿(218B),但单次推理仅激活 250 亿(25B)参数,实现了计算效率与生成性能的平衡。优化后的推理效率使其仅需两张 NVIDIA H100 或单张 B200 GPU 即可运行,Hugging Face 也同步上线了 W4A4 等低精度量化版本,进一步降低了部署门槛。 Command A+ 原生支持多模态图文输入,提供 12.8 万(128K)Token 的输入上下文窗口以及 6.4 万 Token 的输出长度。它针对复杂的逻辑推理、自主工具调用、数据库查询等 Agentic 工作流以及长文档处理进行了深度优化,并支持包含所有欧盟官方语言在内的 48 种语言。

07-25 11:18

AMD发布全开源MoE大模型Instella-MoE,16B参数规模挑战主流开源模型

火星财经消息,7 月 25 日,AMD 宣布推出全开源混合专家模型(MoE)Instella-MoE,该模型拥有 160 亿总参数,每个 Token 激活 28 亿参数,号称在同规模开源语言模型中具备领先性能。 AMD 表示,Instella-MoE 完全基于自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 软件栈从零训练完成,并采用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架构创新,以提升训练和推理效率。 性能测试显示,Instella-MoE-16B-A3B 基础模型平均得分达到 76.7 分,在全开源模型中排名领先,超过 SmolLM3-3B、OLMo-3-7B 等模型,并在仅激活 28 亿参数的情况下,与更大规模模型竞争。 此外,该模型支持 64K Token 长上下文处理,并完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等完整训练流程。 AMD 此次同步公开 Instella-MoE 全部模型权重、训练配置、数据配比、中间检查点及推理代码,推动开放 AI 模型研究与复现。 AMD 表示,Instella-MoE 展示了基于 AMD 硬件和开放软件生态进行大规模 MoE 模型训练的能力,未来将继续推进更大规模、更强推理能力和更高效率的开源语言模型研发。