返回 7*24 快讯
来源MarsBit

英伟达正式开源旗舰级550B模型Nemotron 3 Ultra:首创Mamba-Transformer混合MoE架构,专为长程智能体而生

据动察 Beating 监测,英伟达于 6 月 4 日正式开源 5500 亿参数、激活 550 亿的旗舰大语言模型 Nemotron 3 Ultra,针对复杂规划、推理和工具调用等长程智能体任务进行了优化。在第三方基准平台 Artificial Analysis 的智能指数中,Nemotron 3 Ultra 得分 48 分,是目前美国本土性能最强的开源权重模型,仅次于月之暗面得分 54 分的 Kimi K2.6。 技术架构上,模型采用 Mamba-Transformer 混合专家架构 MoE,通过交替使用 Mamba-2 状态空间模型层与 Transformer 自注意力层,规避了超长上下文下 KV 缓存呈二次方增长的内存瓶颈,在极低内存开销下支持 100 万 token 的上下文窗口。相比同规模 dense 模型,混合架构在智能体任务下提升了 5 倍吞吐量,并降低了 30% 的推理成本。 生态配套上,英伟达同步发布了包含 NemoClaw 编排蓝图与 OpenShell 运行时的智能体工具包 Agent Toolkit。开源内容直接包含模型权重、数据集与训练配方。模型已在 Hugging Face、NVIDIA NIM 及 OpenRouter 上线,企业级 AI 搜索服务商 Glean 等已宣布接入,用作商业闭源大模型的替代方案。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

06-16 18:23重要

Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍

据动察 Beating 监测,评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。 在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。 模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。 作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。

08-03 14:37

SemiAnalysis:英伟达Rubin Ultra主线版本HBM或降至192GB,数据中心供电与HBM供应成关键约束

BlockBeats 消息,8 月 3 日,研究机构 SemiAnalysis 发布报告称,英伟达向关键客户预览的 Rubin Ultra 规格低于此前市场预期。报告称,Rubin Ultra 主线 SKU 仍将采用 HBM4,理论峰值 FLOPs 保持不变,但 HBM 配置降至 8-Hi、192GB,低于此前 Rubin 的 12-Hi、288GB。芯片级功耗约为 1800W,与初期 Rubin 出货版本相近。 报告指出,Rubin Ultra 当前路线图的主要升级点集中在 NVL576 级别的规模化互联。其中一个系统形态为 8 个 72 GPU 机架互联,并采用 NPO 实现交换机间跨机架连接。SemiAnalysis 认为,该形态是目前较具可能性的候选方案之一。 SemiAnalysis 表示,英伟达仍可能提供 2600W 至 2800W 的 Max-P 高功耗版本,另有面向 token decode 等较低计算负载的 1200W 版本。1800W Max-Q 版本则更符合当前数据中心供电受限环境,在 FLOPs/Watt 维度更具部署效率。 SemiAnalysis 认为,英伟达调整 Rubin Ultra 规格,核心原因在于 HBM 供应紧张及数据中心供电约束。降低 HBM 容量和功耗规格,有助于提升客户部署可行性,降低物料成本,并缓冲明年 HBM 涨价压力。

07-06 08:48

SemiAnalysis:英伟达多项AI机架级架构延期或调整,Rubin Ultra扩展路径受限

火星财经消息,7 月 6 日,SemiAnalysis 发文表示,英伟达最新机架级互联架构 Kyber NVL144 在发布仅 3 个月后即出现重大调整,由原计划推迟超过 12 个月至 2028 年,主要原因是 PCB 平面设计在制造可行性方面仍面临挑战。 同时,NVL72x2 背靠背机架架构已被取消。该方案原本用于通过将两个 Oberon 机架背靠背部署来提升纯铜 NVLink 扩展能力,但由于其结构复杂以及对超大规模云厂商(CSP)带来较高运维负担,遭到市场强烈质疑并最终被放弃。 由于 CPO(共封装光学)技术尚未成熟,英伟达基于 CPO NVSwitch 的更大规模扩展方案(如 NVL576)也可能继续延迟,或仅限小批量试产。这意味着在 CPO 成熟之前,英伟达缺乏稳定的大规模 scale-up 解决方案。 此外,Rubin Ultra 产品路线也发生变化:原先规划的「四计算芯片」版本被取消,仅保留「双计算芯片」版本,整体系统级性能规模预计降至原方案约一半。 这一系列调整意味着英伟达在 Rubin Ultra 世代的 scale-up 扩展能力受到限制。在 CPO NVSwitch 于 Feynman 架构之前无法落地的情况下,竞争对手如 AMD MI500X 或谷歌 TPU v8i 在大规模训练集群的扩展能力上可能获得相对窗口期。与此同时,英伟达预计将通过大量出货 Oberon Rubin 机架及其「Ultra」版本来填补产品过渡期的市场需求,并维持整体供应链节奏。

06-21 15:19

Citrini对垒SemiAnalysis?SemiAnalysis创始人对呛Citrini研究员,称3月份就已向客户透露Rubin Ultra 12 Hi相关消息

Odaily星球日报讯 近日,两大知名投研机构 Citrini 与 SemiAnalysis 之间再次爆发争论。Citrini 研究员 Zephyr 援引相关消息称,“Rubin Ultra HBM 性能实际上已经降到了 12 Hi 的水平,而且他们甚至还没有开始使用 HB 技术。 在 2027 年,他们不会使用 16 Hi 芯片。目前,混合键合技术对于 HBM 来说非常昂贵(其产率极低)。 BESI 在短期内最大的优势在于:台积电在其芯片制造和封装环节中采用了混合键合技术,从而实现 EIC 和 PIC 的集成,进而提升 CPO 的生产效率。”对此,Citrini 研究员 Jukan 于评论区附上相关推文表示,“我早在四月的时候就告诉过你了。” 针对此事,SemiAnalysis 创始人 Dylan Patel 转发 Discord 截图消息表示:“在 3 月份,使用 SemiAnalysis Memory 和 Accelerator 模型的客户就已经得知 Rubin Ultra 16 Hi 会被替换为 12 Hi 版本的消息。” 此前,Citrini 研究员 Jukan 曾援引相关消息称“英伟达计划大砍新一代机架内存配置”,彼时美股、韩股内存板块一度集体大跌。SemiAnalysis 创始人 Dylan Patel 澄清表示,该消息断章取义,过于标题党了。

06-04 12:44

阶跃 Step 3.7 Flash 位列 Artificial Analysis 输出速度榜主流第一

火星财经消息,大模型评测平台Artificial Analysis最新Output Speed榜单显示,阶跃星辰(StepFun)最新开源基座模型Step 3.7 Flash以409 tokens/s的输出速度位列主流模型第一,同时在端到端响应时长(End-to-End Response Time)、智能效率(Intelligence vs. Output Speed)与速度价格比(Output Speed vs. Price)等关键指标上均处于领先位置。

05-21 14:45

ArtificialAnalysis:千问3.7问鼎国产模型冠军,全球前五

火星财经消息,5月21日,三方机构ArtificialAnalysis公布了最新的全球大模型榜单,阿里新发布的旗舰模型Qwen3.7-Max得分56.6分,性能接近GPT、Claude、Gemini的最强模型,位列全球第五、国产第一。据了解,Qwen3.7-Max即将上线阿里云百炼对外提供API服务。