返回 7*24 快讯
来源MarsBit

元脑服务器推出支持Mooncake KV缓存共享的G3.5层全闪方案

火星财经消息,元脑服务器面向大模型推理场景,推出支持Mooncake KV缓存共享的G3.5层全闪方案。方案以元脑全闪服务器NF5286为核心,与Mooncake缓存组件、推理框架的缓存感知调度协同,为推理集群提供独立于计算节点、可按业务需求单独规划的KV Cache共享空间。当上下文需求增长时,可以单独扩展缓存资源;当GPU节点扩容、调整或维护时,缓存资源也不必完全随计算节点变化。(财联社)
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-14 10:25

不想被OpenAI和Anthropic卡脖子,美国第二大律所自己买GPU自建AI系统

动察 Beating AI 快讯,美国第二大律所 Latham & Watkins 开始自己买英伟达 GPU,在内部运行 AI 模型。 律所已经采购 H200 GPU,并把服务器放进只有自家员工能进入的数据中心。工程师正在微调英伟达 Nemotron 3 开放权重模型。 这样一来,最敏感的客户材料不用交给外部云厂商。ChatGPT、Claude、Gemini 等商业模型仍然继续使用,律师可以根据任务选择不同模型。 这是首个公开披露的大型律所自购 AI 硬件并微调模型的案例。Latham 已经为这套系统准备了三年,也给自己留了一条不依赖 OpenAI、Anthropic 等单一供应商的路。

09-13 08:34重要

“大空头”Michael Burry被打脸?甲骨文4年以上GPU续约仍涨价20%

Odaily星球日报讯 “白毛股神”Serenity 在 X 平台发文称,甲骨文(ORCL)财报中的一项信息对 Nebius(NBIS)和 IREN(IREN)较为利好。甲骨文表示,所有续约的 GPU 算力均已重新售出,价格较此前合同上涨 20%,且大部分相关设备已使用 4 年以上。Serenity 认为,这一情况再次对“大空头”Michael Burry 关于 GPU 快速折价的贬值论点构成反驳,同时利好英伟达(NVDA)及 Neocloud 算力赛道。

09-13 08:21

Serenity:甲骨文老旧GPU续约价较原合同高出20%,利好英伟达及Neocloud公司

火星财经消息,9 月 13 日,Serenity 发文表示,甲骨文(ORCL)财报中披露的 GPU 续约数据,对 NBIS 和 IREN 等算力基础设施公司释放出较为积极的信号。 甲骨文称,所有进入续约阶段的 GPU 算力均已再次售出,成交价格较原有合同高出 20%,且其中多数设备已使用 4 年以上。Serenity 认为,这一数据对 Burry 提出的「GPU 快速折旧」观点构成反例,并对英伟达(NVDA)及 Neocloud 公司较为有利。

09-13 05:46

中国移动云公司发布异构混合推理系统:类脑芯片+国产GPU 突破单一架构的性能瓶颈

火星财经消息,中国移动云公司类脑与光实验室技术总监杜宇健在2026算力中国展览会首发首秀活动发布面向大模型推理的异构混合推理系统,采用"类脑芯片+国产GPU"架构,对标英伟达Vera Robin+Groq方案。该系统使用灵汐科技类脑芯片与天数智芯GPU混合,在DeepSeek V4 Flash推理场景下,相比同类GPU集群性能提升1倍以上,运营成本降低40%以上,并且自主可控。杜宇健称,引入类脑算力相当于给现有GPU资源"涡轮增压"。 (财联社记者 郭松峤)

09-11 09:06

LG CNS将斥资3814亿韩元采购英伟达GPU及基础设施设备

9月11日,一份监管文件显示,韩国LG集团旗下的专业IT服务与系统集成企业LG CNS计划采购价值3,814亿韩元的GPU及基础设施设备。采购设备包括英伟达Vera Rubin GPU,将用于建设AI工厂。(界面)

09-10 07:17

DeepSeek开始直接对接大规模部署:有2000张GPU可以找官方

动察 Beating AI 快讯,DeepSeek 在 V4.1 Flash 开源公告里罕见地直接向大规模部署方喊话:如果有 2000 张 GPU 和存储集群,可以直接联系 DeepSeek。 但这并不是新的商业授权门槛。V4.1 Flash 仍按 MIT License 开源,没有按照公司营收或业务规模设置额外授权条件。有资源的企业可以自己部署,联系 DeepSeek 更像是针对超大规模场景的直接技术合作。DeepSeek 目前也没有宣布正式的私有化部署产品或收费服务。 过去 DeepSeek 开源模型后,部署适配更多由 SGLang、TensorRT-LLM 等推理框架和硬件厂商完成。这次官方主动留下大规模部署的直接联系方式,并表示会继续支持开源社区做新模型的推理适配,尝试进一步扩大部署范围。