返回 7*24 快讯
来源Blockbeats

2.78万亿参数Kimi K3实现8GB内存运行,开发者开源轻量C推理引擎

BlockBeats 消息,8 月 8 日,有开发者近日开源项目 kimi-k3-in-c,尝试让拥有 2.78 万亿参数的 Kimi K3 模型在仅 8GB 内存的设备上运行。该项目仅 176KB,采用纯 C99 编写,不依赖 GPU、CUDA、PyTorch 或 BLAS,仅通过 CPU 即可完成模型推理。 该方案利用 Kimi K3 的 MoE(混合专家)架构特性。虽然模型总参数规模达到 2.78T,但每层 896 个专家中仅激活 16 个,因此开发者没有将完整约 1.56TB 模型权重加载进内存,而是将大部分专家权重存储在 NVMe 硬盘中,根据推理需求实时读取;同时,部分密集层(dense trunk)也采用逐层流式加载方式。 不过,该方案目前仍存在明显性能限制。在 8GB 内存模式下,模型生成一个 token 大约需要 32.7 秒,同时需要接近 1.7TB 高速存储空间支持。 开发者表示,这一方案目前更像是对大模型推理基础设施优化方向的一次实验探索,并不具备实际生产使用价值,但其通过「硬盘流式加载+MoE 稀疏激活」的方式,为未来低成本运行超大规模模型提供了一种新思路。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-13 13:29

黄仁勋:CUDA可延长英伟达GPU经济使用寿命,使算力成为可融资资产

Odaily星球日报讯 英伟达 CEO 黄仁勋在 X 平台转发“CoreWeave 将英伟达 A100 GPU 租赁合同延续至 2029 年”的消息表示,2020 年推出的 A100 GPU 预计直到 2029 年仍可继续承担计算任务,英伟达的计算平台并不仅仅依赖芯片本身,CUDA 能够让开发者和英伟达工程师在 Ampere、Hopper 和 Blackwell 等架构的整个使用周期内持续进行升级和优化。 黄仁勋称,CUDA 提升了英伟达算力的通用性和不同代际计算资源的可替代性,从而提高 GPU 利用率并延长其经济使用寿命,使英伟达算力成为一种“可出租、耐用且可融资”的生产性资产。

08-12 10:56

比特币硬分叉链BIP-110已确定BLAKE2b为新POW算法,可使用普通CPU/GPU挖矿

Odaily星球日报讯 Luke Dashjr 已利用随机的方式确定 BLAKE2b 将作为 BIP-110 链的新 POW 算法,替代比特币目前使用的 SHA-256d 算法。与 SHA-256d 相比,BLAKE2b 更适合使用通用 CPU/GPU 进行挖矿,更偏 CPU 友好,可降低现有比特币 ASIC 矿机的优势。 此前消息,Luke Dashjr 计划将于 9 月 1 日正式实现 BIP-110 硬分叉,使其成为一条独立区块链,并产生区别于比特币的新代币,Luke Dashjr 已被比特币 BIP 编辑团队撤销了比特币 BIP 编辑权限。

08-05 12:40

Cursor重排GPU流水线,MoE模型训练提速41%

据动察 Beating 监测,Cursor 开源 Mixture-of-Kittens(MoK),用于加速 MoE 大模型训练。它把原本分开的 GPU 数据传输和计算,合进一个 kernel(直接在 GPU 上运行的底层程序)。 MoE 会把模型拆成大量「专家」,每次只调用其中一部分。专家分散在不同 GPU 上,数据需要频繁搬运,有时会占掉一半以上的训练时间。 MoK 让 GPU 一边传数据,一边做计算,减少等待。在 512 块 GB300 GPU 的实际训练中,整体吞吐提高 41%。单独测试 MoE 层时,最高比公开方案快 2.37 倍。 MoK 已用于 Cursor 数万块 GPU 的 Composer 训练,并以 Apache 2.0 开源。目前只支持英伟达 Blackwell GPU,主要面向拥有 GB200、GB300 NVL72 集群的机构。

07-22 12:18重要

Kimi冲击刚过,英伟达Rubin又将AI硬件交易拉回「供给焦虑」

BlockBeats 消息,7 月 22 日,美股 AI 交易刚经历一轮急跌,市场上一个流行解释是:Kimi K3 的出现,让投资者重新担心美国 AI 模型的高成本路线和芯片资本开支回报。上周,半导体板块明显承压,PHLX 半导体指数一度跌入技术性熊市区间,英伟达、Micron、设备股和存储股都被卷入调整。 但 The Information 最新报道给了市场另一组更直接的数字:英伟达下一代 Vera Rubin 服务器系统已经开始进入客户测试,CoreWeave、微软、OpenAI、Anthropic、SpaceXAI 等数十家客户已拿到少量测试机柜。每个 Rubin 机柜包含 72 颗 GPU,单价约 700 万至 800 万美元,高于当前 Grace Blackwell 300 机柜约 500 万美元 的价格。 最刺激市场想象力的是产能。英伟达硬件工程高级副总裁 Andrew Bell 称,十多家制造伙伴最终将具备每天生产最多 1000 个 Rubin 机柜 的能力。粗略测算,如果满负荷运行,这相当于一个季度至少 6300 亿美元 的潜在机柜收入规模。当然,这只是理论产能与机柜价格的乘法,不能直接等同于英伟达财报指引,但足以说明 AI 基础设施军备竞赛的量级仍在快速抬升。 这正是当前 AI 行情的矛盾所在。Kimi K3 这类高性能、低成本、开放权重模型,削弱了市场对美国闭源模型溢价的信心,也让投资者质疑「越花钱越领先」的资本开支逻辑。与此同时,Rubin 的推进又显示,OpenAI、Anthropic、微软等核心客户仍在抢下一代算力。便宜模型扩散可能压低推理成本,也可能扩大 AI 使用场景,最终继续推高 GPU、内存、网络和冷却系统需求。 周二美股的反弹已经体现出这种拉扯。科技股结束连续下跌,纳指上涨约 1.3%,PHLX 半导体指数录得一个月来最大单日涨幅,Micron、SanDisk 等存储股也大幅反弹。市场并未完全放弃 AI 硬件,只是在重新计算:Kimi 带来的效率冲击,会削弱芯片需求,还是刺激更多开发者和企业部署 AI。 此外,英伟达正在将自己从 GPU 供应商推进为整套 AI 服务器基础设施供应商。公司不只卖 GPU,也在布局 CPU、网络交换机、线缆、存储和冷却技术。面对 Google 等公司自研 AI 推理芯片,英伟达的策略是:即使客户使用替代芯片,它仍希望卖出网络、服务器组件和配套系统

07-20 19:30

AMD年度旗舰AI大会来袭 瑞银:CPU/GPU技术路线是重头戏

火星财经消息,AMD年度旗舰AI大会“Advancing AI 2026”将于当地时间7月22日至23日在美国旧金山举行。瑞银发布前瞻报告称,此次活动可能更侧重于展示技术而非公布客户或财务信息,预计AMD将公布数据中心CPU(包含Venice、Verano)与GPU(MI450x以及MI500)技术路线的最新进展;嵌入式、游戏显卡业务也会同步更新相关信息。瑞银予AMD“买入”评级,目标价从670美元上调至700美元。(财联社)

08-04 07:37

SemiAnalysis:AMD股价若涨至600至700美元,Meta与OpenAI的GPU资本成本或降至零

BlockBeats 消息,8 月 4 日,半导体与 AI 独立研究机构 SemiAnalysis 发文表示,AMD 于去年末及今年初分别与 Meta、OpenAI 达成协议,向两家公司提供与业绩挂钩的认股权证。相关权证将根据最多 6GW AMD Instinct GPU 的采购及部署进度归属,同时还取决于 AMD 股价能否跨越多个门槛,最高门槛为 600 美元。 AMD 股价已由 2026 年初约 200 美元升至目前约 500 至 600 美元。假设与股价相关的权证归属大致呈线性变化,且 6GW 容量全部完成部署,Meta 与 OpenAI 每颗 GPU 的小时资本成本将分别由约 2.15 美元和 2.50 美元,降至约 1.60 美元和 1.75 美元。 SemiAnalysis 表示,若 AMD 股价升至 600 至 700 美元区间,两家公司仅就 GPU 而言的资本成本可能实际降至零。若 AMD 持续改善软件栈、获得更多大型客户订单,并推动股价升至 1000 美元以上,则包括服务器设备、网络及 CPU 在内的整个集群资本成本,理论上也可能降至接近零。