20VC 合伙人:AI Token 正重演铝业百年历史,智能体可能打开“无上限市场”
相关推荐
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
Marvell推出AI“内存解耦”架构,将解决Agentic AI推理带宽瓶颈
Odaily星球日报讯 Marvell Technology 宣布推出面向 AI 基础设施的新一代内存解决方案组合,覆盖服务器级 AI 存储、机架级 CXL 内存扩展与池化,以及多机柜光互联共享内存,旨在解决 Agentic AI 推理过程中日益增长的内存容量和带宽瓶颈。 Marvell 表示,随着 AI 模型规模扩大、上下文窗口延长以及 KV Cache 需求增长,传统计算与内存紧耦合架构正限制 AI 推理效率。通过内存解耦(memory disaggregation),可以让内存资源更加独立于计算资源扩展,提高 GPU 利用率并降低数据移动延迟。此次发布的产品包括: Bravera SC6 PCIe 6.0 SSD 控制器:面向 AI 推理存储场景,可帮助云服务商将更多 KV Cache 迁移至高性能 SSD,提升基础设施效率。该产品采用兼容多供应商 NAND 的架构,预计将于 2026 年第四季度开始送样。 Marvell Structera X 内存扩展方案:基于 CXL 技术,支持机架级内存扩展和资源池化,帮助数据中心更灵活地共享和调配内存资源,降低 AI 基础设施成本。 Marvell Photonic Fabric 光互联内存方案:通过光互联技术构建跨多机柜共享内存架构,可支持最高 32TB 温热 KV Cache 卸载,并帮助 AI 推理集群提升吞吐能力。 Marvell 表示,Photonic Fabric 方案可在现有数据中心空间和功耗限制下,实现最高 2 至 3 倍的 Token 吞吐提升,支持更大规模模型和更长上下文 AI 应用。 Marvell 高管 Will Chu 表示,AI 基础设施正在从单一服务器架构转向计算、内存和连接协同运行的系统,未来内存需要更加独立地扩展,以提升资源利用率和 Token 效率。 随着 AI Agent 和大模型推理需求持续增长,内存容量、带宽和数据传输效率正成为继算力之后 AI 基础设施竞争的新焦点。
中国工程院院士郑纬民:智能体时代,产出稳定且低成本Token(词元)的能力非常稀缺
火星财经消息,中国工程院院士、清华大学计算机科学与技术系教授郑纬民在Agentic时代AI基础设施创新发展论坛上表示,算力规模快速扩张并不等于产生高效的Token(词元)产能。智能体时代真正稀缺的不只是芯片,而是稳定、低成本、高等级地产出Token的系统能力。Token正从技术指标变为产业核心生产要素,推理系统也从单机优化,走向分布式、缓存化、异构化、服务化。(财联社)
Palantir CEO:企业对OpenAI、Anthropic等「前沿实验室」不满,后者只追求token最大化
BlockBeats 消息,7 月 2 日,Palantir CEO Alex Karp 昨日接受 CNBC《Squawk Box》采访时言辞激烈批评了 AI 前沿大模型公司,称 AI 的销售方式「完全错误」。 Karp 强调目前企业已对 OpenAI、Anthropic 等「前沿实验室」不满,认为它们只追求 token 最大化(tokenmaxxing),让企业浪费时间和金钱,却把专有价值和 IP 拱手让人。Karp 称企业「愤怒」,将致力于自主拥有 AI 生产资料而非依赖第三方。 6 月 29 日,Palantir 与 Nvidia 合作,将 Nvidia Nemotron 开放 AI 模型部署于主权环境中,主要服务美国政府和关键基础设施客户。据悉,合作系统整合 Nvidia AI 技术与 Palantir AIP、Foundry、Ontology 及 Apollo 平台,帮助机构在本地训练、定制和部署 AI,同时完全掌控数据、知识产权和模型。
英伟达黄仁勋:AI工厂与Token经济将支撑长期算力投入
PANews 6月25日消息,据21世纪经济报道报道,英伟达创始人兼CEO黄仁勋在2026年股东大会上表示,AI不是短期技术热潮,而是让数据中心从信息存储中心转变为生产数字智能的“AI工厂”。他称“有用的AI已经到来并且是盈利的”,Token正成为可计价、可盈利的生产单位,“每个Token都是利润单位”,AI基础设施建设将进入以数十年计的长期周期。黄仁勋强调,Blackwell在推理阶段已具优势,Vera Rubin被定位为面向Agent的AI工厂平台,CUDA及其全栈生态构成英伟达核心护城河。公司将持续加大研发投入,同时计划长期向股东返还逾50%自由现金流。
全国首个海洋Token工厂落地青岛
火星财经消息,9月17日,2026海洋合作发展论坛“探索深海——海洋未来产业的价值变革”平行论坛现场,全国首个面向海洋产业的专属智能要素供给平台——海洋Token(词元)工厂正式发布并落地青岛。据介绍,海洋Token工厂整体架构包含数据、算力、算法三个部分。数据方面,平台可提供海上作业规范、海洋环境要素等130多类涉海数据,建成面向海洋一线需求的专属数据库;算力方面,已形成总算力规模超过800P的海洋算力资源池,且仍在持续扩容;算法方面,汇聚观海、海星等20多个海洋领域专有大模型,以及“九天”大模型等30多款通用模型。按照规划,海洋Token工厂将深度贯穿深海油气勘探等实战场景,服务行业领军企业需求。(财联社)