中国工信部扶持AI应用落地:FDE驻场、买Token、发算力券
相关推荐
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
Meta给Muse上裂变拉新:邀1人送10亿Token,最多拿200亿
动察 Beating AI 快讯,Meta 的个人 AI Agent Muse 上线邀请码。Alexandr Wang 宣布,朋友注册时使用你的邀请码,双方各得 10 亿 Muse Token,最多可以邀请 20 人。拉满后,邀请者还能提前体验电话等新功能。 这个奖励相当大。Muse 免费版目前每周提供 1 亿 Token,成功邀请 1 人拿到的奖励,数量上等于 10 周免费额度;拉满 20 人就是 200 亿 Token,相当于 200 周的基础免费额度。 Muse 上周刚在美国上线,可以自己浏览网页、连接 App,并代用户发邮件、购物和订行程。上线后一直稳居美国 App Store 总榜前几名。Meta 现在直接用大额 Token 奖励,把首批用户变成拉新渠道。
循环Transformer新架构:RLT让Token之间「接着算」
动察 Beating AI 快讯,普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),给 Transformer 加了一条会一直往后传的内部状态。 普通 Transformer 生成下一个 Token 时,主要通过 Attention 和 KV 缓存读取前文。RLT 除了看前文,还会把上一个 Token 算完留下的内部状态,直接交给下一个 Token 继续用。 可以把它理解成给模型加了一根「思维接力棒」。第一个 Token 算完,把当前状态传给第二个;第二个更新后再传给第三个。每个 Token 自己跑的网络层数没有变,但这根状态链会随着文本越来越长。论文把它称为「无限时间深度」,指的就是这条计算链没有固定长度上限。 它和最近讨论较多的 Ouro、Astra 类循环架构也不太一样。那类方法主要让同一个 Token 在同一套网络里多跑几轮;RLT 则让不同 Token 之间持续传递内部状态。前者像一道题交卷前多检查几遍,后者更像上一棒跑完,把手里的进度直接交给下一棒。
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
Hy4 preview优化「想太多」:复杂任务轮次和Token消耗双降
动察 Beating AI 快讯,腾讯混元和 WorkBuddy 给 Hy4 preview 做了一轮专项优化,已经在 WorkBuddy 全量上线。官方称,这次主要针对复杂任务里的长思考和过度自我验证,在不损失任务效果的前提下,显著减少任务轮次和输入、输出 token 消耗。 Hy4 preview 是腾讯 8 月底发布的开源旗舰 MoE,总参数 770B、激活参数 49B,支持 1M 上下文,重点面向代码、办公和科研等长任务。腾讯发布时就主动把「复杂任务长思考、过度自我验证」列为已知问题。
中金:开源模型促进生态繁荣,带动云厂商、FDE、应用厂商需求提升
火星财经消息,中金公司研报指出,开源模型基于高性价比+高智能水平,获得海内外用户的广泛认可,开源模型调用量趋势性提升。据估算,今年海外开源模型收入将达到百亿美元,而2027年全球开源模型调用量占总Token量50%—70%,价值量将达到大模型市场的12%—30%。开源模型促进生态繁荣,带动云厂商、FDE、应用厂商需求提升。开源模型整体生态参与方众多,算力硬件、云厂商、推理调优平台、聚合/应用平台都将参与其中,开源模型的技术进步也将带动相关参与方的商业化兑现。