韩国启动全民免费AI计划:512块B200兜底,落选国家队的「韩模第一」Motif 3照样进场
相关推荐
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
Artificial Analysis重做智能榜:40%权重改用私有测试
动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。
OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5
据动察 Beating 监测,Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。 所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。 GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。
Meta给Muse上裂变拉新:邀1人送10亿Token,最多拿200亿
动察 Beating AI 快讯,Meta 的个人 AI Agent Muse 上线邀请码。Alexandr Wang 宣布,朋友注册时使用你的邀请码,双方各得 10 亿 Muse Token,最多可以邀请 20 人。拉满后,邀请者还能提前体验电话等新功能。 这个奖励相当大。Muse 免费版目前每周提供 1 亿 Token,成功邀请 1 人拿到的奖励,数量上等于 10 周免费额度;拉满 20 人就是 200 亿 Token,相当于 200 周的基础免费额度。 Muse 上周刚在美国上线,可以自己浏览网页、连接 App,并代用户发邮件、购物和订行程。上线后一直稳居美国 App Store 总榜前几名。Meta 现在直接用大额 Token 奖励,把首批用户变成拉新渠道。
循环Transformer新架构:RLT让Token之间「接着算」
动察 Beating AI 快讯,普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),给 Transformer 加了一条会一直往后传的内部状态。 普通 Transformer 生成下一个 Token 时,主要通过 Attention 和 KV 缓存读取前文。RLT 除了看前文,还会把上一个 Token 算完留下的内部状态,直接交给下一个 Token 继续用。 可以把它理解成给模型加了一根「思维接力棒」。第一个 Token 算完,把当前状态传给第二个;第二个更新后再传给第三个。每个 Token 自己跑的网络层数没有变,但这根状态链会随着文本越来越长。论文把它称为「无限时间深度」,指的就是这条计算链没有固定长度上限。 它和最近讨论较多的 Ouro、Astra 类循环架构也不太一样。那类方法主要让同一个 Token 在同一套网络里多跑几轮;RLT 则让不同 Token 之间持续传递内部状态。前者像一道题交卷前多检查几遍,后者更像上一棒跑完,把手里的进度直接交给下一棒。
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。