返回 7*24 快讯
来源Blockbeats

大模型开始自己「打草稿」:NCP把猜后文塞进模型内部

动察 Beating AI 快讯,上海 AI Lab 和上海交大发布 89 亿参数模型 NCP-ArchPreview。普通大模型主要训练「猜下一个 token」,NCP 还会预测后面一小段对应的内部概念信号,再用它辅助 token 生成。最终仍然逐 token 输出,但模型内部已经会提前猜后文。 这套信号还能拿来给投机解码提速。DFlash、DSpark 这类方案会让一个小模型先猜后文,再交给大模型统一检查。NCP 团队把内部概念信号也交给这个小模型,相当于先给它一点「后面大概怎么写」的提示,再让它一次并行猜 16 个 token。 这样一来,小模型猜中的内容更多。四项测试里,大模型每验证一次,平均能通过的 token 从 5.933 个升到 6.180 个,提升 4.17%;HumanEval 上提升 7.59%。接入这套信号只给草稿模型增加约 4 万参数。 同样是 89 亿参数,NCP 用普通 Transformer 约 85% 的训练计算量,就能把训练误差降到差不多的水平。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-11 11:01

英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%

动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。

09-14 08:33

循环Transformer新架构:RLT让Token之间「接着算」

动察 Beating AI 快讯,普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),给 Transformer 加了一条会一直往后传的内部状态。 普通 Transformer 生成下一个 Token 时,主要通过 Attention 和 KV 缓存读取前文。RLT 除了看前文,还会把上一个 Token 算完留下的内部状态,直接交给下一个 Token 继续用。 可以把它理解成给模型加了一根「思维接力棒」。第一个 Token 算完,把当前状态传给第二个;第二个更新后再传给第三个。每个 Token 自己跑的网络层数没有变,但这根状态链会随着文本越来越长。论文把它称为「无限时间深度」,指的就是这条计算链没有固定长度上限。 它和最近讨论较多的 Ouro、Astra 类循环架构也不太一样。那类方法主要让同一个 Token 在同一套网络里多跑几轮;RLT 则让不同 Token 之间持续传递内部状态。前者像一道题交卷前多检查几遍,后者更像上一棒跑完,把手里的进度直接交给下一棒。

09-13 11:31

ElevenLabs Music v2.5上线:免费版也给商用权,每天5首无损下载

动察 Beating AI 快讯,ElevenLabs 上线 Music v2.5,并把它设为 ElevenMusic 默认模型。新版本重点提升旋律、编曲层次和乐器真实感。官方让 v2 和 v2.5 用相同提示词各生成一版,做了 47,885 组盲测,v2.5 在多数对比中获胜。R&B、灵魂乐、嘻哈、摇滚、金属、管弦和电影配乐的差距最大。 而且现在授权也放宽了。Free 用户每天能下载 5 首无损歌曲,生成内容可以商用,但必须标注「Made with ElevenMusic」;Pro 每月有 400 次无损下载,不需要标注,还能把歌曲发行到流媒体平台。作品创建时拿到的权限以后不会因为降级或退订改变。基于其他艺人歌曲做改编的作品则不能下载或对外发行。 ElevenLabs 还明确表示 Music v2 不会下线。Suno 最近上线 v6,同时退役此前所有旧模型,引发不少老用户不满。HN 有用户实测后认为,v2.5 音质更好,但音乐性还是更喜欢 Suno v5。

09-07 09:45

Hy4 preview优化「想太多」:复杂任务轮次和Token消耗双降

动察 Beating AI 快讯,腾讯混元和 WorkBuddy 给 Hy4 preview 做了一轮专项优化,已经在 WorkBuddy 全量上线。官方称,这次主要针对复杂任务里的长思考和过度自我验证,在不损失任务效果的前提下,显著减少任务轮次和输入、输出 token 消耗。 Hy4 preview 是腾讯 8 月底发布的开源旗舰 MoE,总参数 770B、激活参数 49B,支持 1M 上下文,重点面向代码、办公和科研等长任务。腾讯发布时就主动把「复杂任务长思考、过度自我验证」列为已知问题。

09-03 03:17

传百度文心连补两员大将:北美Frontier Lab+DeepSeek OCR核心作者

动察 Beating AI 快讯,百度基础模型研发部(BMU)正在补强核心模型团队。知情人士称,负责人孙天祥从北美某 Frontier Lab 引入了一名花名「武钦」的研究员,和团队一起加强文心预训练。对方过去两年参与过数代前沿大模型研发,但真实姓名和原单位都没有披露。另一边,原 DeepSeek 研究员魏浩然及其团队也从百度内部转入 BMU,由他担任文心多模态算法负责人。 魏浩然这条线其实早有伏笔。6 月百度开源 Unlimited OCR 时,三名核心贡献者中的技术总监只署名「YY」,社区当时就猜测是魏浩然。魏浩然是 DeepSeek-OCR 和 DeepSeek-OCR 2 第一作者;DeepSeek-V4 技术报告也把他标记为已经离职。 Unlimited OCR 发布时在 OmniDocBench v1.6 拿到 93.92%,一度刷新端到端 OCR 纪录。它沿用了 DeepSeek-OCR 的 DeepEncoder,并重新设计解码端的注意力机制,可以一次连续解析几十页文档。 孙天祥 7 月刚接手 BMU,同时进入百度模型委员会,月底又进入百度技术战略委员会。两个月后,文心的预训练和多模态两条核心线都开始补人。

09-01 09:51

Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol

动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。