返回 7*24 快讯
来源MarsBit

从GPT-2到Kimi K3:大模型七年架构演进,本质是一场记忆争夺战

据 动察 Beating 监测,Baseten 工程师 Ali 发布长文,从 GPT-2 一路拆解到 Kimi K3。按参数量计算,一个 K3 相当于约 22580 个 GPT-2。但他认为,过去七年的真正变化并非单纯扩大模型,而是不断改造模型保存、更新和找回信息的方式。 GPT-2 使用全注意力。每个 Token 都留下自己的 Key 和 Value,后续可以随时回看。信息保存最完整,但上下文越长,KV Cache 和计算成本越高。 线性注意力把整段历史压进固定大小的状态。成本不再随上下文持续膨胀,代价是不同信息会挤在同一块空间里。内容越来越多后,旧记忆开始互相干扰。 此后的多项架构创新,都在给这块有限记忆增加管理规则。DeltaNet 允许模型先读取旧内容,再用新旧差异进行覆盖。Gated DeltaNet 加入整体遗忘,让旧信息能够随场景变化衰减。 KDA 进一步把遗忘控制细化到每个通道。不同信息可以拥有不同保存时间:长期事实保留更久,临时指令和局部变量更快衰减。Ali 认为,这才是 Kimi Linear 最关键的进步。 但固定状态不可能保留所有细节。K3 因此没有只用 KDA,而是把 23 组四层结构排列成「三层 KDA 加一层 MLA」,最后再补一层 MLA。KDA 负责低成本维护长期记忆,MLA 定期回看完整上下文,找回数字、代码和早期指令等精确信息。 K3 还引入 Attention Residuals。普通模型会把每一层结果不断相加,早期提取出的信息容易在 93 层计算中被后续结果稀释。K3 把网络按 12 层分块,让后面的层按需调用较早阶段形成的中间表示,不必每次都从原文重新推导。 因此,K3 的关键并不是某一项突然出现的黑科技。它真正特别的地方,是把循环记忆、全局检索、层间回看和专家路由组合成一套分层信息系统。 过去七年的模型架构演进,本质上是在教模型如何选择什么值得留下,什么应该覆盖,什么时候必须翻回原文。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-14 08:58

OpenAI把GPT-5.6 Sol提速14倍:750 token/s先上API

据动察 Beating 监测,OpenAI 开始预览 GPT-5.6 Sol 的 Ultrafast 模式。它由 Cerebras 提供算力,最高输出速度达到 750 token/s,最高是 Standard 模式的 14 倍。目前只向少量 API 客户开放。 OpenAI 已在故障排查、研究、客服、金融分析和开发 Agent 等场景中测试 Ultrafast。对于需要连续多次调用模型的 Agent,单次响应提速也能直接缩短整个任务的执行时间。 这比 OpenAI 7 月底推出的 Fast 模式又快了一档。Fast 模式最高是 Standard 的 2.5 倍,Ultrafast 则把上限推到 14 倍。OpenAI 暂未公布 Ultrafast 的价格,也没有宣布何时进入 ChatGPT。

07-24 18:05

OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5

据动察 Beating 监测,Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。 所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。 GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。

08-02 23:17

Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%

Odaily星球日报讯 Kimi 宣布开源多模态大模型视觉感知评测基准 PerceptionBench,旨在将视觉感知能力拆解为 10 项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 及幻觉识别等维度。该基准基于 42 个现有评测集中的模型失败案例构建,共包含 3000 道经人工验证的问题,每题仅考察单一视觉能力,无需推理或外部知识。 评测结果显示,在 16 款前沿多模态大模型中,没有任何模型整体准确率超过 60%。GPT-5.6-Sol 以 59.7%的准确率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和 GPT-5.5(55.8%)位列前五。报告指出,视觉幻觉(Hallucination)仍是各模型表现最弱的能力,整体感知能力仍存在显著提升空间。

07-27 14:12

Moonshot AI将公开2.8万亿参数Kimi K3权重,中国开源权重模型Token占比升至68%

Odaily星球日报讯 中国 AI 初创公司 Moonshot AI 将公开高性能模型 Kimi K3 的模型权重,开发者可下载模型并按用途修改,也可在自有数据中心或云环境中运行。 Kimi K3 拥有 2.8 万亿个参数和 100 万 Token 上下文窗口,可一次性处理大规模文档和代码库。Moonshot AI 计划后续通过技术报告公开模型结构、训练方式和性能评估结果。 Kimi K3 发布后,Moonshot AI 单日收入据悉至少增长 6 倍。Moonshot AI 正推进按 500 亿美元估值进行新一轮融资,并考虑最快今年在香港上市。 Bloomberg Intelligence 表示,Kimi K3 与 Z.AI 的 GLM-5.2 发布后,中国开源权重模型在整体 Token 使用量中的占比升至 68%。AWS Bedrock、Microsoft Azure Foundry 和 Google Vertex AI 尚未提供 Kimi K3 与 GLM-5.2 等中国开源权重模型。

07-23 11:05

OpenAI总裁承认Kimi K3「相当不错」,是否蒸馏GPT仍不清楚

据动察 Beating 监测,OpenAI 总裁兼联合创始人 Greg Brockman 承认,月之暗面新模型 Kimi K3「相当不错」。但他称,目前判断 Kimi 是否通过蒸馏 OpenAI 模型提升能力还太早,OpenAI 会持续监测。 此前,白宫官员指控月之暗面不当使用美国 AI 模型。Anthropic 也提出过类似质疑。月之暗面尚未回应。 Brockman 还引用估算称,中国模型与美国的差距可能只剩 4 个月。他认为,未来竞争的关键不是模型是否开源,而是谁能用更低成本完成任务。

07-22 16:17

Kimi K3白领任务逼近Fable5,成本升至上代10倍

据动察 Beating 监测,Artificial Analysis 更新 AA-Briefcase 榜单。这个评测让模型从近 2000 份邮件、Slack 记录和公司文件中找信息,再交付表格、演示文稿和界面原型。它共设 4 个长期项目和 91 项保密任务。 Kimi K3 得分 1543 Elo,仅次于 Claude Fable 5 的 1574。它超过 GPT-5.6 Sol 的 1501,也领先 Claude Sonnet 5 和 Claude Opus 4.8。 K3 的客观要求通过率为 51%,Fable 5 为 56%。但 K3 的分析质量得分略高,1754 对 1744。它主要输在成品展示,低于 GPT-5.6 Sol 和 Opus 4.8。 性能提升也伴随着更高的 Token 消耗。K3 平均每项任务花费 10.57 美元,约为 Kimi K2.6 的 10 倍。它平均执行 83 轮,输出 12 万 Token,耗时 56.4 分钟。完成同类任务所需时间约为 Fable 5 的 2.5 倍。