返回 7*24 快讯
来源MarsBit

前沿模型八天便宜近三分之二,Kimi K3跻身前三

据动察 Beating 监测,Artificial Analysis 最新榜单显示,8 天内有 4 款前沿模型发布。Grok 4.5、GPT-5.6、Muse Spark 1.1 和 Kimi K3,先后进入第一梯队。 目前,智能指数超过 50 分的模型团队已有 6 家。6 月初,这一门槛还只有 OpenAI 和 Anthropic 达到。 Kimi K3 得分 57,排名第三。它仅次于 Claude Fable 5 的 60 分和 GPT-5.6 Sol 的 59 分,并超过 Claude Opus 4.8 的 56 分。 价格竞争更加明显。按统一基准和官方价格测算,Kimi K3 每项任务成本为 0.94 美元,约为 Opus 4.8 的一半。 GPT-5.6 Sol 只比榜首低 1 分,每项成本为 1.04 美元。Claude Fable 5 则需要 2.75 美元。 Grok 4.5 得分 54,每项成本仅为 0.31 美元。短短 8 天,接近前沿水平的模型,成本已降至此前的约二分之一到三分之一。 Artificial Analysis
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-11 18:28

Meta要终结中国开源模型?Muse核心成员唱衰Kimi,结果被评论区围攻

据动察 Beating 监测,Meta 超级智能实验室成员、Muse Spark 核心贡献者 Zengyi Qin 公开唱衰中国开源模型。他称,Meta 有多一个数量级的算力和更好的数据,Muse Spark 最终会超过 Kimi 等中国模型。 他还把判断推到了商业层面:JPMorgan 等美国大客户会因为合规改用美国开放模型,中国实验室也会失去这部分推理收入。Meta 自己有 Facebook、Instagram 挣钱,中国模型公司却更依赖模型收入。 评论区很快开始反问:Meta 过去两年一直不缺算力和数据,怎么没压住中国模型?还有人追问,JPMorgan 到底给 Kimi 贡献了多少收入。 有人甚至讽刺,如果这就是「Muse Spark 核心成员」的推理水平,反而开始担心 Muse 的模型表现。 Muse Spark 1.2 即将开放权重,Meta 确实会给 Kimi、DeepSeek、Qwen 多添一个重量级美国对手。但从「多了一个强敌」直接推到「中国模型会被算力碾压、美国收入也会流失」,中间还差了一大截。

07-30 11:12重要

Grok全新语音模型拿下Agent评测第一,API价格涨60%

据动察 Beating 监测,SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。 Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。 性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。

07-28 16:26

从GPT-2到Kimi K3:大模型七年架构演进,本质是一场记忆争夺战

据 动察 Beating 监测,Baseten 工程师 Ali 发布长文,从 GPT-2 一路拆解到 Kimi K3。按参数量计算,一个 K3 相当于约 22580 个 GPT-2。但他认为,过去七年的真正变化并非单纯扩大模型,而是不断改造模型保存、更新和找回信息的方式。 GPT-2 使用全注意力。每个 Token 都留下自己的 Key 和 Value,后续可以随时回看。信息保存最完整,但上下文越长,KV Cache 和计算成本越高。 线性注意力把整段历史压进固定大小的状态。成本不再随上下文持续膨胀,代价是不同信息会挤在同一块空间里。内容越来越多后,旧记忆开始互相干扰。 此后的多项架构创新,都在给这块有限记忆增加管理规则。DeltaNet 允许模型先读取旧内容,再用新旧差异进行覆盖。Gated DeltaNet 加入整体遗忘,让旧信息能够随场景变化衰减。 KDA 进一步把遗忘控制细化到每个通道。不同信息可以拥有不同保存时间:长期事实保留更久,临时指令和局部变量更快衰减。Ali 认为,这才是 Kimi Linear 最关键的进步。 但固定状态不可能保留所有细节。K3 因此没有只用 KDA,而是把 23 组四层结构排列成「三层 KDA 加一层 MLA」,最后再补一层 MLA。KDA 负责低成本维护长期记忆,MLA 定期回看完整上下文,找回数字、代码和早期指令等精确信息。 K3 还引入 Attention Residuals。普通模型会把每一层结果不断相加,早期提取出的信息容易在 93 层计算中被后续结果稀释。K3 把网络按 12 层分块,让后面的层按需调用较早阶段形成的中间表示,不必每次都从原文重新推导。 因此,K3 的关键并不是某一项突然出现的黑科技。它真正特别的地方,是把循环记忆、全局检索、层间回看和专家路由组合成一套分层信息系统。 过去七年的模型架构演进,本质上是在教模型如何选择什么值得留下,什么应该覆盖,什么时候必须翻回原文。

07-22 16:17

Kimi K3白领任务逼近Fable5,成本升至上代10倍

据动察 Beating 监测,Artificial Analysis 更新 AA-Briefcase 榜单。这个评测让模型从近 2000 份邮件、Slack 记录和公司文件中找信息,再交付表格、演示文稿和界面原型。它共设 4 个长期项目和 91 项保密任务。 Kimi K3 得分 1543 Elo,仅次于 Claude Fable 5 的 1574。它超过 GPT-5.6 Sol 的 1501,也领先 Claude Sonnet 5 和 Claude Opus 4.8。 K3 的客观要求通过率为 51%,Fable 5 为 56%。但 K3 的分析质量得分略高,1754 对 1744。它主要输在成品展示,低于 GPT-5.6 Sol 和 Opus 4.8。 性能提升也伴随着更高的 Token 消耗。K3 平均每项任务花费 10.57 美元,约为 Kimi K2.6 的 10 倍。它平均执行 83 轮,输出 12 万 Token,耗时 56.4 分钟。完成同类任务所需时间约为 Fable 5 的 2.5 倍。

07-20 19:35重要

SemiAnalysis:Kimi K3跻身全球第三,或揭示OpenAI与Anthropic隐藏利润空间

火星财经消息,7 月 20 日,SemiAnalysis 分析师 Jordan Nanos 和 Max Kan 近日围绕月之暗面旗下模型 Kimi K3 展开分析,认为该模型在综合基准测试中超越 Google Gemini,不仅反映中美 AI 模型差距缩小,也为推测 Anthropic 和 OpenAI 等闭源 AI 公司的商业模式提供了新视角。 根据 SemiAnalysis 综合评价,Kimi K3 目前排名全球第三,仅次于 Fable 5 和 GPT-5.6,并超过 Google Gemini。分析师表示,虽然这一结果并不意味着 Google AI 业务出现重大问题,但 Kimi K3 公开披露的参数规模、性能和定价,为外界估算闭源模型经济价值提供了参考。 Kimi K3 拥有 2.8 万亿参数,远超多数公开模型。Jordan Nanos 表示,如此规模的模型无法部署在单个英伟达 B200 GPU 上,需要 GB300、B300 级别系统或 AMD MI355X 等更高规格硬件支持。他据此推测,Anthropic 和 OpenAI 的旗舰闭源模型可能也处于类似参数规模,而非拥有数量级领先优势。 在商业模式方面,Kimi K3 上线价格接近 Anthropic Sonnet 系列模型,输入价格约为每百万 token 3 美元,输出价格约为每百万 token 15 美元,较上一代 Kimi 模型价格上涨约 3 倍。 Max Kan 认为,如果月之暗面并非长期亏损运营,那么 Anthropic 和 OpenAI 针对类似规模模型收取更高价格,意味着其 API 业务可能具备较高利润率。「出售 API token 可能比 SaaS 更赚钱。」他说。 不过,两位分析师强调,上述判断并非基于 AI 公司的公开财务数据,而是通过 Kimi K3 的参数、价格和性能表现进行反向推演。

07-18 11:00

华尔街投资人:Kimi K3或成AI转折点,利好模型巨头之外的产业链

据动察 Beating 监测,Atreides Management 管理合伙人兼 CIO Gavin Baker 称,Kimi K3 可能成为 AI 行业的转折点。它对 OpenAI 和 Anthropic 不利,却利好几乎所有其他公司。 他的判断是,前沿模型如果长期由两三家实验室垄断,这些公司会拿走大部分利润,并向芯片、云计算和软件层扩张。 K3 增加了模型层竞争。模型利润被压低后,更多价值会留给电力、芯片、数据中心、云服务和软件公司。 不过,K3 目前还不够省 token。Artificial Analysis 的测试显示,它每项任务成本约为 0.94 美元,高于 GPT-5.6 Terra 的 0.55 美元,但略低于 GPT-5.6 Sol 的 1.04 美元。 Baker 认为,真正的行业转折点,还需要一个同样强、但更省 token 的开放模型。OpenAI 和 Anthropic 仍可能依靠产品、工具链和内部模型守住领先。