Kimi K3白领任务逼近Fable5,成本升至上代10倍
相关推荐
Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%
据动察 Beating 监测,第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。 Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。 模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。 短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。
Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍
据动察 Beating 监测,评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。 在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。 模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。 作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。
SemiAnalysis:Kimi K3跻身全球第三,或揭示OpenAI与Anthropic隐藏利润空间
火星财经消息,7 月 20 日,SemiAnalysis 分析师 Jordan Nanos 和 Max Kan 近日围绕月之暗面旗下模型 Kimi K3 展开分析,认为该模型在综合基准测试中超越 Google Gemini,不仅反映中美 AI 模型差距缩小,也为推测 Anthropic 和 OpenAI 等闭源 AI 公司的商业模式提供了新视角。 根据 SemiAnalysis 综合评价,Kimi K3 目前排名全球第三,仅次于 Fable 5 和 GPT-5.6,并超过 Google Gemini。分析师表示,虽然这一结果并不意味着 Google AI 业务出现重大问题,但 Kimi K3 公开披露的参数规模、性能和定价,为外界估算闭源模型经济价值提供了参考。 Kimi K3 拥有 2.8 万亿参数,远超多数公开模型。Jordan Nanos 表示,如此规模的模型无法部署在单个英伟达 B200 GPU 上,需要 GB300、B300 级别系统或 AMD MI355X 等更高规格硬件支持。他据此推测,Anthropic 和 OpenAI 的旗舰闭源模型可能也处于类似参数规模,而非拥有数量级领先优势。 在商业模式方面,Kimi K3 上线价格接近 Anthropic Sonnet 系列模型,输入价格约为每百万 token 3 美元,输出价格约为每百万 token 15 美元,较上一代 Kimi 模型价格上涨约 3 倍。 Max Kan 认为,如果月之暗面并非长期亏损运营,那么 Anthropic 和 OpenAI 针对类似规模模型收取更高价格,意味着其 API 业务可能具备较高利润率。「出售 API token 可能比 SaaS 更赚钱。」他说。 不过,两位分析师强调,上述判断并非基于 AI 公司的公开财务数据,而是通过 Kimi K3 的参数、价格和性能表现进行反向推演。
前沿模型八天便宜近三分之二,Kimi K3跻身前三
据动察 Beating 监测,Artificial Analysis 最新榜单显示,8 天内有 4 款前沿模型发布。Grok 4.5、GPT-5.6、Muse Spark 1.1 和 Kimi K3,先后进入第一梯队。 目前,智能指数超过 50 分的模型团队已有 6 家。6 月初,这一门槛还只有 OpenAI 和 Anthropic 达到。 Kimi K3 得分 57,排名第三。它仅次于 Claude Fable 5 的 60 分和 GPT-5.6 Sol 的 59 分,并超过 Claude Opus 4.8 的 56 分。 价格竞争更加明显。按统一基准和官方价格测算,Kimi K3 每项任务成本为 0.94 美元,约为 Opus 4.8 的一半。 GPT-5.6 Sol 只比榜首低 1 分,每项成本为 1.04 美元。Claude Fable 5 则需要 2.75 美元。 Grok 4.5 得分 54,每项成本仅为 0.31 美元。短短 8 天,接近前沿水平的模型,成本已降至此前的约二分之一到三分之一。 Artificial Analysis
Kimi K3登顶前端代码榜,领先Claude Fable 5
据 动察 Beating 监测,月之暗面 Kimi K3 登上 Arena 前端代码榜第一,获得 1679 分。它超过 Claude Fable 5 的 1631 分,以及 GPT-5.6 Sol 的 1618 分。相比上一代 Kimi K2.6,排名从第 18 位升至第一。 Kimi K3 在 7 个细分领域中拿下 6 项第一。覆盖品牌营销、参考图复刻、数据分析、消费产品、模拟和内容创作工具。游戏开发排名第二,落后于 Claude Fable 5。 这个榜单不靠固定题库自动判分。用户提交真实的前端开发需求,两款匿名模型分别生成可运行网页。用户实际体验后投票,平台再根据模型之间的胜负关系计算分数。
Kimi K3正式开源:全球首个3万亿级参数开源模型落地
火星财经消息,2026年7月27日晚,月之暗面kimi正式开源Kimi K3完整模型权重,为全球首个落地的3万亿参数级开源大模型。据第三方平台Artificial Analysis数据显示,K3在保持第一梯队性能的同时,BrowseComp基准单次任务成本仅为GPT-5.6 Sol的一半,较Claude Fable 5便宜近一个数量级。月之暗面称每个人都可以下载并部署 Kimi K3 模型——无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用,由此可见,开源社区有望迎来新一轮创新浪潮。 (科创板日报记者 李明明)