Artificial Analysis重做智能榜:40%权重改用私有测试
相关推荐
Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍
据动察 Beating 监测,评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。 在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。 模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。 作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。
Citrini Research被SemiAnalysis收购,创始人拟成立新基金
动察 Beating AI 快讯,「AI 末日报告」发布机构 Citrini Research 创始人 James van Geelen 已将公司出售给芯片及 AI 研究机构 SemiAnalysis,交易金额尚未披露。Van Geelen 暂时将继续担任 Citrini CEO,并计划筹建一只新基金。 Citrini 目前在 Substack 拥有约 26 万名订阅者,今年 2 月因发布《2028 全球智能危机》报告走红。该报告设想 AI 快速取代白领岗位,引发市场对 AI 冲击就业和经济的讨论,并一度对软件股造成明显影响。 SemiAnalysis 由 Dylan Patel 于 2020 年创立,长期专注半导体和 AI 基础设施研究。Patel 表示,此次收购旨在扩大研究规模,并探索投资研究在 AI 时代的新形态。 Van Geelen 本人未透露新基金具体信息。此次交易也意味着 Citrini 在快速扩大影响力后,将与 SemiAnalysis 的半导体、AI 研究能力进一步结合。
25位菲尔兹奖得主集体炮轰AI公司:别把数学难题当Benchmark
动察 Beating AI 快讯,陶哲轩、邓煜、Peter Scholze 等 25 位菲尔兹奖得主联名发布声明,称 AI 公司正把解决重大数学难题当成 benchmark,已经开始伤害数学研究。声明承认,大模型最近几个月进步很快,已经能解决多个领域的重要未解问题,但数学更看重由此产生的新概念、新方法和理解。 他们最不满的是 AI 公司抢着公布结果。声明称,一些解法还没来得及整理完整证明、提炼新方法、补齐前人引用,就已经对外宣布,由此带来严重的署名和抄袭问题。没有数学家继续消化和整理这些结果,AI 找到的想法也很难真正进入数学体系。 声明没有点名 OpenAI,但《经济学人》的配套报道直接把标题写成「顶尖数学家对 OpenAI 的做法感到愤怒」。几天前,OpenAI 刚因 Navier-Stokes 证明陷入署名和未公开研究争议。陶哲轩称,这份声明是 25 位菲尔兹奖得主过去一周讨论后快速形成的,因为他们认为情况已经足够紧急。
Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和
动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。
腾讯混元Hy4重做底层:DeepSeek稀疏注意力+智谱IndexCache一起上
动察 Beating AI 快讯,腾讯混元 Hy4 preview 这次除了把模型做大,底层架构也大改了一轮。上一代 Hy3 使用传统全注意力,Hy4 改成了 Gated DSA,也就是 DeepSeek Sparse Attention 的门控版本。模型面对超长文本时,不再把前面所有内容都重新算一遍,而是先挑出最相关的部分重点处理。 Hy4 还给 DSA 加上了 IndexCache。模型每一层原本都要重新判断「哪些内容最重要」,现在部分层可以直接复用前面已经挑好的结果,少做很多重复计算。 腾讯明确表示,这套设计受到 DeepSeek 和 GLM 启发。 另一处变化是残差结构。传统 Transformer 可以粗略理解成只有一条信息主干,Hy4 用 iHC 把它扩成了 4 条,让模型在很深的网络里能同时保留更多信息。MoE 专家数量也从 Hy3 的 192 个增加到 256 个路由专家 + 1 个共享专家,每个 Token 选择 8 个路由专家,同时始终经过共享专家。
SemiAnalysis创始人:2028年AI大部分算力只属于两家公司
动察 Beating AI 快讯,SemiAnalysis 创始人 Dylan Patel 在最新播客中预测,到 2028 年,OpenAI 与 Anthropic 或将占据全球 70% 至 80% 的新增 AI 算力,合计算力规模可能超过 100GW。Patel 称,两家公司目前已占全球年度新增算力约 30%,且这一比例仍在快速上升。 Patel 指出,前沿 AI 实验室的商业模式正在发生变化,AI 算力产出效率大幅提升,Anthropic 当前每兆瓦算力对应的收入已达约 5000 万美元,并可能进一步升至 1 亿美元。这使 OpenAI、Anthropic 能够以每兆瓦 2500 万至 5000 万美元的高价采购或租赁算力。 更值得关注的是,Patel 预计 2024 年至 2029 年全球 AI 相关资本开支将达到约 11 万亿美元,其中超过 5 万亿美元需要通过债务融资完成。由于 AI 基础设施的潜在回报率远高于传统行业,科技巨头可能接受更高融资成本,从而推升整体信贷利率,并对传统资产估值及高负债经济体形成挤压。 此外,Patel 认为,未来新增算力未必主要用于对外提供模型推理服务,而可能更多流向 AI 实验室内部研发和模型自我改进。