返回 7*24 快讯
来源Blockbeats

Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和

动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-09 03:31

Alexandr Wang:Muse的早期使用量已远超我们的预期

PANews 9月9日消息,Meta Platforms(META.O)首席人工智能官Alexandr Wang:Muse的早期使用量已远超我们的预期。如今,Muse用户的使用量是我们测试组用户的10倍。

09-03 09:11

DeepSWE一夜两换榜首:Gemini刚上去,Meta又报75.4%

动察 Beating AI 快讯,Gemini 3.8 Flash 刚发布时,Google 在 DeepSWE v1.1 上跑出 73.7%。DeepSWE 官方榜目前将它显示为 74%±1%,排在 Claude Opus 5 和 GPT-5.6 Sol 前面。几个小时后,Meta 又公布 Muse Spark 1.3,自己在同一套 DeepSWE 上跑到 75.4%,把公开成绩再往上推了 1.7 个百分点。 这项测试让 Agent 独立处理 113 个真实代码库里的长周期软件工程任务。Google 和 Meta 都使用 mini-swe-agent,Google 跑的是 high 推理档,Meta 跑的是 max。Meta 上一代 Spark 1.2 只有 55.0%,这次直接涨了 20.4 个百分点。不过 Meta 的 75.4% 目前还没进入 DeepSWE 官方榜。 在 Artificial Analysis 的 Coding Agent Index 中,限量预览的 Spark 1.3 max 得到 68 分,仅次于 Claude Opus 5;目前公开可用的 xhigh 版本则是 64 分。

09-02 20:19

Meta发布Muse Spark1.3模型,推进个人AI代理开发

动察 Beating AI 快讯,Meta 周三发布 Muse Spark 1.3 模型更新,称该版本在编码和智能代理(agentic)任务方面性能显著提升。 Meta AI 负责人亚历山大·王(Alexandr Wang)表示,新模型「与前沿模型竞争力相当」,并将为未来个人 AI 代理产品铺路,帮助用户实现可全天候代表用户工作的 AI 助手。Muse Spark 1.3 价格与上一版本保持一致,王称这一价格策略「具有进攻性」。 Meta 还表示,其「贡献者层级」(contributor tier)选项受到开发者欢迎,该计划通过允许 Meta 使用开发者作品改进模型,大幅降低编码产品成本,目前已有「有意义的两位数比例」开发者选择该选项。 亚历山大·王称,随着模型能力提升,安全问题已成为 Meta 内部的重要议题,公司正在增加安全和对齐投入。Muse Spark 1.3 当天将在 Muse Code 和 Meta API 上线,最高推理版本将在完成额外安全测试后推出。

09-03 14:05重要

Meta涨超4%创逾一个月新高,发布最强AI模型Muse Spark 1.3

火星财经消息 9月3日,Meta盘初涨约4.5%,最高触及619.42美元,创7月22日以来新高。消息面上,Meta发布迄今最强大AI模型Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计。Meta首席AI官Alexandr Wang表示,该模型在编码能力上超越OpenAI的GPT-5.6 Sol,与Anthropic的Claude Fable 5.1表现持平。(科股宝播报)

08-15 05:34

Meta重金挖来的余家辉,Muse全家桶刚交付就创业了

据动察 Beating 监测,余家辉宣布离开 Meta,准备创办一家新公司。他去年从 OpenAI 加入 Meta,与扎克伯格、汪滔一起组建 TBD Lab,负责多模态方向研发。一年多后,他选择离开大厂创业。 在 Meta 期间,余家辉参与了 Muse Spark、Voice Mode、Muse Image 和 Muse Video 等项目。就在他离职前,Muse Spark 刚更新到 1.2 版本。他表示,自己越来越被一个「对人类未来非常重要、但目前很少有人探索」的问题吸引,接下来会投入全部精力探索。新公司的名字和具体方向尚未公布。 余家辉此前曾负责 OpenAI 感知团队,也参与 Google DeepMind 的 Gemini 多模态研究。去年 Meta 组建超级智能实验室时,他是扎克伯格从 OpenAI 招募的核心研究员之一。 余家辉加入 Meta 时,正值硅谷 AI 人才争夺最激烈阶段。Meta 当时被曝向少数顶级人才提供第一年超过 1 亿美元的总薪酬,但公司随后否认所有核心员工都拿到这一水平。目前没有证据证明余家辉本人获得 1 亿美元年薪。

08-13 09:34

传Gemini 3.7 Flash今天上线:价格或砍半,3.5 Pro已被跳过

据动察 Beating 监测,爆料博主 leo 称,谷歌最快今天推出 Gemini 3.7 Flash。API 价格可能降到每百万 Token 输入 0.75 美元、输出 3.75 美元。目前 Gemini 3.6 Flash 的标准价分别是 1.50 美元和 7.50 美元。新价格如果属实,相当于直接砍半。 Gemini 3.7 Flash 并非凭空传出。谷歌官方 Python GenAI SDK 此前一度加入 `gemini-3.7-flash`,随后又把相关 PR 改名为「internal」并关闭。社区因此早已猜测新模型临近发布。 更悬的是 Gemini 3.5 Pro。SemiAnalysis 上周称谷歌已经内部取消这款旗舰模型,团队转向规模更大的 Gemini 4。leo 也称自己听到了同样消息。