返回 7*24 快讯
来源Blockbeats

DeepSWE一夜两换榜首:Gemini刚上去,Meta又报75.4%

动察 Beating AI 快讯,Gemini 3.8 Flash 刚发布时,Google 在 DeepSWE v1.1 上跑出 73.7%。DeepSWE 官方榜目前将它显示为 74%±1%,排在 Claude Opus 5 和 GPT-5.6 Sol 前面。几个小时后,Meta 又公布 Muse Spark 1.3,自己在同一套 DeepSWE 上跑到 75.4%,把公开成绩再往上推了 1.7 个百分点。 这项测试让 Agent 独立处理 113 个真实代码库里的长周期软件工程任务。Google 和 Meta 都使用 mini-swe-agent,Google 跑的是 high 推理档,Meta 跑的是 max。Meta 上一代 Spark 1.2 只有 55.0%,这次直接涨了 20.4 个百分点。不过 Meta 的 75.4% 目前还没进入 DeepSWE 官方榜。 在 Artificial Analysis 的 Coding Agent Index 中,限量预览的 Spark 1.3 max 得到 68 分,仅次于 Claude Opus 5;目前公开可用的 xhigh 版本则是 64 分。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-02 15:31

Gemini3.8 Flash正式上线:价格不变,多项评测胜过Opus5

动察 Beating AI 快讯,Google 正式上线 Gemini 3.8 Flash。新模型继续主打长时间软件工程和自主 Agent。上下文约 100 万 Token,最高输出 6.5 万 Token。Google 的托管 Antigravity Agent 也已经默认换成 3.8 Flash。 Google 自家对比表里,3.8 Flash 在 14 组分数中拿下 8 组第一。DeepSWE v1.1 从 65.3% 升到 71.0%,接近 Opus 5 的 74.0%。Terminal-bench 2.1 则达到 89.4%,略高于 Opus 5 的 89.1% 和 GPT-5.6 Sol 的 88.8%。金融 Agent、法律 Agent、复杂图表推理和长视频理解也拿到最高分。 不过它没有全面超过旗舰。Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%。OSWorld-2.0 也以 59.0% 落后于 Opus 5 的 75.4%。 3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。

09-02 15:44

Google推出Gemini 3.8 Flash推理模型,今日起向Pro与Ultra用户开放

PANews 9月2日消息,Google Gemini 宣布其最新 Gemini 3.8 Flash 模型今日起向 Pro 与 Ultra 用户开放。官方称,该模型在日常话题行动建议、文本分析和复杂编码等任务中,将提供更可靠、更全面的回答,以增强高频使用场景下的实用性与执行效率。

08-28 03:11

Google 员工已测试下一代 Gemini 3.8 Flash 模型

火星财经消息,据 Business Insider 报道,Google 本月刚发布新 AI 模型后,部分员工已开始在内部编码平台 Jetski 上测试预览版 Gemini 3.8 Flash。一名测试员工称,该模型已明显优于 3.7 Flash,但强调目前过早,尚无法全面评价。Google 对此不予置评。在 3.5 Pro 仍未推出、Anthropic 与 OpenAI 持续加速的背景下,Google 已不再拥有前沿模型,转而加码速度更快、成本更低的 Flash 系列“主力模型”,用于编码和运行智能体。Gemini 3.6 Flash 于 7 月推出,3.7 Flash 仅三周后跟进。CEO 桑达尔·皮查伊在 Q2 财报会上表示,公司目标接近每月发布一次。员工预览暗示 Gemini 3.8 Flash 公开推出可能不远,但并非保证。部分 AI 观察者认为已在 Arena AI 基准测试网站上发现该模型踪迹,Google 此前曾用该平台测试即将发布的版本。Google 今年早些时候还推出了 Gemini Spark 智能体。

09-08 08:22

Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和

动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。

09-03 02:18

谷歌拟本周推出Gemini 3.8 Flash,内部测试显示编码能力优于Opus

谷歌旗下人工智能研究部门DeepMind正准备推出一款编程能力大幅升级的新模型Gemini 3.8 Flash,内部代号为“Skimaki”。该模型最早可能于当地时间周三(9月2日)上线。知情员工称,这款模型的编码能力较此前版本有显著提升,公司正试图借此补上今年以来相对Anthropic、OpenAI旗舰模型的短板。不过,对外发布窗口尚未由公司正式宣布,行业标准基准分数也尚未公开。(新浪财经)

09-02 01:08

谷歌最快将于周三发布Gemini 3.8 Flash

动察 Beating AI 快讯,据《华尔街日报》记者 Erin Woo 援引员工消息报道,谷歌的人工智能研究部门将发布 Gemini 3.8 Flash 新模型,其编码能力得到显著增强。该模型内部代号为「Skimaki」,最早可能于周三(9 月 2 日)上线。在与谷歌内部编码工具 Jetski 的对比测试中,公司工程师对这款新模型的偏好程度超过了 Anthropic 的 Opus。