DeepSWE一夜两换榜首:Gemini刚上去,Meta又报75.4%
相关推荐
Gemini3.8 Flash正式上线:价格不变,多项评测胜过Opus5
动察 Beating AI 快讯,Google 正式上线 Gemini 3.8 Flash。新模型继续主打长时间软件工程和自主 Agent。上下文约 100 万 Token,最高输出 6.5 万 Token。Google 的托管 Antigravity Agent 也已经默认换成 3.8 Flash。 Google 自家对比表里,3.8 Flash 在 14 组分数中拿下 8 组第一。DeepSWE v1.1 从 65.3% 升到 71.0%,接近 Opus 5 的 74.0%。Terminal-bench 2.1 则达到 89.4%,略高于 Opus 5 的 89.1% 和 GPT-5.6 Sol 的 88.8%。金融 Agent、法律 Agent、复杂图表推理和长视频理解也拿到最高分。 不过它没有全面超过旗舰。Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%。OSWorld-2.0 也以 59.0% 落后于 Opus 5 的 75.4%。 3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。
Google推出Gemini 3.8 Flash推理模型,今日起向Pro与Ultra用户开放
PANews 9月2日消息,Google Gemini 宣布其最新 Gemini 3.8 Flash 模型今日起向 Pro 与 Ultra 用户开放。官方称,该模型在日常话题行动建议、文本分析和复杂编码等任务中,将提供更可靠、更全面的回答,以增强高频使用场景下的实用性与执行效率。
Google 员工已测试下一代 Gemini 3.8 Flash 模型
火星财经消息,据 Business Insider 报道,Google 本月刚发布新 AI 模型后,部分员工已开始在内部编码平台 Jetski 上测试预览版 Gemini 3.8 Flash。一名测试员工称,该模型已明显优于 3.7 Flash,但强调目前过早,尚无法全面评价。Google 对此不予置评。在 3.5 Pro 仍未推出、Anthropic 与 OpenAI 持续加速的背景下,Google 已不再拥有前沿模型,转而加码速度更快、成本更低的 Flash 系列“主力模型”,用于编码和运行智能体。Gemini 3.6 Flash 于 7 月推出,3.7 Flash 仅三周后跟进。CEO 桑达尔·皮查伊在 Q2 财报会上表示,公司目标接近每月发布一次。员工预览暗示 Gemini 3.8 Flash 公开推出可能不远,但并非保证。部分 AI 观察者认为已在 Arena AI 基准测试网站上发现该模型踪迹,Google 此前曾用该平台测试即将发布的版本。Google 今年早些时候还推出了 Gemini Spark 智能体。
Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和
动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。
谷歌拟本周推出Gemini 3.8 Flash,内部测试显示编码能力优于Opus
谷歌旗下人工智能研究部门DeepMind正准备推出一款编程能力大幅升级的新模型Gemini 3.8 Flash,内部代号为“Skimaki”。该模型最早可能于当地时间周三(9月2日)上线。知情员工称,这款模型的编码能力较此前版本有显著提升,公司正试图借此补上今年以来相对Anthropic、OpenAI旗舰模型的短板。不过,对外发布窗口尚未由公司正式宣布,行业标准基准分数也尚未公开。(新浪财经)
谷歌最快将于周三发布Gemini 3.8 Flash
动察 Beating AI 快讯,据《华尔街日报》记者 Erin Woo 援引员工消息报道,谷歌的人工智能研究部门将发布 Gemini 3.8 Flash 新模型,其编码能力得到显著增强。该模型内部代号为「Skimaki」,最早可能于周三(9 月 2 日)上线。在与谷歌内部编码工具 Jetski 的对比测试中,公司工程师对这款新模型的偏好程度超过了 Anthropic 的 Opus。