返回 7*24 快讯
来源MarsBit

Gemini 3.7 Flash成爆款:上线一周破增长纪录

动察 Beating AI 快讯,谷歌 CEO Sundar Pichai 表示,Gemini 3.7 Flash 上线首周就打破了此前 Gemini 模型的增长纪录,成为谷歌迄今增长最快的 Gemini 模型。不过谷歌没有公布具体增长口径和使用规模。 这款模型确实踩中了性价比甜点区。Artificial Analysis 给它的综合智能指数为 56,高推理模式输出速度约 340 token/s,每项评测任务成本约 0.40 美元,并进入智能与完成时间的帕累托前沿。中等推理模式成本进一步降至 0.26 美元,进入智能与成本的帕累托前沿。 ARC Prize 的独立验证中,Gemini 3.7 Flash 高推理模式在 ARC-AGI-2(抽象推理基准)拿到 84.6%,每项任务成本仅 0.25 美元。 谷歌也迅速把 3.7 Flash 铺进自家产品。Gemini App、Antigravity、AI Studio 已经接入,Google Search 也开始使用该模型。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-05 11:13

Artificial Analysis重做智能榜:40%权重改用私有测试

动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。

09-03 09:11

DeepSWE一夜两换榜首:Gemini刚上去,Meta又报75.4%

动察 Beating AI 快讯,Gemini 3.8 Flash 刚发布时,Google 在 DeepSWE v1.1 上跑出 73.7%。DeepSWE 官方榜目前将它显示为 74%±1%,排在 Claude Opus 5 和 GPT-5.6 Sol 前面。几个小时后,Meta 又公布 Muse Spark 1.3,自己在同一套 DeepSWE 上跑到 75.4%,把公开成绩再往上推了 1.7 个百分点。 这项测试让 Agent 独立处理 113 个真实代码库里的长周期软件工程任务。Google 和 Meta 都使用 mini-swe-agent,Google 跑的是 high 推理档,Meta 跑的是 max。Meta 上一代 Spark 1.2 只有 55.0%,这次直接涨了 20.4 个百分点。不过 Meta 的 75.4% 目前还没进入 DeepSWE 官方榜。 在 Artificial Analysis 的 Coding Agent Index 中,限量预览的 Spark 1.3 max 得到 68 分,仅次于 Claude Opus 5;目前公开可用的 xhigh 版本则是 64 分。

09-02 15:31

Gemini3.8 Flash正式上线:价格不变,多项评测胜过Opus5

动察 Beating AI 快讯,Google 正式上线 Gemini 3.8 Flash。新模型继续主打长时间软件工程和自主 Agent。上下文约 100 万 Token,最高输出 6.5 万 Token。Google 的托管 Antigravity Agent 也已经默认换成 3.8 Flash。 Google 自家对比表里,3.8 Flash 在 14 组分数中拿下 8 组第一。DeepSWE v1.1 从 65.3% 升到 71.0%,接近 Opus 5 的 74.0%。Terminal-bench 2.1 则达到 89.4%,略高于 Opus 5 的 89.1% 和 GPT-5.6 Sol 的 88.8%。金融 Agent、法律 Agent、复杂图表推理和长视频理解也拿到最高分。 不过它没有全面超过旗舰。Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%。OSWorld-2.0 也以 59.0% 落后于 Opus 5 的 75.4%。 3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。

09-02 01:08

谷歌最快将于周三发布Gemini 3.8 Flash

动察 Beating AI 快讯,据《华尔街日报》记者 Erin Woo 援引员工消息报道,谷歌的人工智能研究部门将发布 Gemini 3.8 Flash 新模型,其编码能力得到显著增强。该模型内部代号为「Skimaki」,最早可能于周三(9 月 2 日)上线。在与谷歌内部编码工具 Jetski 的对比测试中,公司工程师对这款新模型的偏好程度超过了 Anthropic 的 Opus。

09-01 08:57

Gemini 3.8 Flash明天见?爆料称已完成生产部署

动察 Beating AI 快讯,Gemini 3.8 Flash 可能马上就要上线。爆料者 lyra 称,gemini-3.8-flash 已经完成部署,将在「明天」发布。 上周,《Business Insider》已经拿到内部截图。Gemini 3.8 Flash Preview 出现在 Google 内部编码平台 Jetski。一名试用员工称,它已经明显好于 3.7 Flash。 3.8 Flash 内部代号为 skimaki。这次主要在修 3.7 Flash 暴露的问题,同时减少模板化、啰嗦的「AI 废话」。 Gemini 3.7 Flash 才在 8 月 13 日发布,两代间隔还不到三周。

08-28 12:55

3.7发布仅两周,谷歌内部已测试Gemini 3.8 Flash

动察 Beating AI 快讯,谷歌已经开始内部测试 Gemini 3.8 Flash。《Business Insider》拿到的内部截图显示,新模型名为 Gemini 3.8 Flash Preview,已经向部分员工开放,并出现在谷歌内部编程平台 Jetski 上。 一名已经试用的员工称,3.8 Flash 用起来「明显好于」3.7 Flash,但也表示现在还太早,无法做完整评价。 Gemini 3.7 Flash 在 8 月 13 日正式发布,距离 3.8 内测消息曝光只有 14 天。而 3.7 本身距离 3.6 发布也只有三周。谷歌此前表示,希望把模型更新速度提高到接近每月一次。