MiniMax H3拿下视频编辑第一,文生和图生视频均排第二
相关推荐
Google视频模型重回榜首:Gemini Omni Flash登顶Video Arena
据动察 Beating 监测,Google DeepMind 新近公测的视频生成模型 Gemini Omni Flash,在 Video Arena 盲测天梯榜以 1404 的 Elo 评分登顶第一。新模型领先此前霸榜的字节跳动 Seedance 2.0 Mini 整整 101 分,刷新了这一榜单的最大分差纪录。 Video Arena 作为基于人类盲测投票的偏好榜单,此前一直由字节跳动旗下的 Seedance 系列模型占据前三。其中,Seedance 2.0 Mini 凭借更好的多镜头画面稳定性与更快的生成速度,以 1303 分位居第一。 此次 Gemini Omni Flash 的登顶标志着 Google 视频生成模型在半年内实现了对字节跳动等竞争对手的反超,从 Veo 时代的落后地位一举跃升至领跑位置。
传Gemini 3.7 Flash今天上线:价格或砍半,3.5 Pro已被跳过
据动察 Beating 监测,爆料博主 leo 称,谷歌最快今天推出 Gemini 3.7 Flash。API 价格可能降到每百万 Token 输入 0.75 美元、输出 3.75 美元。目前 Gemini 3.6 Flash 的标准价分别是 1.50 美元和 7.50 美元。新价格如果属实,相当于直接砍半。 Gemini 3.7 Flash 并非凭空传出。谷歌官方 Python GenAI SDK 此前一度加入 `gemini-3.7-flash`,随后又把相关 PR 改名为「internal」并关闭。社区因此早已猜测新模型临近发布。 更悬的是 Gemini 3.5 Pro。SemiAnalysis 上周称谷歌已经内部取消这款旗舰模型,团队转向规模更大的 Gemini 4。leo 也称自己听到了同样消息。
Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍
据动察 Beating 监测,评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。 在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。 模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。 作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。
谷歌宣布推出Gemini 3.7 Flash,年底前以限时优惠价格提供
据 动察 Beating监测,谷歌宣布推出 Gemini 3.7 Flash 模型。Gemini 3.7 Flash 将在今年年底前以限时优惠价格提供,输入价格为每 100 万 Token 0.75 美元,输出价格为每 100 万 Token 3.75 美元。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
「韩模之光」Solar Pro4智能指数冲到42分,但还是打不过DeepSeek V4Flash
据动察 Beating 监测,韩国 AI 公司 Upstage 发布旗舰推理模型 Solar Pro 4。Artificial Analysis 最新评测中,它的智能指数从上一代 Solar Pro 3 的 14 分冲到 42 分,主要提升来自 Agent 和长上下文能力。 其中 Terminal-Bench v2.1 从 12% 升到 57%,长上下文推理从 31 升到 71。GDPval-AA v2 也从 498 Elo 升到 1277,超过 1000 的人类基线。Solar Pro 4 已经是韩国模型冲击全球前列的一张代表牌。 但放到 DeepSeek V4 Flash 0731 面前,还是不够看。同一套 Artificial Analysis 智能指数里,DeepSeek 拿到 52 分,比 Solar Pro 4 高 10 分。DeepSeek 每秒输出约 122 个 Token,Solar Pro 4 约 65 个,前者接近快一倍。 价格差距更大。Solar Pro 4 每百万 Token 输入、输出分别要 0.30 和 1.20 美元,DeepSeek 只要 0.14 和 0.28 美元。Solar 的输出价格超过 DeepSeek 的 4 倍。 至少按这套综合评测和 API 性价比,「韩模之光」还没追上 DeepSeek。
SemiAnalysis:Gemini 已退出前沿竞争,GCP 正加速向第三方出售 TPU 获利
火星财经消息,研究机构 SemiAnalysis 发布分析指出,Google DeepMind 已不再属于前沿 AI 实验室行列。此前一周,DeepMind 联合创始人 Demis Hassabis 退出日常运营,Google 首席科学家 Jeff Dean 及 Gemini 联合负责人 Oriol Vinyals 等核心成员离职,创立新实验室 Discovery Loop。分析认为,Google 内部 Gemini 与 GCP 围绕算力分配的长期博弈已以 GCP 胜出告终。SemiAnalysis 称,Gemini 3.5 Pro 已被取消,Gemini 3.6 Flash 性能不及中国头部开源模型与 Grok 4.5,当前 Gemini 在大模型排名中已跌至第 8 或第 9 位。与此同时,GCP 正向 Anthropic 等竞争对手大量出售 TPU,过去 9 个月内已锁定数十万颗 TPU 的长期租赁及销售合同。Tokenomics 模型估算,Gemini 自身 ARR 约 120 亿美元,而 GCP 到 2027 年底第三方 AI 云服务收入将超 730 亿美元,TPU 系统销售额外贡献超 1200 亿美元。GCP 最新季度增速为 82%,预计 2027 年将因 TPU 系统销售而加速至 100% 以上,为 Google 每股收益贡献约 3 美元。