小米发布MiMo-V2.6模型,称其为当前最强开源模型
相关推荐
小米新一代模型MiMo-X首次亮相:Pro、Flash两款模型开启内测
动察 Beating AI 快讯,小米首次公布新一代 MiMo-X 系列,首批包括 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview 两款模型。目前公开的体验入口是新推出的 Xiaomi MiMo Desktop,获邀用户可限时、限量、免费使用。官方暂未公布两款模型的参数、上下文长度、基准成绩和 API 开放时间。 MiMo-X 面向复杂推理、多 Agent 协作、大型编程项目、Office、网页与交互设计、视频剪辑、3D 生成、音乐生成和电脑操控等专业工作场景。MiMo Desktop 可以直接读取文档、表格、图片、视频等素材,自动拆任务、调用工具和浏览器,并交付可继续编辑的 PPT、网页、App 等成果;大型任务还能拆给多个 Agent 协作。 小米三周前就在财报会上预告,首个 MiMo 桌面应用和新模型即将推出。这次两者一起进入预览测试。
Artificial Analysis重做智能榜:40%权重改用私有测试
动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。
传Gemini 3.7 Flash今天上线:价格或砍半,3.5 Pro已被跳过
据动察 Beating 监测,爆料博主 leo 称,谷歌最快今天推出 Gemini 3.7 Flash。API 价格可能降到每百万 Token 输入 0.75 美元、输出 3.75 美元。目前 Gemini 3.6 Flash 的标准价分别是 1.50 美元和 7.50 美元。新价格如果属实,相当于直接砍半。 Gemini 3.7 Flash 并非凭空传出。谷歌官方 Python GenAI SDK 此前一度加入 `gemini-3.7-flash`,随后又把相关 PR 改名为「internal」并关闭。社区因此早已猜测新模型临近发布。 更悬的是 Gemini 3.5 Pro。SemiAnalysis 上周称谷歌已经内部取消这款旗舰模型,团队转向规模更大的 Gemini 4。leo 也称自己听到了同样消息。
DeepSeek V4.1 Flash即将上线,官方称全面超过V4 Pro
动察 Beating AI 快讯,DeepSeek 计划在 9 月 10 日前后正式发布 V4.1 Flash。官方称,经过内部和外部测试,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro。 V4.1 Flash 上线后,在 V4.1 Pro 发布之前,所有发往 V4 Pro 的请求都会自动切到 V4.1 Flash,并按更便宜的 Flash 价格计费。用户不需要修改原来的 V4 Pro 调用方式。
传Google DeepMind拟裁超1/3:短期停更Pro,资源转向Flash
据动察 Beating 监测,Google DeepMind 正在酝酿进一步重组,可能裁掉三分之一甚至更多员工。GDM 目前约有 7000 至 8000 人,重组将重点精简岗位和实际工作不匹配的冗余人员。 更大的变化是模型路线。谷歌短期没有更新 Pro 模型的计划,也将减少对 Fable、Opus 同级超大旗舰模型的投入,把更多资源转向成本更低、迭代更快的 Flash。 这可能和 GDM 能拿到的资源有关。GDM 最近一个考核年的整体 OKR 只有 0.5/1,过去一段时间很难争取到更多大型模型训练资源。搜索、YouTube、Gmail 等谷歌核心业务同样需要大量 TPU。 还有一个内部细节或许可以解释为什么谷歌 Gemini 模型体验不佳:GDM 核心团队此前从未真正把 Gemini 当成日常主力模型,反而是非核心团队仍被要求使用 Gemini。