传Google DeepMind拟裁超1/3:短期停更Pro,资源转向Flash
相关推荐
Google推出Gemini 3.8 Flash推理模型,今日起向Pro与Ultra用户开放
PANews 9月2日消息,Google Gemini 宣布其最新 Gemini 3.8 Flash 模型今日起向 Pro 与 Ultra 用户开放。官方称,该模型在日常话题行动建议、文本分析和复杂编码等任务中,将提供更可靠、更全面的回答,以增强高频使用场景下的实用性与执行效率。
Gemini3.8 Flash正式上线:价格不变,多项评测胜过Opus5
动察 Beating AI 快讯,Google 正式上线 Gemini 3.8 Flash。新模型继续主打长时间软件工程和自主 Agent。上下文约 100 万 Token,最高输出 6.5 万 Token。Google 的托管 Antigravity Agent 也已经默认换成 3.8 Flash。 Google 自家对比表里,3.8 Flash 在 14 组分数中拿下 8 组第一。DeepSWE v1.1 从 65.3% 升到 71.0%,接近 Opus 5 的 74.0%。Terminal-bench 2.1 则达到 89.4%,略高于 Opus 5 的 89.1% 和 GPT-5.6 Sol 的 88.8%。金融 Agent、法律 Agent、复杂图表推理和长视频理解也拿到最高分。 不过它没有全面超过旗舰。Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%。OSWorld-2.0 也以 59.0% 落后于 Opus 5 的 75.4%。 3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。
前Google DeepMind工程负责人做Fo:AI干不了,直接叫真人上
动察 Beating AI 快讯,前 Google DeepMind 工程负责人 Shivani Poddar 创办的 Wajo,正在主推个人 AI Agent Fo。它可以替用户打电话、发邮件、订服务和付款。AI 自己办不了的事情,会直接转给真人助理继续处理。 比如联系没有 API 的理发店、私人教练或本地商家,Fo 如果自己搞不定,就让真人帮用户打电话、沟通需求、把事情办完。真人只会拿到完成任务需要的信息,不会直接看到用户的全部聊天记录。 Wajo 还拿 104 个现实任务做了自测,每个任务重复 3 次。整个测试不使用真人兜底,Fo 的任务完成率为 71%,OpenClaw 为 42%,前者相对高约 69%。另一组安全测试专门检查 AI 会不会擅自联系别人、泄露隐私或做未经授权的决定,Fo 的通过率为 94%。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
DeepSeek V4.1 Flash即将上线,官方称全面超过V4 Pro
动察 Beating AI 快讯,DeepSeek 计划在 9 月 10 日前后正式发布 V4.1 Flash。官方称,经过内部和外部测试,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro。 V4.1 Flash 上线后,在 V4.1 Pro 发布之前,所有发往 V4 Pro 的请求都会自动切到 V4.1 Flash,并按更便宜的 Flash 价格计费。用户不需要修改原来的 V4 Pro 调用方式。
小米新一代模型MiMo-X首次亮相:Pro、Flash两款模型开启内测
动察 Beating AI 快讯,小米首次公布新一代 MiMo-X 系列,首批包括 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview 两款模型。目前公开的体验入口是新推出的 Xiaomi MiMo Desktop,获邀用户可限时、限量、免费使用。官方暂未公布两款模型的参数、上下文长度、基准成绩和 API 开放时间。 MiMo-X 面向复杂推理、多 Agent 协作、大型编程项目、Office、网页与交互设计、视频剪辑、3D 生成、音乐生成和电脑操控等专业工作场景。MiMo Desktop 可以直接读取文档、表格、图片、视频等素材,自动拆任务、调用工具和浏览器,并交付可继续编辑的 PPT、网页、App 等成果;大型任务还能拆给多个 Agent 协作。 小米三周前就在财报会上预告,首个 MiMo 桌面应用和新模型即将推出。这次两者一起进入预览测试。