日本要拿Fugu当「国产AI」进自卫队,结果指挥模型一直是Qwen
相关推荐
Muse上线一周,稳居美国免费榜第二:只输ChatGPT,超过Gemini和Claude
动察 Beating AI 快讯,Meta 的个人 AI Agent 产品 Muse 上线一周,目前仍排在美国 App Store 免费 App 总榜第二,仅次于 ChatGPT,高于 Google Gemini 和 Claude。 Muse 是一个可以长期工作的个人 Agent,能连接邮箱、日历等服务,自己浏览网页、拆解任务,并在用户关闭 App 后继续后台执行。
Sakana升级「模型战队」:Ultra v2冲性能,Max压成本
动察 Beating AI 快讯,日本 AI 公司 Sakana AI 发布 Fugu Max 和 Fugu Ultra v2。 它们本质上都是「模型调度器」:先看任务,再挑合适的模型分工、互相检查,最后合成答案。 第一代 Fugu 就靠这套方法,让 GPT、Claude、Gemini 等模型组队,做到接近甚至部分超过当时更强的 Fable 5。 这次产品线分成两条。Fugu Max 主打省钱,模型池加入更多开放权重和专业模型,并优先选够用但更便宜的模型。官方称,在接近顶级模型性能时,成本约为对方的 1/2 到 1/6。Fugu Ultra v2 则只追求最高性能,8 项评测中有 5 项第一或并列第一,而且 Agent 池里没有 Fable 5、Fable 5.1 和 GPT-6 Astra。 不过,多模型来回切换可能降低上下文缓存复用,还会额外产生编排 token。Sakana 没公布 Max 的缓存命中率和单任务总 token 成本。初代 Fugu 也曾被用户吐槽慢、额度烧得快。
ElevenLabs v4登顶TTS榜,超过Gemini和Qwen
动察 Beating AI 快讯,ElevenLabs 发布新一代语音模型 Eleven v4 和实时版 Eleven v4 Turbo。v4 主打更自然的情绪和声音控制,Turbo 面向实时语音 Agent,中位推理延迟约 100ms。 在 Artificial Analysis 最新 TTS 盲测榜中,Eleven v4 目前以 1315 Elo 排第一。Cartesia Sonic 3.6 为 1275,Gemini 3.8 Flash TTS 为 1267,Qwen-Audio-3.0-TTS-Plus 为 1258。上一代 Eleven v3 目前只有 1169,排第 17。 v3 已经支持笑声、耳语等音频标签,v4 主要把这套控制做得更准。用户可以直接指定语气、节奏、情绪和音效,也可以用自然语言描述一句话该怎么说。模型还把语言覆盖从 70 多种扩到 90 多种,Instant Voice Clone 只需要约 10 秒音频,并增强了长文本和多人对话中的声音一致性。 Turbo 则专门解决实时对话的速度问题。官方文档显示,v3 Conversational 的中位推理延迟约为 280ms,v4 Turbo 降到约 100ms。
AI网络安全榜爆冷:GPT-6、Claude旗舰因安全拒答掉队,小米MiMo追平Grok登顶
动察 Beating AI 快讯,Artificial Analysis 推出独立的 Cyber Index,专门评测 AI Agent 做企业网络防御的能力。它不是从原来的通用 Intelligence Index 里抽几项测试,而是另外采用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项网络安全评测,分别测试漏洞审计与修补、漏洞发现,以及从发现漏洞到复现并修补的完整流程,三项各占三分之一。 首批榜单中,Grok 4.7(xhigh)和小米 MiMo-V2.6-Pro 同为 56 分,GPT-6 Luna(max)53 分,GLM-5.3-Flash 50 分。MiMo 平均每个任务成本只有 0.18 美元,Grok 4.7 要 11.67 美元;Luna 更低,只要 0.12 美元。 不过,这张榜不能简单理解成模型本身的网络安全能力排名。GPT-6 Sol、GPT-6 Astra 和 Claude Opus 5.5 都参加了测试,但在 CyberGym-E2E-AA 上几乎全部拒答,其中 Sol 和 Astra 拒绝全部任务,Opus 5.5 拒绝 98%。拒答直接记 0 分,Luna 反而愿意继续完成这些任务,所以综合成绩更高。Artificial Analysis 也表示,大量拒答让这些前沿模型的实际能力很难判断。 GLM-5.3 也出现了明显反常。完整版在 Artificial Analysis 的通用能力榜上高于 Flash,但这次 Cyber Index 只有 36 分,Flash 达到 50 分。主要差距来自 CyberGym-E2E-AA:Flash 得到 74%,完整版只有 29%。Artificial Analysis 暂未解释这一差距的原因。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
Claude、Grok、ChatGPT出现宕机或访问异常
动察 Beating AI 快讯,多家 AI 服务出现宕机/访问异常,包括: Claude:Claude 4.6/4.8/5/5.1 系列错误率均在上升。 Grok:Grok for Android 存在异常,grok api 服务在美东 1 区出现异常。 ChatGPT:网页版异常,部分用户客户端异常,未登录时登录可能出问题。