ElevenLabs v4登顶TTS榜,超过Gemini和Qwen
相关推荐
谷歌最强语音转写模型来了:准确率进前五,但还没打过ElevenLabs
动察 Beating AI 快讯,谷歌发布 Gemini 3.5 Transcribe,这是目前最准确的谷歌语音转写模型,也是谷歌首次在专用转写模型中加入 Smart 模式。模型分实时和录音转写两版,目前已开放 Gemini API 公测。Artificial Analysis 评测中,非流式 WER(词错误率,越低越好)为 2.6%,实时版为 4.0%。最终转写延迟相比上一代 Chirp 3 缩短 70%。 Smart 模式不再只是把声音逐字变成文字。比如你说「周二开会,不,周三」,它会直接留下「周三」;「嗯、啊」等口头禅也会自动删除,还能把口语整理成段落、列表、日期和数字。需要会议记录原话时,也可以继续使用默认的逐字转录模式。 模型支持 85 种以上语言和中途切换语言,还能加入自定义专业词汇。录音转写约每分钟 0.005 美元,也就是每 1000 分钟 5 美元;实时版约每分钟 0.009 美元。独立榜单上,它比 OpenAI GPT Transcribe 的 3.3% 更准,但还没超过 ElevenLabs Scribe v2:后者 WER 为 2.2%,每 1000 分钟约 3.67 美元。 这套模型已经用于 Android 的 Rambler 和 macOS 版 Gemini,接下来还会进入 Chrome。届时可以直接在网页输入框里说话打字。
谷歌Gemini 3.8 TTS:30秒样本就能复刻声音
动察 Beating AI 快讯,谷歌发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,两款文本转语音模型已在 Gemini API 和 Google AI Studio 开放。Flash 主打音质、角色表演和长文本稳定性,Lite 偏向高吞吐、低延迟和低成本。 两款模型都能直接用文字设计新声线,也能用约 30 秒参考音频复刻本人或已获授权的声音。用户可以逐句控制情绪、节奏和口音,还能插入笑声、叹气、咳嗽等声音。双人对话也可以直接用一份剧本生成。Flash 支持 130 种语言,Lite 支持 101 种。 价格也比上一代低。到 2026 年 12 月 31 日,Flash 音频输出每百万 tokens 为 9 美元,Lite 为 6 美元;上一代 Gemini 3.1 Flash TTS Preview 为 20 美元。2027 年 1 月 1 日起,两款标准价会升至 18 美元和 12 美元。
ElevenLabs Music v2.5上线:免费版也给商用权,每天5首无损下载
动察 Beating AI 快讯,ElevenLabs 上线 Music v2.5,并把它设为 ElevenMusic 默认模型。新版本重点提升旋律、编曲层次和乐器真实感。官方让 v2 和 v2.5 用相同提示词各生成一版,做了 47,885 组盲测,v2.5 在多数对比中获胜。R&B、灵魂乐、嘻哈、摇滚、金属、管弦和电影配乐的差距最大。 而且现在授权也放宽了。Free 用户每天能下载 5 首无损歌曲,生成内容可以商用,但必须标注「Made with ElevenMusic」;Pro 每月有 400 次无损下载,不需要标注,还能把歌曲发行到流媒体平台。作品创建时拿到的权限以后不会因为降级或退订改变。基于其他艺人歌曲做改编的作品则不能下载或对外发行。 ElevenLabs 还明确表示 Music v2 不会下线。Suno 最近上线 v6,同时退役此前所有旧模型,引发不少老用户不满。HN 有用户实测后认为,v2.5 音质更好,但音乐性还是更喜欢 Suno v5。
谷歌给Gemini加视频Agent:成本最高降66%
动察 Beating AI 快讯,谷歌给 Gemini API 上线 Agentic Video Understanding。它让模型自己决定看哪段视频、怎么检查。普通模式默认按 1 FPS 固定抽帧,再一次性放进上下文。新模式会自己沿时间轴找片段,并按问题选择画面、音频或转录文本。碰到快速动作,还能提高帧率重新检查。 Google 自测称,Gemini 3.7 Flash 开启后,Token 消耗最高下降 88%,分析成本最高下降 66%,准确率相对提升最高约 7%。它能定位不到 1 秒的瞬间,也能在几小时的视频里找一个细节。 技术上是把开发者以前要自己搭的「先定位、再精看」流程塞进 Gemini 内部。现在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 都支持。上传视频和 YouTube 视频都能用,也不另收功能费。之后还会接入 Gemini App 和 YouTube 的 Ask YouTube。
Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。
Qwen3.8-Omni-Flash上线:自己看视频、调工具、交成片
动察 Beating AI 快讯,阿里千问上线原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图片、音频、视频和 1M 上下文。 这代明显加强了音视频 Agent 能力。模型可以自己从视频里找信息、规划任务,再调用外部工具完成剪辑、配音和渲染。官方展示了长会议处理、短剧翻译、电影解说、MV 制作和视频转图文笔记等场景。 面对几小时的长视频,它也不用从头到尾全部处理。模型会先判断答案可能在哪,再逐步定位关键片段。OmniVideoBench 上,准确率从 63.4 提到 67.8,Token 消耗从 145,736 降到 79,117,少了 45.7%。 千问称,Qwen3.8-Omni-Flash 在 30 项评测上的平均成绩比 Qwen3.5-Omni-Plus 提升超过 26%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过后者。音频输入成本下降超过 98%,音视频输入下降超过 93%。 目前 Qwen3.8-Omni-Flash 模型权重尚未公开,只开放了 API。千问同时开源了 Qwen-MM-Plugins,可以装进 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,给它们补上图片、音频、长视频处理和视频剪辑能力。 另一套 Qwen-Live Harness 更像实时调度层。用户可以直接和实时全模态模型说话,再把复杂任务交给 Gemini CLI、Claude Code、Codex 等后台 Agent 持续执行。它会跟踪任务进度,做完后再主动回来告诉你结果。