返回 7*24 快讯
来源Blockbeats

谷歌最强语音转写模型来了:准确率进前五,但还没打过ElevenLabs

动察 Beating AI 快讯,谷歌发布 Gemini 3.5 Transcribe,这是目前最准确的谷歌语音转写模型,也是谷歌首次在专用转写模型中加入 Smart 模式。模型分实时和录音转写两版,目前已开放 Gemini API 公测。Artificial Analysis 评测中,非流式 WER(词错误率,越低越好)为 2.6%,实时版为 4.0%。最终转写延迟相比上一代 Chirp 3 缩短 70%。 Smart 模式不再只是把声音逐字变成文字。比如你说「周二开会,不,周三」,它会直接留下「周三」;「嗯、啊」等口头禅也会自动删除,还能把口语整理成段落、列表、日期和数字。需要会议记录原话时,也可以继续使用默认的逐字转录模式。 模型支持 85 种以上语言和中途切换语言,还能加入自定义专业词汇。录音转写约每分钟 0.005 美元,也就是每 1000 分钟 5 美元;实时版约每分钟 0.009 美元。独立榜单上,它比 OpenAI GPT Transcribe 的 3.3% 更准,但还没超过 ElevenLabs Scribe v2:后者 WER 为 2.2%,每 1000 分钟约 3.67 美元。 这套模型已经用于 Android 的 Rambler 和 macOS 版 Gemini,接下来还会进入 Chrome。届时可以直接在网页输入框里说话打字。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-05 11:13

Artificial Analysis重做智能榜:40%权重改用私有测试

动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。

09-04 09:54

微软新ASR模型比GPT-Transcribe快10倍,每小时只要0.1美元

动察 Beating AI 快讯,Microsoft AI 发布 MAI-Transcribe-2,并在 Microsoft Foundry 开放公共预览。新模型支持 60 种语言,新增说话人区分、逐词时间戳和专业词汇偏置。开发者可以提前塞入人名、药名或行业术语,减少冷门词被听错。 这次提升最明显的是速度。Artificial Analysis 的非实时转写测试里,MAI-Transcribe-2 达到约 410.7 倍实时速度,也就是 1 小时录音理论上约 9 秒处理完。GPT-Transcribe 约为 40 倍,前者快约 10 倍;Gemini 3.5 Transcribe 约为 89.8 倍。 准确率也在第一梯队。它在 FLEURS 的 60 种语言测试中平均 WER(词错误率,越低越好)为 5.2%,排名第一;在 Artificial Analysis 的另一套非实时英文测试中 WER 为 2.0%,排第二,仅低于阿里 Fun-Realtime-ASR-preview 的 1.7%。 价格目前只有每小时 0.10 美元,上一代 MAI-Transcribe-1.5 是 0.36 美元。不过这是限时价格,只持续到 2026 年 12 月 31 日,之后正式价格还没有公布。

08-27 03:30

谷歌发布最新语音转文本模型Gemini 3.5 Transcribe

火星财经消息 8月27日,谷歌发布最新语音转文本模型Gemini 3.5 Transcribe。与传统语音识别工具不同,Gemini 3.5 Transcribe能够识别说话人的自我修正、自动删除口头禅,并直接将非结构化口语转换为格式化文本。谷歌称其为迄今“最精准”的语音转文本模型,并已将其引入Android版Gboard及Mac版Gemini应用,同时通过Gemini API向开发者开放预览。(广角观察)

09-04 04:29

B.AI 宣布 Gemini 3.8 Flash 正式接入 API

火星财经消息,9 月 4 日,B.AI 平台宣布 Google DeepMind 最新 Gemini 3.8 Flash 模型正式接入 API。该模型为 Gemini 3 家族最新一代主力模型,支持 1M Token 上下文窗口与原生多模态输入。据该平台介绍,Gemini 3.8 Flash 在保持 Flash 系列低延迟特点的同时,于软件工程、智能体任务及专业领域多步推理等方面有所提升,在金融和法律等专业领域同样有所表现,面向复杂推理与长期 Agent 工作流。官方 API 接入现已开放。

09-03 09:11

DeepSWE一夜两换榜首:Gemini刚上去,Meta又报75.4%

动察 Beating AI 快讯,Gemini 3.8 Flash 刚发布时,Google 在 DeepSWE v1.1 上跑出 73.7%。DeepSWE 官方榜目前将它显示为 74%±1%,排在 Claude Opus 5 和 GPT-5.6 Sol 前面。几个小时后,Meta 又公布 Muse Spark 1.3,自己在同一套 DeepSWE 上跑到 75.4%,把公开成绩再往上推了 1.7 个百分点。 这项测试让 Agent 独立处理 113 个真实代码库里的长周期软件工程任务。Google 和 Meta 都使用 mini-swe-agent,Google 跑的是 high 推理档,Meta 跑的是 max。Meta 上一代 Spark 1.2 只有 55.0%,这次直接涨了 20.4 个百分点。不过 Meta 的 75.4% 目前还没进入 DeepSWE 官方榜。 在 Artificial Analysis 的 Coding Agent Index 中,限量预览的 Spark 1.3 max 得到 68 分,仅次于 Claude Opus 5;目前公开可用的 xhigh 版本则是 64 分。

08-22 06:52

Gemini 3.7 Flash成爆款:上线一周破增长纪录

动察 Beating AI 快讯,谷歌 CEO Sundar Pichai 表示,Gemini 3.7 Flash 上线首周就打破了此前 Gemini 模型的增长纪录,成为谷歌迄今增长最快的 Gemini 模型。不过谷歌没有公布具体增长口径和使用规模。 这款模型确实踩中了性价比甜点区。Artificial Analysis 给它的综合智能指数为 56,高推理模式输出速度约 340 token/s,每项评测任务成本约 0.40 美元,并进入智能与完成时间的帕累托前沿。中等推理模式成本进一步降至 0.26 美元,进入智能与成本的帕累托前沿。 ARC Prize 的独立验证中,Gemini 3.7 Flash 高推理模式在 ARC-AGI-2(抽象推理基准)拿到 84.6%,每项任务成本仅 0.25 美元。 谷歌也迅速把 3.7 Flash 铺进自家产品。Gemini App、Antigravity、AI Studio 已经接入,Google Search 也开始使用该模型。