云知声:语音大模型U2-ASR与U2-TTS升级
相关推荐
小米发布并开源Xiaomi-CocktailASR-1
PANews 9月11日消息,小米正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。据介绍,Xiaomi-CocktailASR-1旨在解决“鸡尾酒会”难题。该模型采用端到端LLM架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的复杂环境中,精准提取并仅转录目标用户的语音。
微软新ASR模型比GPT-Transcribe快10倍,每小时只要0.1美元
动察 Beating AI 快讯,Microsoft AI 发布 MAI-Transcribe-2,并在 Microsoft Foundry 开放公共预览。新模型支持 60 种语言,新增说话人区分、逐词时间戳和专业词汇偏置。开发者可以提前塞入人名、药名或行业术语,减少冷门词被听错。 这次提升最明显的是速度。Artificial Analysis 的非实时转写测试里,MAI-Transcribe-2 达到约 410.7 倍实时速度,也就是 1 小时录音理论上约 9 秒处理完。GPT-Transcribe 约为 40 倍,前者快约 10 倍;Gemini 3.5 Transcribe 约为 89.8 倍。 准确率也在第一梯队。它在 FLEURS 的 60 种语言测试中平均 WER(词错误率,越低越好)为 5.2%,排名第一;在 Artificial Analysis 的另一套非实时英文测试中 WER 为 2.0%,排第二,仅低于阿里 Fun-Realtime-ASR-preview 的 1.7%。 价格目前只有每小时 0.10 美元,上一代 MAI-Transcribe-1.5 是 0.36 美元。不过这是限时价格,只持续到 2026 年 12 月 31 日,之后正式价格还没有公布。
Inworld TTS-2 正式上线:同声线盲测超过 Sonic3.6 登顶
动察 Beating AI 快讯,实时语音 AI 公司 Inworld 正式推出 Realtime TTS-2。Artificial Analysis 最新 Controlled Voice Arena 中,它以 1123 Elo 排第一,比 Cartesia Sonic 3.6 的 1119 高 4 分。这个榜让不同模型克隆同一组 8 个声音再盲测,主要看谁说得更自然、更像真人,包括发音、停顿、语调和节奏。 它会把前几轮真实语音也作为上下文,听用户的语气、节奏和情绪,再调整下一句话怎么说。开发者还能直接写「低声说」「像刚下班一样疲惫但温暖」这类自然语言指令,并加入笑、叹气、呼吸等声音。它还支持跨语言保持同一声线,以及用短录音克隆声音。 Inworld 官方称,这一代模型就是为了实时对话设计,会利用完整语音交流中的语调、节奏和情绪状态。
Scotts Miracle-Gro拉升涨超6%,特朗普称其是“很棒的公司”
Odaily星球日报讯 根据 MSX.COM 数据,“美乐棵”Scotts Miracle-Gro 股价拉升涨超 6%,特朗普称其是一家“很棒的公司”。 Scotts Miracle-Gro Company(斯科兹奇迹绿)是成立于 1868 年的美国园艺巨头,纽交所上市(代码:SMG),特朗普在谈到白宫翻修时表示,“有意思的是,我没有受到任何批评。这将成为全世界最伟大的军事综合设施加宴会厅。Scotts Miracle-Gro 免费提供了草坪。”
腾讯混元发布语音识别模型Hy ASR 3.0 preview
PANews 8月4日消息,据金十报道,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。基于最新一代大语言模型Hy3的语言理解能力,该模型能够在更复杂的真实输入中给出准确、连贯且更接近用户意图的转写结果。目前该模型已上线腾讯云官网对外提供API服务,可广泛应用于智能客服、内容理解、语音搜索等场景。元宝已完成首发上线,且免费开放;WorkBuddy等产品也在陆续接入中。
阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS
火星财经消息,7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus登顶,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。