千问发布 Qwen-Audio-3.1,下调 Qwen-Audio 全线语音模型价格
相关推荐
阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS
火星财经消息,7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus登顶,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。
阿里发布实时语音交互对话模型Qwen-Audio-3.0-Realtime
PANews 7月15日消息,据人民财讯报道,7月15日,阿里巴巴发布实时语音交互对话模型Qwen-Audio-3.0-Realtime,在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。模型包括推理更强的Plus版本和速度更快的Flash版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。
阿里发布Qwen-Audio-3.0-Realtime,语音AI会主动调用工具办事
据动察 Beating 监测,阿里发布实时语音模型 Qwen-Audio-3.0-Realtime。它能毫秒级回应,也能在对话中主动调用地图、API、MCP 和知识库等外部工具。 用户不必明确说出「调用工具」。例如先问附近的川菜馆,再问哪家评分高且距离近,模型会记住上一次查询结果,继续搜索和回答。 模型还能边说边听,允许用户随时打断。在嘈杂环境或多人交谈时,它会尝试识别主要说话人,减少被背景声音误打断。 语音也会随语境调整语气、节奏和情绪。官方提供推理更强的 Plus 版,以及响应更快的 Flash 版,目前已上线阿里云百炼。
阶跃StepAudio 3发布:语音推理、实时对话双榜第一
动察 Beating AI 快讯,阶跃星辰发布 StepAudio 3,一口气上线 Realtime、ASR、TTS、Gen 和 Music 五款语音模型。 在 Artificial Analysis 的两项语音评测中,StepAudio 3 Realtime 都排第一。Conversational Dynamics 得分 98.9%,高于 Qwen Audio 3.0 Realtime Plus 的 98.4% 和 GPT-Realtime-2 High 的 95.3%;Speech Reasoning 得分 99.7%,同样位列第一。前者主要测模型能不能处理停顿、轮流说话、用户打断和「嗯」「对」这类附和,后者测模型能否直接听懂音频并完成推理。 ASR 也在 Artificial Analysis 非流式语音识别榜做到 1.7% WER(词错误率),与 Fun-Realtime-ASR-preview 并列第一。另外,StepAudio 3 Gen 可以一次生成人声、音效、环境声和音乐,并按场景统一编排。 五款模型目前均已进入阶跃的语音产品线。
Qwen4还没发,架构先来了:Qwen3.8-Flash-Next明晚发布
动察 Beating AI 快讯,阿里把 Qwen4 的下一代架构提前拿出来了。ModelScope 上线 Qwen3.8-Flash-Next 预告页,这是一款基于 Qwen4 架构的多模态 MoE(混合专家模型,每次只调用部分参数),预计 8 月 26 日 23:00 公开发布。官方称,提前放出这套架构,是为了让社区为后续完整的 Qwen4 模型家族做准备。 所以严格说,明晚来的还不是 Qwen4 正式版,更像是一次「Qwen4 技术预览」。这种做法阿里以前用过。2025 年 Qwen3-Next 率先引入 Gated DeltaNet 和普通注意力混合架构,后来 Qwen3.5 系列继续沿用了这套设计。 阿里本月初才发布 2.4T 参数的 Qwen3.8-Max,不到一个月就开始公开下一代架构,节奏相当快。
云知声:语音大模型U2-ASR与U2-TTS升级
火星财经消息 7月28日,云知声在港交所公告,近日公司全面完成U2-ASR与U2-TTS的能力升级,本次升级中,U2-ASR新增13种国际语言识别能力,覆盖欧洲、东南亚、中东及拉美等重点出海市场;U2-TTS新增8种东南亚语言语音合成能力。(公司公告)