阶跃StepAudio 3发布:语音推理、实时对话双榜第一
相关推荐
微软新ASR模型比GPT-Transcribe快10倍,每小时只要0.1美元
动察 Beating AI 快讯,Microsoft AI 发布 MAI-Transcribe-2,并在 Microsoft Foundry 开放公共预览。新模型支持 60 种语言,新增说话人区分、逐词时间戳和专业词汇偏置。开发者可以提前塞入人名、药名或行业术语,减少冷门词被听错。 这次提升最明显的是速度。Artificial Analysis 的非实时转写测试里,MAI-Transcribe-2 达到约 410.7 倍实时速度,也就是 1 小时录音理论上约 9 秒处理完。GPT-Transcribe 约为 40 倍,前者快约 10 倍;Gemini 3.5 Transcribe 约为 89.8 倍。 准确率也在第一梯队。它在 FLEURS 的 60 种语言测试中平均 WER(词错误率,越低越好)为 5.2%,排名第一;在 Artificial Analysis 的另一套非实时英文测试中 WER 为 2.0%,排第二,仅低于阿里 Fun-Realtime-ASR-preview 的 1.7%。 价格目前只有每小时 0.10 美元,上一代 MAI-Transcribe-1.5 是 0.36 美元。不过这是限时价格,只持续到 2026 年 12 月 31 日,之后正式价格还没有公布。
Inworld TTS-2 正式上线:同声线盲测超过 Sonic3.6 登顶
动察 Beating AI 快讯,实时语音 AI 公司 Inworld 正式推出 Realtime TTS-2。Artificial Analysis 最新 Controlled Voice Arena 中,它以 1123 Elo 排第一,比 Cartesia Sonic 3.6 的 1119 高 4 分。这个榜让不同模型克隆同一组 8 个声音再盲测,主要看谁说得更自然、更像真人,包括发音、停顿、语调和节奏。 它会把前几轮真实语音也作为上下文,听用户的语气、节奏和情绪,再调整下一句话怎么说。开发者还能直接写「低声说」「像刚下班一样疲惫但温暖」这类自然语言指令,并加入笑、叹气、呼吸等声音。它还支持跨语言保持同一声线,以及用短录音克隆声音。 Inworld 官方称,这一代模型就是为了实时对话设计,会利用完整语音交流中的语调、节奏和情绪状态。
Grok全新语音模型拿下Agent评测第一,API价格涨60%
据动察 Beating 监测,SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。 Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。 性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。
Artificial Analysis重做智能榜:40%权重改用私有测试
动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。
Meta新ASR模型实时转写登顶,每小时只要0.18美元
动察 Beating AI 快讯,Meta Superintelligence Labs 发布 Muse Voice Transcribe。它把实时语音转文字、区分不同说话人、判断用户什么时候说完,全塞进一个模型。最长可以处理超过 1 小时的音频,同时区分 20 多个人。 在 Artificial Analysis 的英文实时转写测试中,它的 WER(词错误率,越低越好)为 3.1%。GPT Live Transcribe 为 3.9%,Gemini 3.5 Transcribe Live 为 4.0%。Muse Voice Transcribe 在说话结束后约 0.16 秒就能给出最终文本。 它没有给所有词固定同一个等待时间。模型每次读取 80ms 音频,自己决定继续听还是开始输出。简单的词可以更快写出来,难词就多听一点上下文再确定。Meta 用强化学习同时优化准确率和延迟。 模型用 70 多种语言训练,其中 25 种已经重点验证,还能直接识别一句话里中英文混说。目前已经接入 Meta AI for Mac 和 Muse Code,也开放 Meta Model API。价格为每 1000 分钟 3 美元,也就是每小时 0.18 美元。
MiniMax前技术合伙人融资600万美元做语音Agent
动察 Beating AI 快讯,MiniMax 前技术合伙人杨斌创办语音 AI 公司 BreezeBlue,已完成 600 万美元种子轮融资,由元璟资本、红点中国联合领投。团队目前约 15 人,主攻实时语音交互,最新模型为 Breeze TTS 2。 杨斌此前负责 MiniMax 图像和视频生成模型,现在却把创业方向转向声音。他判断,AI Agent 能干的活越来越复杂后,人反而很难一直盯着屏幕监督。语音可以让 Agent 干活时主动汇报、确认问题,人也能随时插嘴纠偏。