Fish Audio发布Drama 3:把TTS做成可编辑音频,错一个词只重做一个词
相关推荐
科大讯飞发布Spark-Audio-1.0-Preview全国产语音基座大模型
火星财经消息,9月16日,科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。据了解,Spark-Audio-1.0-Preview支持文本和语音两个模态的输入以及文本模态的输出,可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现,覆盖99种语言及202种方言识别,使智能语音完成从“听清”到“听懂”的跃升。目前,Spark-Audio-1.0-Preview正式开放体验,API后续将上线讯飞开放平台。
AI 语音初创公司 Fish Audio 完成 5200 万美元种子轮融资,Coreline Ventures 等领投
ChainCatcher 消息,AI 语音生成初创公司 Fish Audio 宣布完成 5200 万美元种子轮融资,由 Coreline Ventures 和 Capital Today 领投,359 Capital、Parable、Play Time 等机构参投。该公司由前英伟达研究员 Shijia Liao 创立,最初因不满市场上 AI 合成语音表现力不足,在单块 GPU 上训练出首个语音生成模型并开源。过去一年,Fish Audio 共推出 5 款模型,包括 4 款语音生成模型和 1 款语音转文本模型。
谷歌Gemini 3.8 TTS:30秒样本就能复刻声音
动察 Beating AI 快讯,谷歌发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,两款文本转语音模型已在 Gemini API 和 Google AI Studio 开放。Flash 主打音质、角色表演和长文本稳定性,Lite 偏向高吞吐、低延迟和低成本。 两款模型都能直接用文字设计新声线,也能用约 30 秒参考音频复刻本人或已获授权的声音。用户可以逐句控制情绪、节奏和口音,还能插入笑声、叹气、咳嗽等声音。双人对话也可以直接用一份剧本生成。Flash 支持 130 种语言,Lite 支持 101 种。 价格也比上一代低。到 2026 年 12 月 31 日,Flash 音频输出每百万 tokens 为 9 美元,Lite 为 6 美元;上一代 Gemini 3.1 Flash TTS Preview 为 20 美元。2027 年 1 月 1 日起,两款标准价会升至 18 美元和 12 美元。
kKimi K2.8 Preview 正式登陆 B.AI,API 与 Web Chat 双端同步开放
ChainCatcher 消息,B.AI 平台宣布 Moonshot AI 最新预览模型 Kimi K2.8 Preview 正式上线,面向开发者同步开放 API 与 Web Chat 双端体验。 该模型专为编程与 Agent 工作流打造,支持 1M(1,048,576 Token)超长上下文及文本、图片、视频多模态输入,综合性能直逼旗舰 Kimi K3,较 K2.7 Code 在思考效率与代码能力上进一步提升,并支持 Low/High/Max 三档灵活可调推理强度。 即日起,开发者可通过 B.AI 平台直接调用 Kimi K2.8 Preview。
阶跃StepAudio 3发布:语音推理、实时对话双榜第一
动察 Beating AI 快讯,阶跃星辰发布 StepAudio 3,一口气上线 Realtime、ASR、TTS、Gen 和 Music 五款语音模型。 在 Artificial Analysis 的两项语音评测中,StepAudio 3 Realtime 都排第一。Conversational Dynamics 得分 98.9%,高于 Qwen Audio 3.0 Realtime Plus 的 98.4% 和 GPT-Realtime-2 High 的 95.3%;Speech Reasoning 得分 99.7%,同样位列第一。前者主要测模型能不能处理停顿、轮流说话、用户打断和「嗯」「对」这类附和,后者测模型能否直接听懂音频并完成推理。 ASR 也在 Artificial Analysis 非流式语音识别榜做到 1.7% WER(词错误率),与 Fun-Realtime-ASR-preview 并列第一。另外,StepAudio 3 Gen 可以一次生成人声、音效、环境声和音乐,并按场景统一编排。 五款模型目前均已进入阶跃的语音产品线。
腾讯混元 Hy4 Preview 登陆 B.AI API
火星财经消息,9 月 2 日,B.AI 平台宣布腾讯混元团队最新开源旗舰模型 Hy4 Preview 正式上线 API 服务,面向开发者开放接入。该模型为 Hy4 系列早期版本,采用 770B 稀疏 MoE 架构,每 Token 激活 49B 参数,并支持 1M 超长上下文窗口。开发者可通过 B.AI API 官方渠道直接调用,登录 chat.b.ai/chat 或访问 docs.b.ai/zh-Hans/llmservice/models/hy4-preview/ 了解详情。