Meta新ASR模型实时转写登顶,每小时只要0.18美元
相关推荐
Meta发布实时音频感知AI模型Muse Voice Transcribe,支持20余人分轨转写
PANews 9月2日消息,据IT之家援引9to5Mac报道,Meta推出首个实时音频感知模型Muse Voice Transcribe,开发者可通过Meta Model API调用,定价为每1,000分钟音频3美元(约合每小时0.18美元)。该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时可同步输出文字,无需等待完整录音结束后再处理。模型支持70余种语言(25种已验证)、超1小时音频及多语言切换,可在包含20余名说话者的录音中分离不同发言者。Meta引入自适应延迟机制,对易识别语音快速输出,对复杂词语调用更多上下文以兼顾速度与准确度。
微软新ASR模型比GPT-Transcribe快10倍,每小时只要0.1美元
动察 Beating AI 快讯,Microsoft AI 发布 MAI-Transcribe-2,并在 Microsoft Foundry 开放公共预览。新模型支持 60 种语言,新增说话人区分、逐词时间戳和专业词汇偏置。开发者可以提前塞入人名、药名或行业术语,减少冷门词被听错。 这次提升最明显的是速度。Artificial Analysis 的非实时转写测试里,MAI-Transcribe-2 达到约 410.7 倍实时速度,也就是 1 小时录音理论上约 9 秒处理完。GPT-Transcribe 约为 40 倍,前者快约 10 倍;Gemini 3.5 Transcribe 约为 89.8 倍。 准确率也在第一梯队。它在 FLEURS 的 60 种语言测试中平均 WER(词错误率,越低越好)为 5.2%,排名第一;在 Artificial Analysis 的另一套非实时英文测试中 WER 为 2.0%,排第二,仅低于阿里 Fun-Realtime-ASR-preview 的 1.7%。 价格目前只有每小时 0.10 美元,上一代 MAI-Transcribe-1.5 是 0.36 美元。不过这是限时价格,只持续到 2026 年 12 月 31 日,之后正式价格还没有公布。
Meta重金挖来的余家辉,Muse全家桶刚交付就创业了
据动察 Beating 监测,余家辉宣布离开 Meta,准备创办一家新公司。他去年从 OpenAI 加入 Meta,与扎克伯格、汪滔一起组建 TBD Lab,负责多模态方向研发。一年多后,他选择离开大厂创业。 在 Meta 期间,余家辉参与了 Muse Spark、Voice Mode、Muse Image 和 Muse Video 等项目。就在他离职前,Muse Spark 刚更新到 1.2 版本。他表示,自己越来越被一个「对人类未来非常重要、但目前很少有人探索」的问题吸引,接下来会投入全部精力探索。新公司的名字和具体方向尚未公布。 余家辉此前曾负责 OpenAI 感知团队,也参与 Google DeepMind 的 Gemini 多模态研究。去年 Meta 组建超级智能实验室时,他是扎克伯格从 OpenAI 招募的核心研究员之一。 余家辉加入 Meta 时,正值硅谷 AI 人才争夺最激烈阶段。Meta 当时被曝向少数顶级人才提供第一年超过 1 亿美元的总薪酬,但公司随后否认所有核心员工都拿到这一水平。目前没有证据证明余家辉本人获得 1 亿美元年薪。
Meta发布Muse:把OpenClaw做成普通人直接能用的产品
动察 Beating AI 快讯,Meta 发布个人 Agent Muse。和 OpenClaw、Hermes 最大的区别是,不用自己部署,也不用折腾模型、服务器和 Skill。Meta 直接提供独立云端环境,打开 App、网页或 WhatsApp 就能用。 和 Grok Bot 相比,Muse 不强调同时养多个 Agent,更偏一个长期跟着你的私人助手;和 Instinct 最接近,但 Muse 直接接入 Meta 自己的账号、App 和后续 AI 眼镜。 Muse 另一个重点是安全。密码、银行卡等敏感信息不会直接交给 Agent,付款和高风险操作会单独确认。
Meta发布Muse Spark1.3模型,推进个人AI代理开发
动察 Beating AI 快讯,Meta 周三发布 Muse Spark 1.3 模型更新,称该版本在编码和智能代理(agentic)任务方面性能显著提升。 Meta AI 负责人亚历山大·王(Alexandr Wang)表示,新模型「与前沿模型竞争力相当」,并将为未来个人 AI 代理产品铺路,帮助用户实现可全天候代表用户工作的 AI 助手。Muse Spark 1.3 价格与上一版本保持一致,王称这一价格策略「具有进攻性」。 Meta 还表示,其「贡献者层级」(contributor tier)选项受到开发者欢迎,该计划通过允许 Meta 使用开发者作品改进模型,大幅降低编码产品成本,目前已有「有意义的两位数比例」开发者选择该选项。 亚历山大·王称,随着模型能力提升,安全问题已成为 Meta 内部的重要议题,公司正在增加安全和对齐投入。Muse Spark 1.3 当天将在 Muse Code 和 Meta API 上线,最高推理版本将在完成额外安全测试后推出。
Meta涨超3.7%重回600美元,发布首个实时音频感知AI模型
火星财经消息 9月2日,Meta涨超3.7%,重回600美元上方。 消息面上,Meta推出首个实时音频感知模型Muse Voice Transcribe。该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。截至9月1日,Muse Voice Transcribe位列Artificial Analysis流式语音转文本排行榜第1名。(科股宝播报)