Grok实时语音转写冲到第一,价格只有OpenAI五分之一
相关推荐
SpaceXAI 发布 Grok Voice Transcribe 2
ChainCatcher 消息,SpaceXAI 发布 Grok Voice Transcribe 2,准确率提升一倍,价格保持不变。
传OpenAI下周发Codex Bot,直接对标Grok Bot
动察 Beating AI 快讯,AI 博主 Mark Kretschmann 爆料,OpenAI 正准备推出一款暂称 Codex Bot 的新产品,基于 OpenClaw 开发。原计划本周发布,目前已推迟到下周。 Sam Altman 今天刚表示,原定本周发布的「主要新东西」延至下周;而 OpenAI 今年 2 月招募 OpenClaw 创始人 Peter Steinberger 时,也称他将负责开发「下一代个人 Agent」。 Mark 称,Codex Bot 会比现有 ChatGPT Work 更像 Grok Bot。后者相当于一组长期在线的「AI 同事」,可以使用自己的工作环境,跨网站和 App 持续干活。
SpaceXAI要收拾订阅乱局,Grok和Cursor几周内统一套餐
动察 Beating AI 快讯,SpaceXAI 产品负责人 Maxime Prades 确认,公司正在统一 Grok 和 Cursor 的订阅方案,预计几周内准备好。 一名用户此前吐槽现有套餐太乱,建议只保留 X 和 Cursor 两套订阅,让 X Premium+ 包含 Cursor Pro,并停掉 Grok Build。Prades 没有确认这些具体建议,只说新方案已经在做,还邀请这名用户提前看方案给反馈。 现在的体系确实很绕。Cursor Pro、Pro+、Ultra 都带 Grok Bot;SuperGrok 和 X Premium+ 也能给 Cursor 账户开 Grok Bot。但两边的 Grok Bot 用量不会叠加,订阅仍然各自续费。Cursor 社区最近也反复有人问 SuperGrok Heavy 和 Cursor Ultra 到底该买哪个、额度是否共享。
Artificial Analysis重做智能榜:40%权重改用私有测试
动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。
微软新ASR模型比GPT-Transcribe快10倍,每小时只要0.1美元
动察 Beating AI 快讯,Microsoft AI 发布 MAI-Transcribe-2,并在 Microsoft Foundry 开放公共预览。新模型支持 60 种语言,新增说话人区分、逐词时间戳和专业词汇偏置。开发者可以提前塞入人名、药名或行业术语,减少冷门词被听错。 这次提升最明显的是速度。Artificial Analysis 的非实时转写测试里,MAI-Transcribe-2 达到约 410.7 倍实时速度,也就是 1 小时录音理论上约 9 秒处理完。GPT-Transcribe 约为 40 倍,前者快约 10 倍;Gemini 3.5 Transcribe 约为 89.8 倍。 准确率也在第一梯队。它在 FLEURS 的 60 种语言测试中平均 WER(词错误率,越低越好)为 5.2%,排名第一;在 Artificial Analysis 的另一套非实时英文测试中 WER 为 2.0%,排第二,仅低于阿里 Fun-Realtime-ASR-preview 的 1.7%。 价格目前只有每小时 0.10 美元,上一代 MAI-Transcribe-1.5 是 0.36 美元。不过这是限时价格,只持续到 2026 年 12 月 31 日,之后正式价格还没有公布。
Meta发布实时音频感知AI模型Muse Voice Transcribe,支持20余人分轨转写
PANews 9月2日消息,据IT之家援引9to5Mac报道,Meta推出首个实时音频感知模型Muse Voice Transcribe,开发者可通过Meta Model API调用,定价为每1,000分钟音频3美元(约合每小时0.18美元)。该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时可同步输出文字,无需等待完整录音结束后再处理。模型支持70余种语言(25种已验证)、超1小时音频及多语言切换,可在包含20余名说话者的录音中分离不同发言者。Meta引入自适应延迟机制,对易识别语音快速输出,对复杂词语调用更多上下文以兼顾速度与准确度。