微软补齐语音Agent全链路:边说边转写,语音生成低至45ms
相关推荐
微软MAI-Image-2.6-Flash卷性价比:快2.8倍,千张不到20美元
动察 Beating AI 快讯,Microsoft AI 推出 MAI-Image-2.6-Flash,并在 Microsoft Foundry 开放公共预览。它是旗舰模型 MAI-Image-2.6 的加速版,同样支持文生图、图片编辑、多图参考、联网获取最新信息和自动选择画面比例,重点是把生成延迟和成本继续压低。 速度是这次最大的卖点。MAI-Image-2.6-Flash 的生图速度是 GPT-Image-2 Medium 的 2.8 倍,GPU 使用效率高 72%。 但也不是纯靠牺牲画质换速度。Artificial Analysis 当前图片编辑榜里,MAI-Image-2.6-Flash 以 1311 Elo 排第三,略高于 GPT Image 2 high 的 1309;文生图则以 1297 Elo 排第八。旗舰 MAI-Image-2.6 的表现更强,目前分别排图片编辑第一、文生图第二。 微软 Foundry 上 MAI-Image-2.6-Flash 的图片输出价格为每百万 token 19 美元,旗舰 2.6 为 38 美元。Artificial Analysis 按代表性图片折算后,Flash 约为 19.5 美元/千张,而 GPT Image 2 high 约为 211 美元/千张。
DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化
动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。
微软收拢Agent研发:AI Frontiers从Research并入MAI
动察 Beating AI 快讯,微软把 AI Frontiers 从 Microsoft Research 调入 Mustafa Suleyman 领导的 Microsoft AI(MAI)。这支实验室 2023 年 10 月成立,主要研究小模型和 Agent。 AutoGen、FARA、Magentic-One、Magentic-UI、Phi 等项目都曾由这支团队参与开发。多 Agent 开源框架 AutoGen 后来与 AI 应用开发 SDK Semantic Kernel 一同汇入微软统一 Agent 开发框架 Microsoft Agent Framework。 AI Frontiers 接下来会继续做前沿 Agent 和模型研究。MAI 自己也在训练一系列模型,并组建了 Superintelligence 团队,目标是开发所谓「Humanist Superintelligence」。微软给它的定义是面向具体问题、保持在人类控制之下,并服务于人的高能力 AI。 AI Frontiers 原负责人 Ece Kamar 最近刚离开微软,结束 16 年任职。她把建立 AI Frontiers 称为自己微软生涯的亮点之一,目前还没有公布下一站。
SpaceXAI 发布 Grok Voice Transcribe 2
ChainCatcher 消息,SpaceXAI 发布 Grok Voice Transcribe 2,准确率提升一倍,价格保持不变。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。
微软新ASR模型比GPT-Transcribe快10倍,每小时只要0.1美元
动察 Beating AI 快讯,Microsoft AI 发布 MAI-Transcribe-2,并在 Microsoft Foundry 开放公共预览。新模型支持 60 种语言,新增说话人区分、逐词时间戳和专业词汇偏置。开发者可以提前塞入人名、药名或行业术语,减少冷门词被听错。 这次提升最明显的是速度。Artificial Analysis 的非实时转写测试里,MAI-Transcribe-2 达到约 410.7 倍实时速度,也就是 1 小时录音理论上约 9 秒处理完。GPT-Transcribe 约为 40 倍,前者快约 10 倍;Gemini 3.5 Transcribe 约为 89.8 倍。 准确率也在第一梯队。它在 FLEURS 的 60 种语言测试中平均 WER(词错误率,越低越好)为 5.2%,排名第一;在 Artificial Analysis 的另一套非实时英文测试中 WER 为 2.0%,排第二,仅低于阿里 Fun-Realtime-ASR-preview 的 1.7%。 价格目前只有每小时 0.10 美元,上一代 MAI-Transcribe-1.5 是 0.36 美元。不过这是限时价格,只持续到 2026 年 12 月 31 日,之后正式价格还没有公布。