Interfaze把Qwen、Whisper等模型接成一套AI工具箱
相关推荐
ElevenLabs v4登顶TTS榜,超过Gemini和Qwen
动察 Beating AI 快讯,ElevenLabs 发布新一代语音模型 Eleven v4 和实时版 Eleven v4 Turbo。v4 主打更自然的情绪和声音控制,Turbo 面向实时语音 Agent,中位推理延迟约 100ms。 在 Artificial Analysis 最新 TTS 盲测榜中,Eleven v4 目前以 1315 Elo 排第一。Cartesia Sonic 3.6 为 1275,Gemini 3.8 Flash TTS 为 1267,Qwen-Audio-3.0-TTS-Plus 为 1258。上一代 Eleven v3 目前只有 1169,排第 17。 v3 已经支持笑声、耳语等音频标签,v4 主要把这套控制做得更准。用户可以直接指定语气、节奏、情绪和音效,也可以用自然语言描述一句话该怎么说。模型还把语言覆盖从 70 多种扩到 90 多种,Instant Voice Clone 只需要约 10 秒音频,并增强了长文本和多人对话中的声音一致性。 Turbo 则专门解决实时对话的速度问题。官方文档显示,v3 Conversational 的中位推理延迟约为 280ms,v4 Turbo 降到约 100ms。
阿里也做AI终端,QwenBook先从办公平板下手
动察 Beating AI 快讯,《晚点 LatePost》称,阿里云无影团队正在研发 QwenBook,一款主打办公的「原生智能体电脑」,形态更接近平板加键盘。产品定义和硬件由团队自研,并用上无影已有的系统和端云能力。目前接入 Qwen3.8-Max 和 Qwen3.8-Flash。IT之家今天也在云栖大会现场看到了演示真机。 简单说,阿里想把千问直接放进系统里,让 Agent 能拿到文件、会议记录等上下文,再调用工具完成任务,而不只是做一个聊天 App。QwenBook 目前已经做了听记、Wiki、智能文件夹、邮箱、知识库 MyNote 和记忆管理 MyZone 等自有应用,还在与金山合作接入 WPS。 这和豆包手机的路线不太一样。豆包主要通过读屏和模拟点击,直接操作手机里已有的 App;QwenBook 先从自己能控制的办公应用做起。豆包这条路此前已经碰到第三方 App 的限制。新发布的努比亚 NaviX Ultra,目前仍无法在微信、淘宝、美团、小红书等应用内自动执行任务。 QwenBook 目前仍是早期试水项目。《晚点》称团队约 150 人,今年 4 月左右启动,完整产品预计到今年底或明年初才会发布。阿里现阶段更像是在先搭一套 Agent 能真正动手干活的办公环境,再慢慢往外接第三方软件。
Qwen半年两轮高层调整,刘大一恒正式接掌大模型
动察 Beating AI 快讯,阿里已任命刘大一恒为 Qwen 大语言模型负责人。云栖大会官网也已将他的头衔更新为「Qwen LLM 项目负责人」。 刘大一恒 2021 年加入阿里,此后一直是 Qwen 核心研发成员。今年 3 月,Qwen 技术负责人林俊旸离职创业;6 月,负责 AI 模型研发的周靖人卸任相关管理职务,转任阿里首席科学家。半年内连续调整后,Qwen 大语言模型线的负责人现在正式明确。 刘大一恒也被放到了今年云栖大会的核心位置。大会官网的演讲嘉宾中,他排在阿里主席蔡崇信和 CEO 吴泳铭之后,并将在主论坛发表「Qwen:迈向真实世界智能体」演讲。
Jina魔改DeepSeek-OCR,自测14款里页面吞吐第一
动察 Beating AI 快讯,Jina AI 发布文档解析模型 jina-ocr-v1,可以把 PDF、扫描件、表格和图表直接转成 Markdown。它基于 DeepSeek-OCR 做后训练,沿用其约 34 亿总参数、解码时每个 Token 激活约 5.7 亿参数的 MoE 架构,并加入 FastMTP 推测解码。 Jina 自测中,jina-ocr-v1 在 OmniDocBench v1.6 得 91.14,比 DeepSeek-OCR-2 高 0.89 分;在 olmOCR-Bench 得 83.4,比它实际基于的 DeepSeek-OCR 底模高 7.4 分。 吞吐量是 Jina 主打的卖点之一。单张 A100、并发 32 时,它达到 2.57 页/秒,在 Jina 测试的 14 个系统中最高,比 DeepSeek-OCR 的 2.10 页/秒高约 22%。 模型权重已经放上 Hugging Face,采用 CC BY-NC 4.0,商业使用需要联系 Jina。
PrismML把Qwen3.8 27B压到5.9GB,自测保留98.2%性能
动察 Beating AI 快讯,加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 发布 Ternary Bonsai 2 27B,把 Qwen3.8 27B 的 270 亿参数模型压到 5.9GB。它把权重压成 -1、0、+1 三种值,体积只有 FP16 原版约九分之一。模型支持 26.2 万 Token 上下文、图文输入和 Agent 工具调用,并以 Apache 2.0 许可开放权重。 相比两个月前的第一代 Bonsai 27B,新版体积基本没变,但底模从 Qwen3.6 换成了 Qwen3.8。PrismML 自测称,综合基准成绩相对完整版的保留率从约 95% 提到 98.2%,其中数学和代码成绩已经非常接近原版。官方还演示了它在 RTX 5090 上直接跑 Cline 编程 Agent 和 Computer Use。
Qwen3.8-Omni-Flash上线:自己看视频、调工具、交成片
动察 Beating AI 快讯,阿里千问上线原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图片、音频、视频和 1M 上下文。 这代明显加强了音视频 Agent 能力。模型可以自己从视频里找信息、规划任务,再调用外部工具完成剪辑、配音和渲染。官方展示了长会议处理、短剧翻译、电影解说、MV 制作和视频转图文笔记等场景。 面对几小时的长视频,它也不用从头到尾全部处理。模型会先判断答案可能在哪,再逐步定位关键片段。OmniVideoBench 上,准确率从 63.4 提到 67.8,Token 消耗从 145,736 降到 79,117,少了 45.7%。 千问称,Qwen3.8-Omni-Flash 在 30 项评测上的平均成绩比 Qwen3.5-Omni-Plus 提升超过 26%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过后者。音频输入成本下降超过 98%,音视频输入下降超过 93%。 目前 Qwen3.8-Omni-Flash 模型权重尚未公开,只开放了 API。千问同时开源了 Qwen-MM-Plugins,可以装进 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,给它们补上图片、音频、长视频处理和视频剪辑能力。 另一套 Qwen-Live Harness 更像实时调度层。用户可以直接和实时全模态模型说话,再把复杂任务交给 Gemini CLI、Claude Code、Codex 等后台 Agent 持续执行。它会跟踪任务进度,做完后再主动回来告诉你结果。