4D世界模型首进鸿蒙手机
相关推荐
华为Mate90系列全系搭载旗舰韬芯片
火星财经消息,华为Mate90系列今日发布,全系搭载旗舰韬芯片。其中,华为Mate90搭载麒麟9030旗舰韬芯片,Mate90 Pro搭载麒麟9035旗舰韬芯片,Mate90 Pro Max搭载麒麟9050 Pro逻辑折叠韬芯片,并业界首发四卡三待eSim+实体卡。基于韬定律打造的逻辑折叠韬芯片,通过把逻辑单元一层层折叠起来,装上垂直互联的高速 "电梯",让信号"跑"得更快。 (科创板日报记者 黄心怡)
MiniMax 推出新一代极速文本模型 M3.1-Flash-Preview
PANews 9月27日消息,MiniMax 公布其最新文本模型 M3.1-Flash-Preview,已在 MiniMax Code 正式上线。该模型定位为日常开发场景,官方称其在代码开发中可用于快速修复 bug 与实现完整功能,强调响应速度与稳定性。MiniMax 同时在 MiniMax Code 推出限时活动:自 9 月 28 日至 10 月 7 日(UTC+8),用户每日签到可获得 2 倍积分,适用于包括 M3.1-Flash-Preview 在内的代码模型,以及用于生成视频的 H3 模型。
智谱GLM-5.3-Flash调用量增长73%
PANews 9月22日消息,据金十报道,全球头部大型API聚合平台OpenRouter最新日榜数据显示,智谱AI旗下GLM-5.3-Flash当日调用量达到4.36万亿Token,较上一统计周期增长73%,位列平台模型调用量第一。
智谱Coding Plan双节放量:Flash夜间免费,FlashX开放试用
动察 Beating AI 快讯,智谱给 GLM Coding Plan 开启双节活动。原定 9 月 20 日结束的 GLM-5.3-Flash 夜间畅用延长到 10 月 7 日。每天 23 点至次日 9 点,在 ZCode 中使用 Flash 不扣额度,其他支持的 Agent 则获得 2 倍 Flash 额度。 9 月 25 日至 10 月 7 日还会取消高峰期,全天按非高峰倍率扣额度。新版 Coding Plan 平时只有周一至周五 14 点至 18 点属于高峰期,其他时间只消耗 50% 积分。双节期间相当于全天都按这个倍率计算。 同时,刚上线的 GLM-5.3-FlashX 开始向 Coding Plan 用户滚动开放试用。用户提交申请并通过后,可以体验两周。FlashX 最高输出速度为 200 tokens/s,但消耗额度是普通 Flash 的 2.5 倍。
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
Qwen3.8-Omni-Flash上线:自己看视频、调工具、交成片
动察 Beating AI 快讯,阿里千问上线原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图片、音频、视频和 1M 上下文。 这代明显加强了音视频 Agent 能力。模型可以自己从视频里找信息、规划任务,再调用外部工具完成剪辑、配音和渲染。官方展示了长会议处理、短剧翻译、电影解说、MV 制作和视频转图文笔记等场景。 面对几小时的长视频,它也不用从头到尾全部处理。模型会先判断答案可能在哪,再逐步定位关键片段。OmniVideoBench 上,准确率从 63.4 提到 67.8,Token 消耗从 145,736 降到 79,117,少了 45.7%。 千问称,Qwen3.8-Omni-Flash 在 30 项评测上的平均成绩比 Qwen3.5-Omni-Plus 提升超过 26%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过后者。音频输入成本下降超过 98%,音视频输入下降超过 93%。 目前 Qwen3.8-Omni-Flash 模型权重尚未公开,只开放了 API。千问同时开源了 Qwen-MM-Plugins,可以装进 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,给它们补上图片、音频、长视频处理和视频剪辑能力。 另一套 Qwen-Live Harness 更像实时调度层。用户可以直接和实时全模态模型说话,再把复杂任务交给 Gemini CLI、Claude Code、Codex 等后台 Agent 持续执行。它会跟踪任务进度,做完后再主动回来告诉你结果。