阿里巴巴发布更具成本效益的Qwen AI模型
相关推荐
阿里千问发布Qwen3.8-Flash模型
PANews 8月26日消息,阿里千问发布Qwen3.8-Flash模型,据介绍,这是一款多模态MoE模型,也是Qwen4架构的早期预览版。生产版Qwen3.8-Flash很快将通过Qwen Cloud API提供服务,价格仅为每100万输入Token 0.16美元、每100万输出Token 0.47美元。模型拥有1250亿参数+510亿 N-gram嵌入参数,但每个Token仅激活60亿参数,实现了极高的成本效益。
Qwen3.8-Flash发布一天就降价:输出比GLM便宜0.1元,但对手还在打5折
动察 Beating AI 快讯,Qwen3.8-Flash 刚发布一天,阿里云就降价了。每百万 Token 输入从 1 元降到 0.8 元,输出从 3 元降到 2.7 元,分别下降 20% 和 10%。 新价格刚好压过昨天发布的 GLM-5.3-Flash。后者 API 标价为输入 0.8 元、输出 2.8 元。Qwen 输入价格相同,输出便宜 0.1 元。 不过 GLM-5.3-Flash 上线后前两周打 5 折,目前实际价格只有输入 0.4 元、输出 1.4 元。优惠期内,GLM 仍然便宜近一半。等优惠结束,两款国产 Flash 模型的价格基本打平。
B.AI 宣布 Gemini 3.8 Flash 正式接入 API
火星财经消息,9 月 4 日,B.AI 平台宣布 Google DeepMind 最新 Gemini 3.8 Flash 模型正式接入 API。该模型为 Gemini 3 家族最新一代主力模型,支持 1M Token 上下文窗口与原生多模态输入。据该平台介绍,Gemini 3.8 Flash 在保持 Flash 系列低延迟特点的同时,于软件工程、智能体任务及专业领域多步推理等方面有所提升,在金融和法律等专业领域同样有所表现,面向复杂推理与长期 Agent 工作流。官方 API 接入现已开放。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
Qwen4还没发,架构先来了:Qwen3.8-Flash-Next明晚发布
动察 Beating AI 快讯,阿里把 Qwen4 的下一代架构提前拿出来了。ModelScope 上线 Qwen3.8-Flash-Next 预告页,这是一款基于 Qwen4 架构的多模态 MoE(混合专家模型,每次只调用部分参数),预计 8 月 26 日 23:00 公开发布。官方称,提前放出这套架构,是为了让社区为后续完整的 Qwen4 模型家族做准备。 所以严格说,明晚来的还不是 Qwen4 正式版,更像是一次「Qwen4 技术预览」。这种做法阿里以前用过。2025 年 Qwen3-Next 率先引入 Gated DeltaNet 和普通注意力混合架构,后来 Qwen3.5 系列继续沿用了这套设计。 阿里本月初才发布 2.4T 参数的 Qwen3.8-Max,不到一个月就开始公开下一代架构,节奏相当快。
B.AI 宣布 DeepSeek-V4.1-Flash 多模态模型上线
ChainCatcher 消息,B.AI 平台宣布 DeepSeek 原生多模态 MoE 大模型 DeepSeek-V4.1-Flash 正式上线。该模型采用 5520 亿参数主干与 Causal Encoder-Decoder 架构,输入与输出采用非对称计算规模。模型支持 100 万 Token 上下文与 384K Output,面向长周期编程 Agent、多模态工作流与高并发 Agent 系统。目前 Web Chat 与 API 双端接入均已开放。