Qwen4还没发,架构先来了:Qwen3.8-Flash-Next明晚发布
相关推荐
Qwen3.8-Flash发布一天就降价:输出比GLM便宜0.1元,但对手还在打5折
动察 Beating AI 快讯,Qwen3.8-Flash 刚发布一天,阿里云就降价了。每百万 Token 输入从 1 元降到 0.8 元,输出从 3 元降到 2.7 元,分别下降 20% 和 10%。 新价格刚好压过昨天发布的 GLM-5.3-Flash。后者 API 标价为输入 0.8 元、输出 2.8 元。Qwen 输入价格相同,输出便宜 0.1 元。 不过 GLM-5.3-Flash 上线后前两周打 5 折,目前实际价格只有输入 0.4 元、输出 1.4 元。优惠期内,GLM 仍然便宜近一半。等优惠结束,两款国产 Flash 模型的价格基本打平。
阿里千问发布Qwen3.8-Flash模型
PANews 8月26日消息,阿里千问发布Qwen3.8-Flash模型,据介绍,这是一款多模态MoE模型,也是Qwen4架构的早期预览版。生产版Qwen3.8-Flash很快将通过Qwen Cloud API提供服务,价格仅为每100万输入Token 0.16美元、每100万输出Token 0.47美元。模型拥有1250亿参数+510亿 N-gram嵌入参数,但每个Token仅激活60亿参数,实现了极高的成本效益。
阿里云:下调Qwen3.8-Flash模型模式计费单价
火星财经消息 8月27日,阿里云发布通知,大模型服务平台百炼2026年8月27日12:00:00起,对Qwen3.8-Flash模型模式计费单价进行下调调整。具体如下:输入价格调整前1元,调整后0.8元;输出价格调整前3元,调整后2.7元。(广角观察)
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
阿里巴巴发布更具成本效益的Qwen AI模型
Odaily星球日报讯 阿里千问发布 Qwen3.8-Flash 模型,据介绍,这是一款多模态 MoE 模型,也是 Qwen4 架构的早期预览版。生产版 Qwen3.8-Flash 很快将通过 Qwen Cloud API 提供服务,价格仅为每 100 万输入 Token 0.16 美元、每 100 万输出 Token 0.47 美元。模型拥有 1250 亿参数+510 亿 N-gram 嵌入参数,但每个 Token 仅激活 60 亿参数,实现了极高的成本效益。(金十)
蚂蚁Ling-3.0-flash正式开源,FP8版仅128GB
据动察 Beating 监测,蚂蚁百灵(inclusionAI)正式开放 Ling-3.0-flash 权重,同时提供 BF16 原版和 FP8 量化版。两版均采用 MIT 许可证,已上线 Hugging Face 和 ModelScope,可用 SGLang 或 vLLM 自行部署。 BF16 版权重约 255GB,FP8 版约 128GB,体积接近减半。FP8 用更低精度保存参数,可以降低存储和显存门槛。官方列出的 4 项测试中,FP8 与 BF16 的最大分差为 1.57 分。 Ling-3.0-flash 总参数 1240 亿,每次生成只激活 51 亿。模型支持 25.6 万 Token 上下文,主要面向编程、搜索、深度研究和工具调用等 Agent 任务。官方评测显示,它在多数基准上达到或超过万亿参数的前代模型 Ring-2.6-1T。