阿里发布Qwen-Audio-3.0-Realtime,语音AI会主动调用工具办事
相关推荐
Qwen3.8-Flash发布一天就降价:输出比GLM便宜0.1元,但对手还在打5折
动察 Beating AI 快讯,Qwen3.8-Flash 刚发布一天,阿里云就降价了。每百万 Token 输入从 1 元降到 0.8 元,输出从 3 元降到 2.7 元,分别下降 20% 和 10%。 新价格刚好压过昨天发布的 GLM-5.3-Flash。后者 API 标价为输入 0.8 元、输出 2.8 元。Qwen 输入价格相同,输出便宜 0.1 元。 不过 GLM-5.3-Flash 上线后前两周打 5 折,目前实际价格只有输入 0.4 元、输出 1.4 元。优惠期内,GLM 仍然便宜近一半。等优惠结束,两款国产 Flash 模型的价格基本打平。
信通院MCP专项测试:StartLux-27B综合第二,超越284B DeepSeek V4 Flash
火星财经消息 8月31日,中国信通院人工智能研究所公布的可信AI大模型基准测试MCP专项测试显示,上海原点星辉研发的StartLux-V1.0-27B-Preview以27B参数量取得综合性能排名第二,得分39.25%,高于第三名284B的DeepSeek-V4-Flash-0731(38.24%),并以1个百分点之差紧追1.6T的DeepSeek-V4-Pro。测试于8月3日启动,经三轮完整测试取均值,覆盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理及3D设计6类专项共7项检验。 同等参数规模下,StartLux-27B较Qwen-3.6-27B高出5.34个百分点;位置导航任务排名第一,浏览器自动化、金融分析与DeepSeek-V4-Pro并列第一。该模型以Qwen3.6-27B为基座,采用"AI训练AI"方法后训练,是国内首个以此方法进行后训练的本地Agent模型,可在消费级个人电脑运行,团队计划年内推出第一代本地智能解决方案。
阿里千问发布Qwen3.8-Flash模型
PANews 8月26日消息,阿里千问发布Qwen3.8-Flash模型,据介绍,这是一款多模态MoE模型,也是Qwen4架构的早期预览版。生产版Qwen3.8-Flash很快将通过Qwen Cloud API提供服务,价格仅为每100万输入Token 0.16美元、每100万输出Token 0.47美元。模型拥有1250亿参数+510亿 N-gram嵌入参数,但每个Token仅激活60亿参数,实现了极高的成本效益。
Qwen4还没发,架构先来了:Qwen3.8-Flash-Next明晚发布
动察 Beating AI 快讯,阿里把 Qwen4 的下一代架构提前拿出来了。ModelScope 上线 Qwen3.8-Flash-Next 预告页,这是一款基于 Qwen4 架构的多模态 MoE(混合专家模型,每次只调用部分参数),预计 8 月 26 日 23:00 公开发布。官方称,提前放出这套架构,是为了让社区为后续完整的 Qwen4 模型家族做准备。 所以严格说,明晚来的还不是 Qwen4 正式版,更像是一次「Qwen4 技术预览」。这种做法阿里以前用过。2025 年 Qwen3-Next 率先引入 Gated DeltaNet 和普通注意力混合架构,后来 Qwen3.5 系列继续沿用了这套设计。 阿里本月初才发布 2.4T 参数的 Qwen3.8-Max,不到一个月就开始公开下一代架构,节奏相当快。
B.AI 宣布 Gemini 3.8 Flash 正式接入 API
火星财经消息,9 月 4 日,B.AI 平台宣布 Google DeepMind 最新 Gemini 3.8 Flash 模型正式接入 API。该模型为 Gemini 3 家族最新一代主力模型,支持 1M Token 上下文窗口与原生多模态输入。据该平台介绍,Gemini 3.8 Flash 在保持 Flash 系列低延迟特点的同时,于软件工程、智能体任务及专业领域多步推理等方面有所提升,在金融和法律等专业领域同样有所表现,面向复杂推理与长期 Agent 工作流。官方 API 接入现已开放。
B.AI 上线智谱 GLM-5.3-Flash 模型并免费开放 API
ChainCatcher 消息,8 月 27 日,一站式 AGI 基础设施平台 B.AI 宣布智谱 GLM-5.3-Flash(320B-A18B)正式登陆平台,并在 API 官方组全量免费开放。作为 GLM-5 系列首款原生全模态模型,GLM-5.3-Flash 拥有 320B 总参数与 18B 激活参数,由纯国产 AI 芯片提供算力支持,首次引入稀疏与线性注意力混合架构,配合 1M 超长上下文,兼具强悍性能与极致性价比。即日起,开发者可通过 B.AI API 官方组零成本调用,轻松驾驭复杂推理、长文本处理与多模态任务。