智谱GLM-5.3-Flash调用量增长73%
相关推荐
商汤大装置为智谱 GLM-5.3-Flash 提供国产算力与 Token 服务
火星财经消息,据证券时报,8月 27 日,记者从商汤获悉,商汤大装置为智谱近日上线并开源的 GLM -5.3- Flash 提供国产算力支持与 Token 服务,这被认为是国产算力规模化商用的又一个标杆。据透露,商汤大装置7月日均 Token 服务量已达到2.42万亿,预计2026年年底突破日均10万亿。
B.AI 上线智谱 GLM-5.3-Flash 模型并免费开放 API
ChainCatcher 消息,8 月 27 日,一站式 AGI 基础设施平台 B.AI 宣布智谱 GLM-5.3-Flash(320B-A18B)正式登陆平台,并在 API 官方组全量免费开放。作为 GLM-5 系列首款原生全模态模型,GLM-5.3-Flash 拥有 320B 总参数与 18B 激活参数,由纯国产 AI 芯片提供算力支持,首次引入稀疏与线性注意力混合架构,配合 1M 超长上下文,兼具强悍性能与极致性价比。即日起,开发者可通过 B.AI API 官方组零成本调用,轻松驾驭复杂推理、长文本处理与多模态任务。
智谱再发匿名模型:GLM-5.3-Flash刚转正,Omen Alpha又来了
动察 Beating AI 快讯,OpenCode 又上线一个匿名模型 Omen Alpha,而这次身份似乎已经提前露馅。OpenCode 自己的数据页直接把它归在 Zhipu 名下。智谱目前还没有正式认领,也没有公布它究竟是哪款 GLM。 这离上一个匿名模型揭晓只有 9 天。智谱此前把 GLM-5.3-Flash 化名为 Ox Alpha,在 OpenRouter 和 OpenCode 免费测试。8 月 26 日才正式公布真身,并开放模型权重。 但这次没有免费午餐了,Omen Alpha 只给每月 10 美元的 OpenCode Go 用户使用,套餐提供价值 100 美元的 Omen 用量。每百万 token 输入收费 0.20 美元,输出 0.66 美元,比 GLM-5.3-Flash 正式价格高约三成;但 GLM-5.3-Flash 目前正在打五折,按现价算,Omen Alpha 大约贵 1.6 倍。 Omen Alpha 的正式规格目前还是空白。OpenCode 没公布上下文、输入模态和最大输出。社区已经有人猜它可能是新的 GLM-5.x 或 Omni 分支。
Qwen3.8-Flash发布一天就降价:输出比GLM便宜0.1元,但对手还在打5折
动察 Beating AI 快讯,Qwen3.8-Flash 刚发布一天,阿里云就降价了。每百万 Token 输入从 1 元降到 0.8 元,输出从 3 元降到 2.7 元,分别下降 20% 和 10%。 新价格刚好压过昨天发布的 GLM-5.3-Flash。后者 API 标价为输入 0.8 元、输出 2.8 元。Qwen 输入价格相同,输出便宜 0.1 元。 不过 GLM-5.3-Flash 上线后前两周打 5 折,目前实际价格只有输入 0.4 元、输出 1.4 元。优惠期内,GLM 仍然便宜近一半。等优惠结束,两款国产 Flash 模型的价格基本打平。
「牛来」模型GLM-5.3-Flash正式开源:320B 参数仅激活 18B,价格只有 GLM-5.2 十分之一
动察 Beating AI 快讯,白天认领 Ox Alpha 后,智谱晚上正式开源 GLM-5.3-Flash,模型权重已经上线 Hugging Face,采用 MIT 许可。它总参数 320B,但每次只激活 18B,原生支持文字、图片和视频,也是 GLM-5 系列首个原生多模态模型。 官方称,GLM-5.3-Flash 整体性能超过 GLM-5.2,编程和 Agent 评测已经接近 Claude Opus 4.8,但价格只有 GLM-5.2 的十分之一。它还换了一套新的基础模型,首次在 GLM 主系列引入稀疏注意力和线性注意力混合架构,并用 30T Token 多模态数据预训练。 此前社区对 Ox Alpha 的 DeepSWE 小样本测试一度跑出 80%,但那只有 10 道题。扩大样本后成绩回落到约 63%,测试者也主动纠正了最初的说法。这个成绩依然属于第一梯队,但没有最初 80% 那么夸张。 权重开源后,开发者可以直接用 vLLM、SGLang、KTransformers 等框架自己部署,不需要再走匿名模型的 API。
「牛来」模型Ox Alpha就是 GLM-5.3 Flash?预测市场超九成认定智谱
动察 Beating AI 快讯,神秘模型 Ox Alpha 的身份竞猜已经明显倒向智谱。Polymarket 上,Z.ai 的概率目前超过 90%,第二名 Google 只有约 5%。Ox Alpha 是最近突然出现在 OpenRouter 上的匿名推理模型,主打编程和长时间 Agent 任务。 最硬的线索来自后端。社区开发者故意向 OpenCode 的 Ox Alpha 接口发送错误参数,服务器吐出了 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest。其中的 paas/v4/chat 与 Z.ai 官方 API 路径直接对上。继续发送非法 role 时,Ox Alpha 又返回 1214 Incorrect role information,和 Z.ai 自己托管的 GLM 一致。换成 DeepInfra 托管同一 GLM 权重,报错格式就变了。 模型本身的指纹也对上了。一份公开取证跑了 600 多次请求、约 1350 万输入 Token,44 组分词器测试全部匹配 GLM-5 这一代。