B.AI 累计 Token 吞吐量突破 10.9 万亿
相关推荐
智谱再发匿名模型:GLM-5.3-Flash刚转正,Omen Alpha又来了
动察 Beating AI 快讯,OpenCode 又上线一个匿名模型 Omen Alpha,而这次身份似乎已经提前露馅。OpenCode 自己的数据页直接把它归在 Zhipu 名下。智谱目前还没有正式认领,也没有公布它究竟是哪款 GLM。 这离上一个匿名模型揭晓只有 9 天。智谱此前把 GLM-5.3-Flash 化名为 Ox Alpha,在 OpenRouter 和 OpenCode 免费测试。8 月 26 日才正式公布真身,并开放模型权重。 但这次没有免费午餐了,Omen Alpha 只给每月 10 美元的 OpenCode Go 用户使用,套餐提供价值 100 美元的 Omen 用量。每百万 token 输入收费 0.20 美元,输出 0.66 美元,比 GLM-5.3-Flash 正式价格高约三成;但 GLM-5.3-Flash 目前正在打五折,按现价算,Omen Alpha 大约贵 1.6 倍。 Omen Alpha 的正式规格目前还是空白。OpenCode 没公布上下文、输入模态和最大输出。社区已经有人猜它可能是新的 GLM-5.x 或 Omni 分支。
Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。
GLM-5.3-Flash 免费体验即将收官,1 折特惠无缝接棒
ChainCatcher 消息,B.AI 宣布 GLM-5.3-Flash 限时免费体验即将告一段落,1 折专属调用特惠将于 9 月 12 日 10:00(SGT)起无缝接棒,用户仅需支付原价的 10%,直接节省 90%,输入低至 $0.015/M、输出低至 $0.05/M。作为原生全模态大模型,GLM-5.3-Flash 拥有 320B 总参数与 18B 激活参数,结合稀疏与线性注意力混合架构及 1M 超长上下文,在编程开发、智能体、长上下文处理及高频 API 工作负载等场景下表现强劲。B.AI 始终践行算力普惠愿景,坚持低门槛接入,致力于以极具竞争力的价格,让每一位开发者都能无负担使用顶级算力,告别高昂成本,全速推进创新落地。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。
B.AI 延长 GLM-5.3-Flash 免费调用至 9 月 12 日
ChainCatcher 消息,9 月 9 日,智谱 GLM-5.3-Flash 官方调价即将生效。AI 模型调用平台 B.AI 宣布限时延长免费权益,即日起至 9 月 12 日 09:59(SGT),该模型在 B.AI 平台仍可全量免费调用。GLM-5.3-Flash 总参数 320B、激活参数 18B,支持 1M 上下文。Qwen3.8 Flash、Hy3、MiMo V2.5 等模型在 B.AI 平台仍保持免费开放。
B.AI 宣布 Gemini 3.8 Flash 正式接入 API
火星财经消息,9 月 4 日,B.AI 平台宣布 Google DeepMind 最新 Gemini 3.8 Flash 模型正式接入 API。该模型为 Gemini 3 家族最新一代主力模型,支持 1M Token 上下文窗口与原生多模态输入。据该平台介绍,Gemini 3.8 Flash 在保持 Flash 系列低延迟特点的同时,于软件工程、智能体任务及专业领域多步推理等方面有所提升,在金融和法律等专业领域同样有所表现,面向复杂推理与长期 Agent 工作流。官方 API 接入现已开放。