8月27日A股盘前要闻
相关推荐
智谱再发匿名模型:GLM-5.3-Flash刚转正,Omen Alpha又来了
动察 Beating AI 快讯,OpenCode 又上线一个匿名模型 Omen Alpha,而这次身份似乎已经提前露馅。OpenCode 自己的数据页直接把它归在 Zhipu 名下。智谱目前还没有正式认领,也没有公布它究竟是哪款 GLM。 这离上一个匿名模型揭晓只有 9 天。智谱此前把 GLM-5.3-Flash 化名为 Ox Alpha,在 OpenRouter 和 OpenCode 免费测试。8 月 26 日才正式公布真身,并开放模型权重。 但这次没有免费午餐了,Omen Alpha 只给每月 10 美元的 OpenCode Go 用户使用,套餐提供价值 100 美元的 Omen 用量。每百万 token 输入收费 0.20 美元,输出 0.66 美元,比 GLM-5.3-Flash 正式价格高约三成;但 GLM-5.3-Flash 目前正在打五折,按现价算,Omen Alpha 大约贵 1.6 倍。 Omen Alpha 的正式规格目前还是空白。OpenCode 没公布上下文、输入模态和最大输出。社区已经有人猜它可能是新的 GLM-5.x 或 Omni 分支。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
中信建投:英伟达业绩指引乐观,MiniMax ARR大幅增长,AI产业持续高景气
火星财经消息,中信建投指出,英伟达FY2027二季度实现营收962.2亿美元,同比增长106%。展望FY2027三季度,公司预计营收达到1080亿美元±2%,对应同比增长约89%。英伟达指引2028财年收入增长约70%,如果供应链不受限的情况下,增速预计更快。总体看,全球AI资本开支仍处于强劲上行周期。MiniMax商业化进程明显加速,2026年上半年实现收入约1.17亿美元,同比增长283.1%,其中二季度收入环比增长81.8%;进入三季度后增长进一步提速,7月Token消耗量已达到1月的20倍,8月ARR突破8亿美元。
智谱Token推理成本较年初降80%:10万张国产芯片跑大模型
动察 Beating AI 快讯,智谱披露,公司目前已经实现 10 万级国产芯片的规模化低成本推理,单位 Token 推理成本较年初下降 80%。 这批国产算力此前已经露过面。智谱发布 GLM-5.3-Flash 时曾确认,该模型的全部线上流量由 10 万张国产芯片承载。发布前,匿名模型 Ox-Alpha 在 OpenRouter、OpenCode 上的大规模测试,同样跑在这批国产算力上。
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。