Aikido砍掉GLM-5.3三分之一专家,做成本地安全模型
相关推荐
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。
GLM-5.3智能指数暴涨到60:追平Kimi K3,API单价没涨
据动察 Beating 监测,智谱正式开放 GLM-5.3 API。此前模型发布时,API 没有立即上线。与此同时,Artificial Analysis 的独立评测也出炉了:Intelligence Index 从 GLM-5.2 的 53 暴涨到 60,追平 Kimi K3,只比 GPT-5.6 Sol 低 1 分。等权重按计划公开后,它将和 Kimi K3 并列 AA 评分最高的开放权重模型。 涨得最猛的是 Agent。GDPval-AA v2 的 Elo 从 1524 跳到 1770,一次涨了 246 分,排所有模型第二,仅次于 Claude Opus 5 的 1855,也比 Kimi K3 的 1668 高出 100 多分。 API 单价没有跟着涨。输入仍是每百万 Token 1.40 美元,输出 4.40 美元,缓存输入 0.26 美元,和 GLM-5.2 完全一样。 不过 5.3 明显更能花 Token。AA 测得它每项任务平均输出约 1.87 万 Token,比 5.2 多 20%。因此单任务实际成本从 0.44 美元涨到 0.68 美元,贵了约 55%。即便如此,同档模型里仍比 Kimi K3 的 0.84 美元和 GPT-5.6 Sol 的 1.23 美元便宜。
GLM-5.3开始优化自己的系统,智谱唐杰:RSI最小闭环已经出现
动察 Beating AI 快讯,智谱披露,GLM-5.3 驱动的 Infra Agent 已经参与优化 GLM-5.3-Flash 的推理系统。从首次跑通到承接全部生产流量不到两周,端到端吞吐提升到最初的 3.2 倍。 联合创始人兼首席科学家唐杰在复盘中提到,Agent 现在最容易卡住的地方,往往不是不会写代码,而是不知道问题出在哪。比如一次修改让吞吐下降 20%,它知道自己改坏了,却不知道是哪一层出了问题,下一步该查什么。 于是智谱把资深工程师平时的排查方法做成一套 Agent 可以直接使用的工具。Agent 改完代码后,可以自己检查结果对不对、时间耗在哪里、哪种方案更快,再根据结果继续修改。 靠这套方法,Agent 找出了长上下文计算误差、KV 传输阻塞和解码 kernel 重复计算等问题。其中一个 kernel 重写后提速 1.71 倍。 唐杰判断,工程师的角色会越来越像「设计反馈的人」。人负责定目标、设边界和审核高风险修改,Agent 自己提假设、改代码、跑实验。离完整的 RSI 还很远,但「模型优化系统,系统再服务模型」这个最小闭环已经出现。
Hugging Face封禁黑客版GLM-5.3,作者改名后重传
动察 Beating AI 快讯,Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。 具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。 但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。
传谷歌新Pro模型首个checkpoint现身,10月或公开发布
动察 Beating AI 快讯,爆料者 lyra 称,谷歌下一款 Pro 已经有了首个 checkpoint(训练过程中保存的一版模型状态),预计 10 月公开。lyra 还预计,9 月会有新的 Flash-Lite,同时 Nano Banana 2 Lite 也会更新。 不过新 Pro 模型最终叫什么还没定。社区有人猜是 Gemini 4 Pro,也有人认为可能是其他 Pro 版本。
智谱再发匿名模型:GLM-5.3-Flash刚转正,Omen Alpha又来了
动察 Beating AI 快讯,OpenCode 又上线一个匿名模型 Omen Alpha,而这次身份似乎已经提前露馅。OpenCode 自己的数据页直接把它归在 Zhipu 名下。智谱目前还没有正式认领,也没有公布它究竟是哪款 GLM。 这离上一个匿名模型揭晓只有 9 天。智谱此前把 GLM-5.3-Flash 化名为 Ox Alpha,在 OpenRouter 和 OpenCode 免费测试。8 月 26 日才正式公布真身,并开放模型权重。 但这次没有免费午餐了,Omen Alpha 只给每月 10 美元的 OpenCode Go 用户使用,套餐提供价值 100 美元的 Omen 用量。每百万 token 输入收费 0.20 美元,输出 0.66 美元,比 GLM-5.3-Flash 正式价格高约三成;但 GLM-5.3-Flash 目前正在打五折,按现价算,Omen Alpha 大约贵 1.6 倍。 Omen Alpha 的正式规格目前还是空白。OpenCode 没公布上下文、输入模态和最大输出。社区已经有人猜它可能是新的 GLM-5.x 或 Omni 分支。