GLM-5.3开始优化自己的系统,智谱唐杰:RSI最小闭环已经出现
相关推荐
智谱GLM公开国内大模型首个RSI实践:AI在十万卡国产集群上自建推理系统
火星财经消息,今日,智谱GLM 团队披露其在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践:由GLM-5.3驱动的Infra Agent完成了GLM-5.3-Flash推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进。这是国内大模型厂商首次公开跑进生产环境的RSI案例。据官方博客,Infra Agent在超10万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的3倍,硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平。 (科创板日报记者 李明明)(财联社)
智谱 GLM:公开递归自我改进实践,GLM-5.3-Flash 发布
火星财经消息,智谱 GLM 团队披露递归自我改进方向的首个工程化实践,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化。该实践在十万卡国产集群上完成,团队称其为国内大模型首个递归自我改进实践。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。
「牛来」模型GLM-5.3-Flash正式开源:320B 参数仅激活 18B,价格只有 GLM-5.2 十分之一
动察 Beating AI 快讯,白天认领 Ox Alpha 后,智谱晚上正式开源 GLM-5.3-Flash,模型权重已经上线 Hugging Face,采用 MIT 许可。它总参数 320B,但每次只激活 18B,原生支持文字、图片和视频,也是 GLM-5 系列首个原生多模态模型。 官方称,GLM-5.3-Flash 整体性能超过 GLM-5.2,编程和 Agent 评测已经接近 Claude Opus 4.8,但价格只有 GLM-5.2 的十分之一。它还换了一套新的基础模型,首次在 GLM 主系列引入稀疏注意力和线性注意力混合架构,并用 30T Token 多模态数据预训练。 此前社区对 Ox Alpha 的 DeepSWE 小样本测试一度跑出 80%,但那只有 10 道题。扩大样本后成绩回落到约 63%,测试者也主动纠正了最初的说法。这个成绩依然属于第一梯队,但没有最初 80% 那么夸张。 权重开源后,开发者可以直接用 vLLM、SGLang、KTransformers 等框架自己部署,不需要再走匿名模型的 API。
「牛来」模型Ox Alpha就是 GLM-5.3 Flash?预测市场超九成认定智谱
动察 Beating AI 快讯,神秘模型 Ox Alpha 的身份竞猜已经明显倒向智谱。Polymarket 上,Z.ai 的概率目前超过 90%,第二名 Google 只有约 5%。Ox Alpha 是最近突然出现在 OpenRouter 上的匿名推理模型,主打编程和长时间 Agent 任务。 最硬的线索来自后端。社区开发者故意向 OpenCode 的 Ox Alpha 接口发送错误参数,服务器吐出了 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest。其中的 paas/v4/chat 与 Z.ai 官方 API 路径直接对上。继续发送非法 role 时,Ox Alpha 又返回 1214 Incorrect role information,和 Z.ai 自己托管的 GLM 一致。换成 DeepInfra 托管同一 GLM 权重,报错格式就变了。 模型本身的指纹也对上了。一份公开取证跑了 600 多次请求、约 1350 万输入 Token,44 组分词器测试全部匹配 GLM-5 这一代。
又一条RSI路线出现:模型参数不动,Agent靠Memory持续进化
动察 Beating AI 快讯,UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。 这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。 系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。 在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。 它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。