智谱披露算力Scaling模型:300亿元投入可建10万P 推理年收入最高400亿元
相关推荐
智谱创始人唐杰:大模型Scaling不只是堆参数,未来竞争核心转向后训练与推理能力
Odaily星球日报讯 智谱创始人唐杰在 X 平台发布关于大模型 Scaling Law 的思考文章表示,当前人工智能行业对模型能力提升的理解正在从“扩大参数规模”转向多维度扩展,参数量并非衡量模型能力的唯一指标,还需要结合数据规模、计算资源分配方式以及模型实际运行场景综合评估。 唐杰指出,早期研究曾推动行业快速扩大模型参数规模。Kaplan 等人在 2020 年的研究认为,模型参数增长速度应高于数据增长速度,推动了 GPT-3、Gopher、MT-NLG 等超大规模模型的发展。但 Hoffmann 等人在 2022 年通过分析数百个模型发现,计算最优方案更接近“每个参数对应约 20 个训练 Token”,模型参数和数据规模应保持同步增长,过去追求万亿参数模型的路线实际上是一次行业共同经历的“偏航”。随着模型应用场景变化,推理成本逐渐成为生命周期成本的重要组成部分,优化目标也从单纯降低训练成本转向提升长期运行效率,因此“小模型+更充分训练”的路线开始受到关注。 唐杰表示,稀疏混合专家(MoE)架构进一步改变了 Scaling 逻辑。在 MoE 模型中,总参数量决定模型能够存储多少知识,而激活参数和有效深度更影响模型完成复杂推理任务的能力。对于漏洞发现等需要长链条推理的任务而言,能力并不来自简单记忆更多信息,而是需要模型保持多步推理过程的连贯性。近期研究显示,最优“Token/参数比例”并不存在统一答案:偏向记忆型任务需要更多参数,而偏向推理型任务则更依赖更多数据和计算深度。在固定训练数据规模下,盲目增加总参数甚至可能削弱推理能力,而增加激活专家数量则更有助于提升模型表现。 围绕智谱最新模型进展,唐杰透露,GLM-5.3 是一次针对 Scaling 方向的实验。该模型与 GLM-5.2 采用相同基础模型、架构以及总参数和激活参数规模,但通过一个月的大规模长周期环境训练和强化学习(RL)进行后训练优化,性能提升并非来自参数增加,而是来自后训练阶段的扩展。他总结称,大模型竞争已经从单纯比拼参数规模,进入探索“多维 Scaling”的阶段,未来模型能力提升将更多依赖训练策略、推理深度以及后训练能力的持续优化。
智谱正式发布GLM-5.3 拥有更强编程能力
火星财经消息,智谱8月14日正式发布GLM-5.3。据介绍,与GLM-5.2相比,GLM-5.3基座模型未变,但通过极致的后训练Scaling大大提高了模型的智能上界。GLM-5.3拥有更强的编程能力,在内部自建体感评测中较GLM-5.2提升50%,在包括TerminalBench3.0、Agents'LastExam(CLI)在内的公开基准测试中取得开源第一。智谱还表示,将在发布两周后开放模型权重。(财联社)
Hugging Face封禁黑客版GLM-5.3,作者改名后重传
动察 Beating AI 快讯,Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。 具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。 但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。
智谱约50亿美元融资落定,加码下一代GLM基础模型、完全自训练及算力基建
火星财经消息,9月13日,智谱宣布完成约50亿美元融资。公告称,此次融资将用于下一代GLM基础模型、完全自训练体系及相关算力基础设施。在公告中,智谱将完全自训练描述为下一代GLM在上一代GLM构建的环境中训练,形成递归式自我改进循环。具体投入包括自动化生成和筛选训练数据、构建任务环境、提升长程推理能力,以及国产芯片适配、算子开发和推理优化。
GLM-5.3-Flash 免费体验即将收官,1 折特惠无缝接棒
ChainCatcher 消息,B.AI 宣布 GLM-5.3-Flash 限时免费体验即将告一段落,1 折专属调用特惠将于 9 月 12 日 10:00(SGT)起无缝接棒,用户仅需支付原价的 10%,直接节省 90%,输入低至 $0.015/M、输出低至 $0.05/M。作为原生全模态大模型,GLM-5.3-Flash 拥有 320B 总参数与 18B 激活参数,结合稀疏与线性注意力混合架构及 1M 超长上下文,在编程开发、智能体、长上下文处理及高频 API 工作负载等场景下表现强劲。B.AI 始终践行算力普惠愿景,坚持低门槛接入,致力于以极具竞争力的价格,让每一位开发者都能无负担使用顶级算力,告别高昂成本,全速推进创新落地。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。