返回 7*24 快讯
重要来源Blockbeats

智谱旗舰模型GLM 5.3将于8月28日上午10点开源

动察 Beating AI 快讯,智谱旗舰模型 GLM-5.3 将在北京时间 8 月 28 日上午 10 点开源。 GLM-5.3 其实早在 8 月 14 日就已上线 Coding Plan,随后开放 API。明天模型权重终于下载,这次晚了整整两周,原因有点特殊。智谱称,GLM-5.3 在后训练过程中,网络安全能力增长速度「超出预期」,不仅更会找漏洞,还开始学会跨多个步骤规划完整的漏洞利用链。官方因此先做安全评估和加固,再开放权重。 官方评测中,GLM-5.3 在漏洞发现测试 CyberGym 拿到 84.5%,略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。更偏攻击利用的 ExploitBench 则从 GLM-5.2 的 24.4% 翻到 54.4%,不过仍明显落后 Mythos 5 的 78.0%。智谱还称,模型已在 269 个开源项目中发现 2436 个漏洞,其中 1097 个属于严重或高危级别。 GLM-5.3 沿用 GLM-5.2 的同一基础模型,这些提升全部来自后训练。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-19 01:17

GLM-5.3智能指数暴涨到60:追平Kimi K3,API单价没涨

据动察 Beating 监测,智谱正式开放 GLM-5.3 API。此前模型发布时,API 没有立即上线。与此同时,Artificial Analysis 的独立评测也出炉了:Intelligence Index 从 GLM-5.2 的 53 暴涨到 60,追平 Kimi K3,只比 GPT-5.6 Sol 低 1 分。等权重按计划公开后,它将和 Kimi K3 并列 AA 评分最高的开放权重模型。 涨得最猛的是 Agent。GDPval-AA v2 的 Elo 从 1524 跳到 1770,一次涨了 246 分,排所有模型第二,仅次于 Claude Opus 5 的 1855,也比 Kimi K3 的 1668 高出 100 多分。 API 单价没有跟着涨。输入仍是每百万 Token 1.40 美元,输出 4.40 美元,缓存输入 0.26 美元,和 GLM-5.2 完全一样。 不过 5.3 明显更能花 Token。AA 测得它每项任务平均输出约 1.87 万 Token,比 5.2 多 20%。因此单任务实际成本从 0.44 美元涨到 0.68 美元,贵了约 55%。即便如此,同档模型里仍比 Kimi K3 的 0.84 美元和 GPT-5.6 Sol 的 1.23 美元便宜。

09-11 07:34

OpenAI把ChatGPT实时语音开放API:每分钟5美分

动察 Beating AI 快讯,OpenAI 开放 GPT-Live-1 API,也就是 ChatGPT 目前使用的实时语音模型。它能同时听和说,直接理解语音、处理普通对话,也能应对插话、停顿和背景噪音。 遇到复杂推理或工具调用时,GPT-Live-1 可以把任务交给 GPT-6 Astra、Luna 或第三方模型,拿到结果后再继续和用户聊。开发者可以自己决定后端接什么模型。 相比传统的「语音转文字→大模型→文字转语音」,GPT-Live-1 减少了中间的模型交接,让实时对话更连贯。 GPT-Live-1 收费每分钟 0.05 美元,后端模型另算。

09-03 11:11

20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三

动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。

08-29 13:49

Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol

动察 Beating AI 快讯,Terminal-Bench 发布 4.0,重新校准 Agent 执行任务时的时间、CPU 和内存,并修复 19 个任务、移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到 8 小时,主要是减少超时和环境问题对成绩的干扰。 最新榜单里,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,冲到第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名里,GLM-5.3 是唯一不是 Anthropic 的模型。 在 Terminal-Bench 3.0 中,GLM-5.3 还是 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反过来领先 Sol 4.5 个百分点。

09-07 08:22

OpenAI更新GPT-6 Astra界面,补充模型性能及API定价等信息

Odaily星球日报讯 OpenAI 最新更新 GPT-6 Astra 产品页面,补充了模型性能、企业应用、安全能力及 API 定价等信息。Astra 在 ARC-AGI-3 取得 99.9%,FrontierMath Tier 4 约 97.6%,Terminal-Bench 4.0 达 57.9%,高于 GPT-5.6 Sol 的 37.3%,并略高于 Claude Fable 5.1 的 55.8%;专业任务 Agents’ Last Exam 得分 59.3%,也高于 Claude Opus 5 的 55.5%。 OpenAI 同时明确,Astra 未来数日将陆续开放给 Plus、Pro、Business 和 Enterprise 用户,并进入 API、Azure 和 AWS Bedrock。由此看,产品页此次更新很可能是在为更大范围开放做准备,但具体全面上线时间仍未公布。

08-31 11:42重要

智谱API涨价一倍还越用越猛:调用量涨40倍,大客户涨98倍

动察 Beating AI 快讯,智谱这半年不只是 API 收入暴涨,调用量和商业效率也一起上去了。截至财报发布,MaaS 平台 Token 调用量较年初增长超过 40 倍,付费日活增长 603%。其中前十大客户的日均调用量更是增长 98 倍。 而且,这轮增长并不是靠降价换来的。上半年智谱 API 平均售价同比上涨约 101%,Coding Plan 也提高了订阅价格。量价同时上涨,最终把开放平台和 API 收入推到 8.25 亿元,同比增长 2735.7%。 智谱还在财报里披露了一个自定义指标「算力乘数」,用来衡量每投入 1 元算力成本能带来多少 API 收入。上半年这个指标同比提高约 14 倍。简单说,智谱不仅卖出了更多 Token,每单位算力能换回的收入也比一年前高得多。