智谱旗舰模型GLM 5.3将于8月28日上午10点开源
相关推荐
GLM-5.3智能指数暴涨到60:追平Kimi K3,API单价没涨
据动察 Beating 监测,智谱正式开放 GLM-5.3 API。此前模型发布时,API 没有立即上线。与此同时,Artificial Analysis 的独立评测也出炉了:Intelligence Index 从 GLM-5.2 的 53 暴涨到 60,追平 Kimi K3,只比 GPT-5.6 Sol 低 1 分。等权重按计划公开后,它将和 Kimi K3 并列 AA 评分最高的开放权重模型。 涨得最猛的是 Agent。GDPval-AA v2 的 Elo 从 1524 跳到 1770,一次涨了 246 分,排所有模型第二,仅次于 Claude Opus 5 的 1855,也比 Kimi K3 的 1668 高出 100 多分。 API 单价没有跟着涨。输入仍是每百万 Token 1.40 美元,输出 4.40 美元,缓存输入 0.26 美元,和 GLM-5.2 完全一样。 不过 5.3 明显更能花 Token。AA 测得它每项任务平均输出约 1.87 万 Token,比 5.2 多 20%。因此单任务实际成本从 0.44 美元涨到 0.68 美元,贵了约 55%。即便如此,同档模型里仍比 Kimi K3 的 0.84 美元和 GPT-5.6 Sol 的 1.23 美元便宜。
OpenAI把ChatGPT实时语音开放API:每分钟5美分
动察 Beating AI 快讯,OpenAI 开放 GPT-Live-1 API,也就是 ChatGPT 目前使用的实时语音模型。它能同时听和说,直接理解语音、处理普通对话,也能应对插话、停顿和背景噪音。 遇到复杂推理或工具调用时,GPT-Live-1 可以把任务交给 GPT-6 Astra、Luna 或第三方模型,拿到结果后再继续和用户聊。开发者可以自己决定后端接什么模型。 相比传统的「语音转文字→大模型→文字转语音」,GPT-Live-1 减少了中间的模型交接,让实时对话更连贯。 GPT-Live-1 收费每分钟 0.05 美元,后端模型另算。
20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。
Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol
动察 Beating AI 快讯,Terminal-Bench 发布 4.0,重新校准 Agent 执行任务时的时间、CPU 和内存,并修复 19 个任务、移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到 8 小时,主要是减少超时和环境问题对成绩的干扰。 最新榜单里,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,冲到第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名里,GLM-5.3 是唯一不是 Anthropic 的模型。 在 Terminal-Bench 3.0 中,GLM-5.3 还是 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反过来领先 Sol 4.5 个百分点。
OpenAI更新GPT-6 Astra界面,补充模型性能及API定价等信息
Odaily星球日报讯 OpenAI 最新更新 GPT-6 Astra 产品页面,补充了模型性能、企业应用、安全能力及 API 定价等信息。Astra 在 ARC-AGI-3 取得 99.9%,FrontierMath Tier 4 约 97.6%,Terminal-Bench 4.0 达 57.9%,高于 GPT-5.6 Sol 的 37.3%,并略高于 Claude Fable 5.1 的 55.8%;专业任务 Agents’ Last Exam 得分 59.3%,也高于 Claude Opus 5 的 55.5%。 OpenAI 同时明确,Astra 未来数日将陆续开放给 Plus、Pro、Business 和 Enterprise 用户,并进入 API、Azure 和 AWS Bedrock。由此看,产品页此次更新很可能是在为更大范围开放做准备,但具体全面上线时间仍未公布。
智谱API涨价一倍还越用越猛:调用量涨40倍,大客户涨98倍
动察 Beating AI 快讯,智谱这半年不只是 API 收入暴涨,调用量和商业效率也一起上去了。截至财报发布,MaaS 平台 Token 调用量较年初增长超过 40 倍,付费日活增长 603%。其中前十大客户的日均调用量更是增长 98 倍。 而且,这轮增长并不是靠降价换来的。上半年智谱 API 平均售价同比上涨约 101%,Coding Plan 也提高了订阅价格。量价同时上涨,最终把开放平台和 API 收入推到 8.25 亿元,同比增长 2735.7%。 智谱还在财报里披露了一个自定义指标「算力乘数」,用来衡量每投入 1 元算力成本能带来多少 API 收入。上半年这个指标同比提高约 14 倍。简单说,智谱不仅卖出了更多 Token,每单位算力能换回的收入也比一年前高得多。