返回 7*24 快讯
来源Blockbeats

腾讯Hy4盲测压过GLM-5.3、Kimi K3,输出价最低便宜82%

动察 Beating AI 快讯,腾讯还专门公布了一组 Hy4 preview 的真实工程盲测。163 名腾讯内部专家拿 203 个工程任务测试不同模型,Hy4 最终平均拿到 2.99/4,高于 GLM-5.3 的 2.92/4 和 Kimi K3 的 2.94/4。 具体来看,Hy4 对 GLM-5.3 的胜率为 46.8%,打平 12.8%,负率 40.4%;对 Kimi K3 的胜率为 51.2%,打平 7.9%,负率 40.9%。这些题目来自腾讯内部真实工程任务,不是传统的固定 Benchmark。 不过 Hy4 并没有在公开跑分中全面领先。从腾讯公布的评测结果看,它和 GLM-5.3、Kimi K3 等模型各有胜负,DeepSWE、CyberGym 等代码和网络安全测试仍落后 GLM-5.3。 价格是 Hy4 最明显的优势。每百万 Tokens 输入 6 元、输出 18 元,分别比 GLM-5.3 便宜 25% 和约 36%;相比 Kimi K3,更是便宜 70% 和 82%。缓存命中只要 0.3 元,也比 GLM-5.3 和 Kimi K3 的 2 元便宜 85%。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

06-21 03:05

智谱GLM-5.2登顶DeepSWE开源第一:解决44%复杂开发任务,力压主力闭源模型

据动察 Beating 监测,智谱 AI 开源模型 GLM-5.2 正式进驻长程软件工程基准 DeepSWE。在最大思考力度模式下,复杂开发任务的一次成功率达到 44%,在开源模型中排名第一。对比此前入榜的 Kimi K2.7 Code,成功率高出 13 个百分点。 GLM-5.2 解决每项任务的平均成本为 3.92 美元,略高于 Kimi K2.7 Code 的 2.82 美元,成功率却超越了多款主流闭源模型在特定思考配置下的表现,包括 Claude Sonnet 4.6 [high] (30%)、Gemini 3.5 Flash [medium] (37%),以及 Claude Opus 4.8 [low] (41%)。 评测发起方 Datacurve 设计的 DeepSWE 基准专门测试 AI 智能体解决长任务的能力。测试包含 113 个真实编程问题,覆盖 5 种语言。与只修改单处代码的传统测试不同,DeepSWE 要求 AI 协同修改多个文件,平均修复代码超过 600 行。评测在隔离容器中运行,严格限制 CPU 和内存资源。

09-11 07:53

Kimi K2.8 Preview全量上线:性能逼近K3,支持1M上下文

动察 Beating AI 快讯,月之暗面开始向 Kimi Code CLI 全量推送 Kimi K2.8 Preview。用户不用切换 Model ID,原来的 kimi-for-coding 会直接指向新模型。 Kimi 称,K2.8 Preview 综合性能已经接近 K3,但 thinking 效率更高。它还支持和 K3 一样的思考强度调节,并把上下文扩到 1M token。 上一代 K2.7 Code 只有 256K 上下文,而且只能开启 thinking。K2.8 这次基本把 K3 上的两项核心能力下放到了默认代码模型。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。

08-19 01:17

GLM-5.3智能指数暴涨到60:追平Kimi K3,API单价没涨

据动察 Beating 监测,智谱正式开放 GLM-5.3 API。此前模型发布时,API 没有立即上线。与此同时,Artificial Analysis 的独立评测也出炉了:Intelligence Index 从 GLM-5.2 的 53 暴涨到 60,追平 Kimi K3,只比 GPT-5.6 Sol 低 1 分。等权重按计划公开后,它将和 Kimi K3 并列 AA 评分最高的开放权重模型。 涨得最猛的是 Agent。GDPval-AA v2 的 Elo 从 1524 跳到 1770,一次涨了 246 分,排所有模型第二,仅次于 Claude Opus 5 的 1855,也比 Kimi K3 的 1668 高出 100 多分。 API 单价没有跟着涨。输入仍是每百万 Token 1.40 美元,输出 4.40 美元,缓存输入 0.26 美元,和 GLM-5.2 完全一样。 不过 5.3 明显更能花 Token。AA 测得它每项任务平均输出约 1.87 万 Token,比 5.2 多 20%。因此单任务实际成本从 0.44 美元涨到 0.68 美元,贵了约 55%。即便如此,同档模型里仍比 Kimi K3 的 0.84 美元和 GPT-5.6 Sol 的 1.23 美元便宜。

06-29 02:01

Coinbase通过默认采用GLM和Kimi等开放权重模型,将AI支出削减近半

PANews 6月29日消息,Coinbase首席执行官Brian Armstrong发文分享了公司在AI支出方面的优化经验。他指出,在代币使用量指数级增长的同时,通过更好的默认设置、路由和缓存策略,已将AI支出削减近半,而非依赖使用上限和警报机制。在默认设置方面,Coinbase正通过LLM网关将开源权重模型(如智谱的GLM 5.2和月之暗面的Kimi 2.7)设为默认选项,同时鼓励工程师为特定任务选择正确模型。该公司91%的员工从未触及使用上限,因此团队选择转向更便宜的默认设置而非降低上限。

06-27 11:37

Coinbase已将AI支出削减近半,尝试将GLM 5.2、Kimi 2.7等开放权重模型设为默认选项

火星财经消息,6 月 27 日,Coinbase CEO Brian Armstrong 发文表示,若想在 token 使用量指数级增长的同时保持 AI 支出稳定,关键不在于设置使用摩擦或支出提醒,而在于更好的默认模型、路由和缓存机制。Coinbase 正在通过 LLM 网关尝试默认使用 GLM 5.2、Kimi 2.7 等开放权重模型,同时仍鼓励工程师根据任务选择合适模型。其称,91% 的员工从未触及使用上限,因此公司没有选择降低额度并增加提醒,而是转向更低成本的默认模型。 在模型路由方面,Coinbase 会在自定义流程中预处理提示词,并根据缓存命中率和模型定价,将任务路由至最合适模型。例如,规划阶段可能需要前沿模型,但执行阶段使用前沿模型可能过度。其认为,未来不应由人类选择模型,AI 可以自动完成该任务。 Armstrong 还表示,缓存未命中是推高成本最容易的方式。Coinbase 的请求均具备缓存感知能力,以便尽可能复用热缓存。例如,在正确实现缓存后,LibreChat 的缓存命中率已从 5% 提升至 60%。此外,Coinbase 也要求工程师保持上下文精简,包括切换任务时开启新会话、缩小文件上下文范围、断开未使用工具等。目标不是压制 AI 使用量,而是构建可支撑指数级增长的基础设施。通过上述实践,Coinbase 已将 AI 支出削减近一半,同时 token 使用量仍在继续增长。