腾讯混元Hy4开源:7700亿总参数、100万上下文
相关推荐
Hy4 preview优化「想太多」:复杂任务轮次和Token消耗双降
动察 Beating AI 快讯,腾讯混元和 WorkBuddy 给 Hy4 preview 做了一轮专项优化,已经在 WorkBuddy 全量上线。官方称,这次主要针对复杂任务里的长思考和过度自我验证,在不损失任务效果的前提下,显著减少任务轮次和输入、输出 token 消耗。 Hy4 preview 是腾讯 8 月底发布的开源旗舰 MoE,总参数 770B、激活参数 49B,支持 1M 上下文,重点面向代码、办公和科研等长任务。腾讯发布时就主动把「复杂任务长思考、过度自我验证」列为已知问题。
腾讯混元称 Hy4 preview 调用激增,WorkBuddy 已紧急扩容
火星财经消息,腾讯混元发文称,自 2026 年 8 月 28 日混元 Hy4 preview 在 WorkBuddy 首发接入以来,凭借其 Agent 能力的显著提升,受到了广大用户与开发者的积极体验和热情反馈,上线首日即在 WorkBuddy 任务队列中出现排队情况,对此深表歉意。为保障大家的使用体验,公司已针对 Hy4 preview 推理集群进行紧急扩容,并将持续动态调配资源。但受限于高端算力总量与高峰并发集中,仍不排除个别时段会继续出现排队情况。
1.5TB变214GB:腾讯给Hy4 preview做了极限量化版
动察 Beating AI 快讯,Hy4 preview 刚开源,腾讯混元又放出了一个极限量化版。原始模型权重接近 1.5TB,新版 GGUF 只有约 214GB,大幅降低了这款 770B MoE 模型的本地部署门槛。 它并不是把整个模型都压成 1.25-bit。腾讯按不同层对精度的敏感程度分别量化,能扛的部分最低压到约 1.31-bit,敏感部分保留 2-bit 甚至更高精度。最终整个文件平均约 2.38 bpw。腾讯给出的四项评测中,相比 BF16 原版只下降了 0.2 到 1.6 分。 压小以后,腾讯还和 prima.cpp 测试了异构设备联合推理。一台 RTX 4090 笔记本加一台四卡 A4000 服务器,总共只有 80GB 显存和 64GB 内存,最终把模型跑到了 1.02 token/s,比笔记本单机 offload 快约 6 倍。几台不同配置的设备,也可以一起分担模型推理。
腾讯AI智能体赛马开始收拢:QClaw划入WorkBuddy所在部门
据动察 Beating 监测,腾讯将 QClaw 产品中心相关业务和部分团队划入云产品六部。QClaw 仍会继续运营,但将与 WorkBuddy 归入同一部门。 云产品六部今年 4 月成立,负责 CodeBuddy、WorkBuddy 等 AI 原生生产力产品的建设和商业化。QClaw 基于 OpenClaw 打造,偏向个人用户和远程操控电脑;WorkBuddy 主打职场和企业办公。
Kimi K2.8 Preview全量上线:性能逼近K3,支持1M上下文
动察 Beating AI 快讯,月之暗面开始向 Kimi Code CLI 全量推送 Kimi K2.8 Preview。用户不用切换 Model ID,原来的 kimi-for-coding 会直接指向新模型。 Kimi 称,K2.8 Preview 综合性能已经接近 K3,但 thinking 效率更高。它还支持和 K3 一样的思考强度调节,并把上下文扩到 1M token。 上一代 K2.7 Code 只有 256K 上下文,而且只能开启 thinking。K2.8 这次基本把 K3 上的两项核心能力下放到了默认代码模型。
腾讯混元 Hy4 Preview 登陆 B.AI API
火星财经消息,9 月 2 日,B.AI 平台宣布腾讯混元团队最新开源旗舰模型 Hy4 Preview 正式上线 API 服务,面向开发者开放接入。该模型为 Hy4 系列早期版本,采用 770B 稀疏 MoE 架构,每 Token 激活 49B 参数,并支持 1M 超长上下文窗口。开发者可通过 B.AI API 官方渠道直接调用,登录 chat.b.ai/chat 或访问 docs.b.ai/zh-Hans/llmservice/models/hy4-preview/ 了解详情。