Hy4 preview优化「想太多」:复杂任务轮次和Token消耗双降
相关推荐
1.5TB变214GB:腾讯给Hy4 preview做了极限量化版
动察 Beating AI 快讯,Hy4 preview 刚开源,腾讯混元又放出了一个极限量化版。原始模型权重接近 1.5TB,新版 GGUF 只有约 214GB,大幅降低了这款 770B MoE 模型的本地部署门槛。 它并不是把整个模型都压成 1.25-bit。腾讯按不同层对精度的敏感程度分别量化,能扛的部分最低压到约 1.31-bit,敏感部分保留 2-bit 甚至更高精度。最终整个文件平均约 2.38 bpw。腾讯给出的四项评测中,相比 BF16 原版只下降了 0.2 到 1.6 分。 压小以后,腾讯还和 prima.cpp 测试了异构设备联合推理。一台 RTX 4090 笔记本加一台四卡 A4000 服务器,总共只有 80GB 显存和 64GB 内存,最终把模型跑到了 1.02 token/s,比笔记本单机 offload 快约 6 倍。几台不同配置的设备,也可以一起分担模型推理。
腾讯混元称 Hy4 preview 调用激增,WorkBuddy 已紧急扩容
火星财经消息,腾讯混元发文称,自 2026 年 8 月 28 日混元 Hy4 preview 在 WorkBuddy 首发接入以来,凭借其 Agent 能力的显著提升,受到了广大用户与开发者的积极体验和热情反馈,上线首日即在 WorkBuddy 任务队列中出现排队情况,对此深表歉意。为保障大家的使用体验,公司已针对 Hy4 preview 推理集群进行紧急扩容,并将持续动态调配资源。但受限于高端算力总量与高峰并发集中,仍不排除个别时段会继续出现排队情况。
Kimi K2.8 Preview全量上线:性能逼近K3,支持1M上下文
动察 Beating AI 快讯,月之暗面开始向 Kimi Code CLI 全量推送 Kimi K2.8 Preview。用户不用切换 Model ID,原来的 kimi-for-coding 会直接指向新模型。 Kimi 称,K2.8 Preview 综合性能已经接近 K3,但 thinking 效率更高。它还支持和 K3 一样的思考强度调节,并把上下文扩到 1M token。 上一代 K2.7 Code 只有 256K 上下文,而且只能开启 thinking。K2.8 这次基本把 K3 上的两项核心能力下放到了默认代码模型。
腾讯混元 Hy4 Preview 登陆 B.AI API
火星财经消息,9 月 2 日,B.AI 平台宣布腾讯混元团队最新开源旗舰模型 Hy4 Preview 正式上线 API 服务,面向开发者开放接入。该模型为 Hy4 系列早期版本,采用 770B 稀疏 MoE 架构,每 Token 激活 49B 参数,并支持 1M 超长上下文窗口。开发者可通过 B.AI API 官方渠道直接调用,登录 chat.b.ai/chat 或访问 docs.b.ai/zh-Hans/llmservice/models/hy4-preview/ 了解详情。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
腾讯盘中涨超5%迎来叙事逆转:WorkBuddy用户涨两个数量级,微信AI「小微」打开更大想象空间
BlockBeats 消息,7 月 6 日,据 Bitget 行情数据,港股腾讯控股今日盘中一度涨超 5%,股价升至 453 港元。曾被质疑「AI 慢了」的腾讯正迎来叙事逆转。马化腾 5 月在股东大会上坦言「一年前以为上了船,后来发现船漏水了,现在站上去了还坐不下去」,但短短数月,WorkBuddy 月活突破 2000 万、日活超 1300 万,DAU/MAU 比值达 65%-75%,黏性比肩 Slack 级别办公工具。三个月发布 43 个版本,五一假期照常更新,腾讯内部将其定位为继 QQ、微信之后第三个现象级产品。 WorkBuddy 能跑出来的关键在于两重壁垒:一是极简安装——桌面客户端加微信小程序,微信授权后手机发指令、PC 端自动执行,彻底绕过国外同类产品命令行部署的高门槛;二是腾讯全家桶生态在 Agent 时代被激活——已打通腾讯文档、腾讯会议、企业微信及 30 余家外部工具,SkillHub 技能库从 7.9 万扩展至 79 万,一句把上周销售数据做成 PPT 发给参会同事即可自动调数据、生成文件并完成分发,从聊天 Bot 到帮你干活的跃迁使分散的工具链转化为护城河。同时腾讯历史上首个开展地推的现象级产品这一信号,也折射出对 B 端下沉的真正决心。 更大的想象空间来自微信 AI。微信 AI 助手「小微」已于 6 月 20 日启动小范围灰度测试,支持语音或文字完成发消息、朋友圈、调用小程序预约挂号与外卖点单,甚至通过自然语言生成小程序原型,这是 14.3 亿月活超级应用首次踏入智能体赛道。 摩根大通按概率加权测算,微信 AI Agent 到 2030 年可带来增量收入约 1260 亿元、增量经营利润约 880 亿元;但高盛则警惕三大疑虑:自研 WeLM 模型与混元并行运作可能资源重复、全面推广后推理成本或侵蚀 Q4 预测经调整营业利润的 5%-17%、短期变现路径尚不清晰。两家机构的分歧核心在于节奏:摩根大通认为公测已将微信 AI 从「抽象期权」变为「可追踪里程碑」,高盛认为短期成本与收益不对称需更多季度验证。 底层模型方面,混元 3 Preview 已接入 131 款腾讯产品,Token 调用量较二代提升 10 倍,在 OpenRouter 平台按使用量排名第一,但马化腾站上去了还坐不下去的判断仍有效,生态是腾讯做 Agent 的天然土壤,但微信 AI 要处理交易、广告、支付、商户、公平性和监管的复