腾讯混元 Hy4 Preview 登陆 B.AI API
相关推荐
Hy4 preview优化「想太多」:复杂任务轮次和Token消耗双降
动察 Beating AI 快讯,腾讯混元和 WorkBuddy 给 Hy4 preview 做了一轮专项优化,已经在 WorkBuddy 全量上线。官方称,这次主要针对复杂任务里的长思考和过度自我验证,在不损失任务效果的前提下,显著减少任务轮次和输入、输出 token 消耗。 Hy4 preview 是腾讯 8 月底发布的开源旗舰 MoE,总参数 770B、激活参数 49B,支持 1M 上下文,重点面向代码、办公和科研等长任务。腾讯发布时就主动把「复杂任务长思考、过度自我验证」列为已知问题。
OpenAI把ChatGPT实时语音开放API:每分钟5美分
动察 Beating AI 快讯,OpenAI 开放 GPT-Live-1 API,也就是 ChatGPT 目前使用的实时语音模型。它能同时听和说,直接理解语音、处理普通对话,也能应对插话、停顿和背景噪音。 遇到复杂推理或工具调用时,GPT-Live-1 可以把任务交给 GPT-6 Astra、Luna 或第三方模型,拿到结果后再继续和用户聊。开发者可以自己决定后端接什么模型。 相比传统的「语音转文字→大模型→文字转语音」,GPT-Live-1 减少了中间的模型交接,让实时对话更连贯。 GPT-Live-1 收费每分钟 0.05 美元,后端模型另算。
AI编程代理Amp取消BYOK月费与Token费用,用户可用自有算力免费运行
PANews 9月13日消息,据Amp官方公告,AI编程代理Amp现已允许用户在自备算力以及模型订阅或API密钥的情况下免费使用。用户通过ChatGPT订阅接入Amp不再需要月度套餐,BYOK模式也不再收取Amp Token费用或设置额度限制(企业版除外)。用户可在自有电脑上通过Runner免费运行Amp代理,也可按量付费使用远程计算环境Orbs。
Amp取消平台门票:自带ChatGPT和电脑就能免费跑Coding Agent
动察 Beating AI 快讯,Amp 推出免费 Hobby 档。Amp 是从 Sourcegraph 拆出来的 Coding Agent 公司,产品和 Claude Code、Codex 属于一类,可以让 AI 自己读代码、改代码、跑命令和测试。现在只要用自己的电脑,再接自己的 ChatGPT 订阅或模型 API Key,就能免费使用 Amp,不再额外交月费和 BYOK Token 费。 今年 7 月 Amp 推出订阅制后,想把自己的 ChatGPT 订阅接进 Amp,至少要开每月 20 美元的 Megawatt。BYOK 即便用的是自己的模型 Key,Amp 也会收额外 Token 费用并设限制。现在这两层都取消了。ChatGPT 订阅费或 API 本身的模型费用,还是用户自己承担。 Amp 还有一个叫 Orb 的远程云电脑产品,可以给每个任务开一套独立环境。代码和开发工具都放在里面,关掉自己的电脑后 Agent 还能继续干活,也方便同时跑多个任务。Orb 依然按使用量收费;不想付这笔钱,也可以让 Amp 直接跑在自己的电脑上。 另外,Amp 还在扩大 BYOK 范围。付费用户已经可以接 OpenRouter、Amazon Bedrock、Azure Foundry、Ollama Cloud 和自定义模型接口等,之后会开放给所有用户。
1.5TB变214GB:腾讯给Hy4 preview做了极限量化版
动察 Beating AI 快讯,Hy4 preview 刚开源,腾讯混元又放出了一个极限量化版。原始模型权重接近 1.5TB,新版 GGUF 只有约 214GB,大幅降低了这款 770B MoE 模型的本地部署门槛。 它并不是把整个模型都压成 1.25-bit。腾讯按不同层对精度的敏感程度分别量化,能扛的部分最低压到约 1.31-bit,敏感部分保留 2-bit 甚至更高精度。最终整个文件平均约 2.38 bpw。腾讯给出的四项评测中,相比 BF16 原版只下降了 0.2 到 1.6 分。 压小以后,腾讯还和 prima.cpp 测试了异构设备联合推理。一台 RTX 4090 笔记本加一台四卡 A4000 服务器,总共只有 80GB 显存和 64GB 内存,最终把模型跑到了 1.02 token/s,比笔记本单机 offload 快约 6 倍。几台不同配置的设备,也可以一起分担模型推理。
MiMo系列正式登陆B.AI Web Chat
Odaily星球日报讯 8 月 25 日,B.AI 平台宣布 MiMo 系列模型正式上线 Web Chat 端。继 API 端率先开放后,MiMo V2.5 现均已开启 Web Chat 与 API 双端限时免费体验,开发者与用户可零成本感受小米开源旗舰全模态模型的硬核实力。 作为一款 310B 稀疏 MoE 原生全模态大模型,MiMo V2.5 支持文本、图像、视频及音频全模态输入,并拥有 1M 超长上下文窗口与极速响应能力,专为多模态 Agent、音视频智能分析及通用编程等高强度场景深度优化。 与此同时,定位复杂智能体与编程任务的 MiMo V2.5 Pro 也已同步上线 Web Chat,欢迎开发者与用户体验小米迄今最强大的模型能力。立即登录 chat.b.ai/chat,开启 MiMo 系列全模态智能新体验。