阶跃Step 5正式发布,10月15日开源
相关推荐
阶跃Step 5偷跑:AA跑分追平Kimi K3,输出价不到1/5
动察 Beating AI 快讯,阶跃星辰还没正式官宣 Step 5,预览版已经提前出现在 Artificial Analysis。Step 5 Preview 是一款多模态推理模型,AA 标注其总参数约 600B、每次推理激活 27B,支持图片输入和 100 万 Token 上下文。 它在最新 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。Terminal-Bench 4.0 上,Step 5 Preview 得到 33%,Kimi K3 为 13%;SciCode 两者都是 59%。 Step 5 Preview 每百万输入 Token 1 美元,输出 2.7 美元;Kimi K3 分别为 3 美元和 15 美元。Step 5 的输出价格不到 K3 的五分之一,AA 跑完整套 Intelligence Index 的成本也只有 K3 的约四分之一。 阶跃星辰还没官宣 Step 5,但 AA 已经通过 StepFun API 跑完评测。参数和价格目前都还不是官方最终口径。
Hy4 preview优化「想太多」:复杂任务轮次和Token消耗双降
动察 Beating AI 快讯,腾讯混元和 WorkBuddy 给 Hy4 preview 做了一轮专项优化,已经在 WorkBuddy 全量上线。官方称,这次主要针对复杂任务里的长思考和过度自我验证,在不损失任务效果的前提下,显著减少任务轮次和输入、输出 token 消耗。 Hy4 preview 是腾讯 8 月底发布的开源旗舰 MoE,总参数 770B、激活参数 49B,支持 1M 上下文,重点面向代码、办公和科研等长任务。腾讯发布时就主动把「复杂任务长思考、过度自我验证」列为已知问题。
腾讯混元 Hy4 Preview 登陆 B.AI API
火星财经消息,9 月 2 日,B.AI 平台宣布腾讯混元团队最新开源旗舰模型 Hy4 Preview 正式上线 API 服务,面向开发者开放接入。该模型为 Hy4 系列早期版本,采用 770B 稀疏 MoE 架构,每 Token 激活 49B 参数,并支持 1M 超长上下文窗口。开发者可通过 B.AI API 官方渠道直接调用,登录 chat.b.ai/chat 或访问 docs.b.ai/zh-Hans/llmservice/models/hy4-preview/ 了解详情。
阶跃新旗舰基座模型Step 5 Preview发布 跻身全球权威榜单开源前三
火星财经消息,阶跃星辰发布新一代旗舰基座模型Step 5 Preview,重点面向AI编程、软件工程、专业知识工作、金融等场景,提升模型在真实世界Agentic任务中的综合表现,在能力、成本、效率和场景覆盖之间实现良好平衡,进一步拓展智能与成本之间的最优边界。在全球权威榜单Artificial Analysis Intelligence Index(AA 综合智能指数)中,阶跃 Step 5 Preview 跻身全球开源前三。值得关注的是,该模型单任务成本仅为Claude Opus 5 的1/8。据了解,阶跃将于10月15日正式开源 Step 5 Preview。 (科创板日报记者 黄心怡)
阶跃StepAudio 3发布:语音推理、实时对话双榜第一
动察 Beating AI 快讯,阶跃星辰发布 StepAudio 3,一口气上线 Realtime、ASR、TTS、Gen 和 Music 五款语音模型。 在 Artificial Analysis 的两项语音评测中,StepAudio 3 Realtime 都排第一。Conversational Dynamics 得分 98.9%,高于 Qwen Audio 3.0 Realtime Plus 的 98.4% 和 GPT-Realtime-2 High 的 95.3%;Speech Reasoning 得分 99.7%,同样位列第一。前者主要测模型能不能处理停顿、轮流说话、用户打断和「嗯」「对」这类附和,后者测模型能否直接听懂音频并完成推理。 ASR 也在 Artificial Analysis 非流式语音识别榜做到 1.7% WER(词错误率),与 Fun-Realtime-ASR-preview 并列第一。另外,StepAudio 3 Gen 可以一次生成人声、音效、环境声和音乐,并按场景统一编排。 五款模型目前均已进入阶跃的语音产品线。
1.5TB变214GB:腾讯给Hy4 preview做了极限量化版
动察 Beating AI 快讯,Hy4 preview 刚开源,腾讯混元又放出了一个极限量化版。原始模型权重接近 1.5TB,新版 GGUF 只有约 214GB,大幅降低了这款 770B MoE 模型的本地部署门槛。 它并不是把整个模型都压成 1.25-bit。腾讯按不同层对精度的敏感程度分别量化,能扛的部分最低压到约 1.31-bit,敏感部分保留 2-bit 甚至更高精度。最终整个文件平均约 2.38 bpw。腾讯给出的四项评测中,相比 BF16 原版只下降了 0.2 到 1.6 分。 压小以后,腾讯还和 prima.cpp 测试了异构设备联合推理。一台 RTX 4090 笔记本加一台四卡 A4000 服务器,总共只有 80GB 显存和 64GB 内存,最终把模型跑到了 1.02 token/s,比笔记本单机 offload 快约 6 倍。几台不同配置的设备,也可以一起分担模型推理。