加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源MarsBit

阶跃新旗舰基座模型Step 5 Preview发布 跻身全球权威榜单开源前三

火星财经消息,阶跃星辰发布新一代旗舰基座模型Step 5 Preview,重点面向AI编程、软件工程、专业知识工作、金融等场景,提升模型在真实世界Agentic任务中的综合表现,在能力、成本、效率和场景覆盖之间实现良好平衡,进一步拓展智能与成本之间的最优边界。在全球权威榜单Artificial Analysis Intelligence Index(AA 综合智能指数)中,阶跃 Step 5 Preview 跻身全球开源前三。值得关注的是,该模型单任务成本仅为Claude Opus 5 的1/8。据了解,阶跃将于10月15日正式开源 Step 5 Preview。 (科创板日报记者 黄心怡)
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-20 02:10

阶跃Step 5正式发布,10月15日开源

动察 Beating AI 快讯,阶跃星辰正式发布旗舰模型 Step 5 Preview。它采用稀疏 MoE 架构,总参数 600B,每次仅激活 27B,支持 100 万 Token 上下文和图文输入。API 和 Studio 已经全量开放,完整模型权重将在 10 月 15 日放出。 此前 Artificial Analysis 已经提前跑完评测。Step 5 Preview 在 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。AA 当前测得其输出约 100 Token/s,每项任务成本 0.71 美元;Kimi K3 Max 为 2 美元。 官方重点展示了它跑长任务的能力。阶跃让 Step 5 Preview 连续最多 24 小时自主优化一套 H100 GPU 内核。模型会自己改代码、跑测试、比较结果,再继续迭代。约 22 小时后达到 508 TFLOPS,同一实验中的 Claude Opus 5 为 493 TFLOPS。 另一项 24 小时实验里,Step 5 Preview 自己设计后训练数据,把 Qwen3-30B-A3B 在 AIME24 上的准确率从 53.3% 提到 60%,与 Claude Opus 5 持平,同时消耗更少的标注 Token。

09-05 11:13

Artificial Analysis重做智能榜:40%权重改用私有测试

动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。

09-19 16:15

阶跃Step 5偷跑:AA跑分追平Kimi K3,输出价不到1/5

动察 Beating AI 快讯,阶跃星辰还没正式官宣 Step 5,预览版已经提前出现在 Artificial Analysis。Step 5 Preview 是一款多模态推理模型,AA 标注其总参数约 600B、每次推理激活 27B,支持图片输入和 100 万 Token 上下文。 它在最新 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。Terminal-Bench 4.0 上,Step 5 Preview 得到 33%,Kimi K3 为 13%;SciCode 两者都是 59%。 Step 5 Preview 每百万输入 Token 1 美元,输出 2.7 美元;Kimi K3 分别为 3 美元和 15 美元。Step 5 的输出价格不到 K3 的五分之一,AA 跑完整套 Intelligence Index 的成本也只有 K3 的约四分之一。 阶跃星辰还没官宣 Step 5,但 AA 已经通过 StepFun API 跑完评测。参数和价格目前都还不是官方最终口径。

09-15 08:06

阶跃StepAudio 3发布:语音推理、实时对话双榜第一

动察 Beating AI 快讯,阶跃星辰发布 StepAudio 3,一口气上线 Realtime、ASR、TTS、Gen 和 Music 五款语音模型。 在 Artificial Analysis 的两项语音评测中,StepAudio 3 Realtime 都排第一。Conversational Dynamics 得分 98.9%,高于 Qwen Audio 3.0 Realtime Plus 的 98.4% 和 GPT-Realtime-2 High 的 95.3%;Speech Reasoning 得分 99.7%,同样位列第一。前者主要测模型能不能处理停顿、轮流说话、用户打断和「嗯」「对」这类附和,后者测模型能否直接听懂音频并完成推理。 ASR 也在 Artificial Analysis 非流式语音识别榜做到 1.7% WER(词错误率),与 Fun-Realtime-ASR-preview 并列第一。另外,StepAudio 3 Gen 可以一次生成人声、音效、环境声和音乐,并按场景统一编排。 五款模型目前均已进入阶跃的语音产品线。

07-29 02:24重要

Claude 发现加密算法弱点,对后量子安全构成理论威胁

火星财经消息,Anthropic 宣布 Claude Mythos Preview 模型在密码学研究中取得突破,发现针对后量子数字签名候选方案 HAWK 的改进攻击方法。HAWK 是 NIST 为对抗量子计算机攻击而征集的后量子签名候选方案,此前已通过两轮专家审查,但 Claude 仅用 60 小时就将 HAWK-256 的有效密钥强度从 2^64 降至 2^38,大幅降低理论破解成本。HAWK 尚未被实际部署,该攻击目前不影响任何生产系统。Claude 还发现针对 7 轮 AES 的改进攻击,速度提升 200 至 800 倍。研究过程中,Claude 在密码学家有限指导下自主完成文献综述、数学推理和实验验证。HAWK 攻击约 60 小时、API 成本约 10 万美元;AES 攻击由 Claude 自主完成,生成约 10 亿 token 后提出核心创新思路。Anthropic 研究人员随后花费数百小时验证结果。Anthropic 表示,AI 模型已能帮助发现重要密码算法缺陷,密码学界可能面临类似软件漏洞领域的瓶颈——AI 产生的研究成果远超人类验证能力。Anthropic 已与学术机构合作推出 CryptanalysisBench 基准,并与 NIST 作者及政府伙伴协调披露。研究团队已在 LEA、Serpent-128 等算法上取得初步成果。Anthropic 警告,随着 AI 能力提升,未来可能发现对已部署系统的实际攻击,需提前建立应对机制。

07-09 08:54

Grok 4.5登顶SaaS工作流评测,成本约为Claude四分之一

据动察 Beating 监测,独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。 AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。 评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。 Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。 它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。 但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。