返回 7*24 快讯
来源MarsBit

阶跃 Step 3.7 Flash 位列 Artificial Analysis 输出速度榜主流第一

火星财经消息,大模型评测平台Artificial Analysis最新Output Speed榜单显示,阶跃星辰(StepFun)最新开源基座模型Step 3.7 Flash以409 tokens/s的输出速度位列主流模型第一,同时在端到端响应时长(End-to-End Response Time)、智能效率(Intelligence vs. Output Speed)与速度价格比(Output Speed vs. Price)等关键指标上均处于领先位置。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

07-01 16:24

SemiAnalysis拆解企业AI预算:Meta曾单月消耗70万亿tokens,但真正的风险不是客户不用AI了

BlockBeats 消息,7 月 1 日,企业 AI 使用正在从「尽量多用」转向「有额度地用」。SemiAnalysis 在 7 月 1 日发布的 Token Budgeting 报告中称,年初一度流行的 tokenmaxxing,也就是鼓励员工尽可能多消耗 AI token 以提升生产力,正在被更现实的预算制度取代。但该机构认为,媒体关于企业削减 AI 支出的叙事被夸大了,OpenAI 和 Anthropic 的 API 业务在今年下半年并未面临实质性预算风险。 SemiAnalysis 团队称,他们通过 Slack、电话以及 Databricks AI Summit 与 50 多家企业客户交流后发现,大多数公司确实开始设置 AI 使用上限,但并没有形成统一标准。低端预算可能只有每人每月 250 至 500 美元,高端预算则可达到每月 2000 美元甚至数万美元。一家美国大型航空航天与国防制造商把部分员工的月度额度设在 250 美元,一家大型制药公司设在 500 美元;Workday、Stripe 等技术更前沿的企业,部分员工预算约为每月 2000 美元。 这与年初的「token 最大化」形成对比。报告提到,Meta 和 Salesforce 等公司曾鼓励员工大量使用 AI 工具。Meta 内部甚至出现过一个名为「Claudeconomics」的仪表盘,对公司前 250 名重度用户进行排名。数据显示,Meta 员工在 30 天内消耗超过 60 万亿 tokens,单个最高用户消耗约 2800 亿 tokens。该仪表盘在相关报道后两天被关闭。Uber 也被报道称在四个月内消耗完 Claude Code 和 Codex 的年度预算,随后设置了每人每月 1500 美元的限额,超额申请需逐案审批。 但 SemiAnalysis 认为,这些极端案例更多反映激励机制和管理松散,而不是企业 AI 支出整体见顶。报告称,前 10% 高消费客户贡献了 AI 实验室大部分收入,这些客户在今年剩余时间削减 API 支出的风险很低。即便 Meta 在 2 月每月消耗约 70 万亿 tokens,并且按标价计算每名员工每年花费接近 5 万美元,SemiAnalysis 估计其仍只占 Anthropic 收入的 3% 至 5%。 企业支出分布也高度不均。SemiAnalysis 引用 Ramp 数据称,前 1% 客户每名员工年均 A

06-16 18:23重要

Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍

据动察 Beating 监测,评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。 在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。 模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。 作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。

06-08 15:52重要

阶跃星辰(StepFun)最快周一递港股IPO申请,估值或达120亿美元

据动察 Beating 监测,据华尔街日报引述知情人士消息,中国人工智能初创公司阶跃星辰(StepFun)最快将于周一递交港股 IPO 申请。主要投资方已提议将阶跃星辰的 IPO 估值设为最高 120 亿美元,不过最终估值仍可能发生变化。 在阶跃星辰之前,竞争对手智谱 AI 和 MiniMax 已于今年 1 月在香港挂牌。两家公司的股价在上市后均大幅上涨,有望在下月禁售期届满前为早期投资人带来可观回报。近期,智谱 AI 与 MiniMax 均表示正筹备在内地市场上市。 另一家中国大模型初创公司月之暗面同样在筹备赴港上市。密集上市反映出中国人工智能公司在市场环境有利时吸引投资人的迫切需求。在过去一年中,香港重新成为全球最活跃的首次公开募股市场之一,主要得益于大批来自人工智能、半导体和生物技术领域的中国公司选择在港上市。 阶跃星辰于 2023 年创立,创始人兼 CEO 姜大昕曾任微软副总裁。今年年初,阶跃星辰聘请了人脸识别企业旷视科技的联合创始人印奇出任董事长。

05-30 13:43

海光信息完成阶跃星辰Step 3.7 Flash适配

火星财经消息,5月29日,阶跃星辰发布Step 3.7 Flash,海光团队依托DTK异构计算平台与全栈软件栈,于发布当天即完成全流程适配与深度调优,实现“发布即适配、适配即高效”。即日起,开发者即可在海光平台上高效运行该模型,快速搭建多模态Agent、智能代码助手和复杂工作流应用,大幅降低接入与编排成本。

05-29 08:20

阶跃星辰发布并开源Step 3.7 Flash

火星财经消息 5月29日消息,阶跃星辰正式发布并开源Step 3.7 Flash。据介绍,Step 3.7 Flash是面向Agent生产化阶段推出的新一代Flash模型,围绕Agent、Coding、Search与多模态工作流进行系统优化。(广角观察)

05-21 14:45

ArtificialAnalysis:千问3.7问鼎国产模型冠军,全球前五

火星财经消息,5月21日,三方机构ArtificialAnalysis公布了最新的全球大模型榜单,阿里新发布的旗舰模型Qwen3.7-Max得分56.6分,性能接近GPT、Claude、Gemini的最强模型,位列全球第五、国产第一。据了解,Qwen3.7-Max即将上线阿里云百炼对外提供API服务。