返回 7*24 快讯
来源MarsBit

Grok 4.5登顶SaaS工作流评测,成本约为Claude四分之一

据动察 Beating 监测,独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。 AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。 评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。 Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。 它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。 但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

06-16 18:23重要

Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍

据动察 Beating 监测,评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。 在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。 模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。 作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。

07-30 11:12重要

Grok全新语音模型拿下Agent评测第一,API价格涨60%

据动察 Beating 监测,SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。 Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。 性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。

07-16 07:20

SpaceXAI宣布开源Grok Build

BlockBeats 消息,7 月 16 日,马斯克旗下 SpaceXAI 宣布开源 Grok Build,并重置所有用户的使用限制。 针对用户关于隐私的问题,公司表示,自上线以来,Grok Build 完全尊重零数据保留(ZDR)原则。所有用户始终能够在命令行界面中禁用数据上传。在早期测试版中,非 ZDR 用户默认启用了数据保留。 自 7 月 12 日起,公司已为所有 Grok Build 用户禁用默认数据保留,此外正在删除之前保留的所有编码数据,确保每位用户的偏好得到尊重。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。

08-15 01:41

SpaceXAI 推出 Grok 4.6 模型

ChainCatcher 消息,SpaceXAI 在 GitHub Copilot 中推出 Grok 4.6 模型。

08-12 23:31

SpaceXAI推出Grok 4.6

火星财经消息,8 月 12 日,据官方消息,SpaceXAI 正式推出 Grok 4.6。 马斯克此前称,Grok 4.6 是 1.5 万亿参数模型。升级重点是监督微调和强化学习。

08-12 00:58

SpaceXAI:Grok聊天机器人已处于测试阶段

BlockBeats 消息,8 月 12 日,SpaceXAI 宣布 Grok 聊天机器人已处于测试阶段,今日起向订阅 SuperGrok Heavy、Cursor Ultra 与 Cursor Teams Premium 套餐的桌面端及 iOS 用户开放使用。