Grok 4.5登顶SaaS工作流评测,成本约为Claude四分之一
相关推荐
Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍
据动察 Beating 监测,评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。 在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。 模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。 作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。
Grok全新语音模型拿下Agent评测第一,API价格涨60%
据动察 Beating 监测,SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。 Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。 性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。
SpaceXAI宣布开源Grok Build
BlockBeats 消息,7 月 16 日,马斯克旗下 SpaceXAI 宣布开源 Grok Build,并重置所有用户的使用限制。 针对用户关于隐私的问题,公司表示,自上线以来,Grok Build 完全尊重零数据保留(ZDR)原则。所有用户始终能够在命令行界面中禁用数据上传。在早期测试版中,非 ZDR 用户默认启用了数据保留。 自 7 月 12 日起,公司已为所有 Grok Build 用户禁用默认数据保留,此外正在删除之前保留的所有编码数据,确保每位用户的偏好得到尊重。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
SpaceXAI 推出 Grok 4.6 模型
ChainCatcher 消息,SpaceXAI 在 GitHub Copilot 中推出 Grok 4.6 模型。
SpaceXAI推出Grok 4.6
火星财经消息,8 月 12 日,据官方消息,SpaceXAI 正式推出 Grok 4.6。 马斯克此前称,Grok 4.6 是 1.5 万亿参数模型。升级重点是监督微调和强化学习。
SpaceXAI:Grok聊天机器人已处于测试阶段
BlockBeats 消息,8 月 12 日,SpaceXAI 宣布 Grok 聊天机器人已处于测试阶段,今日起向订阅 SuperGrok Heavy、Cursor Ultra 与 Cursor Teams Premium 套餐的桌面端及 iOS 用户开放使用。