返回 7*24 快讯
来源PANews

马斯克:Grok 5或许会超越目前所有产品

PANews 9月14日消息,马斯克在社交平台上表示:“Grok 4.7的水平应该大致相当于Opus 5.0,而不是5.1。它在某些方面更好,在另一些方面则更弱。我们需要改进多模态性能。Grok 4.8将会带来明显提升。Grok 4.9可能会达到Astra/Fable级别。Grok 5或许会超越目前所有产品。我们拭目以待。”
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-04 07:36

GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%

动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。

06-28 10:58

马斯克:Grok 4.5进入SpaceX与特斯拉私测,性能或接近甚至超越Opus

PANews 6月28日消息,马斯克在X平台发文表示,基于 1.5T V9 f基础模型构建的 Grok 4.5 版本已在 SpaceX 与特斯拉内部进入私有测试阶段,并在补充训练中加入了 Cursor 数据。早期评测显示,该模型性能已接近甚至可能超过 Opus 水平。马斯克同时指出,强化学习(RL)仍在持续显著提升模型能力,而 Grok Build 训练框架也在不断迭代优化。此外,马斯克透露由 SpaceX 完全从零训练的新模型将在今年内以每月一次的频率持续发布。

07-25 01:26

Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%

据动察 Beating 监测,第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。 Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。 模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。 短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。

07-15 06:30

传Claude Opus5最快本周发布,填补Fable5退场空档

据动察 Beating 监测,爆料账号 leo 称,Anthropic 正在为 Claude Opus 5 做最后准备。模型最快本周发布,也可能推迟到下周。其能力预计接近 Fable 5,但运行成本更低。 Anthropic 已把 Fable 5 的订阅内使用期延长至 7 月 19 日,但暂不准备再次延期。

07-13 02:38

马斯克:Grok 4.5在部分软件开发基准测试中超越Fable

Odaily星球日报讯 马斯克在 X 平台发文表示,Grok 4.5 在部分软件开发基准测试中表现超过 Fable, 而 Fable 本身已经是一个非常优秀的模型。

09-11 00:00

Cognition拿Kimi K3炼出SWE-2:逼近Astra,成本仅1/4

动察 Beating AI 快讯,Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。它直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测又提高约 5 到 6 个百分点。 在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。它距离 Fable 5.1 的 50.9% 只差 0.9 个百分点,但成本低 64%。GPT-6 Astra 得分 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为四分之一。 SWE-2 也比上一代少走很多弯路。中等推理强度下,它完成任务的交互轮数减少 58%,平均成本下降 81%。不过在更难的 Terminal-Bench 4 上,SWE-2 只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,还谈不上全面追平前沿模型。 SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。