加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源PANews

哔哩哔哩上线“AI 无限竞技场”评测平台

PANews 9月16日消息,哔哩哔哩推出“AI 无限竞技场”,目前收录超过 30 个测评主题、100 余个参战大模型,相关内容累计观看量已达 1398 万次以上。按各模型在测评主题中获得榜首的次数统计,GPT-6 Astra、GLM-5.3 和 Claude Fable 5.1 暂列前三名。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-03 11:11

20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三

动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。

09-04 07:36

GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%

动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。

09-12 16:08

GPT-6 Astra 发布一周后遭用户吐槽变笨,OpenAI 尚未回应

ChainCatcher 消息,据 Decrypt 报道,OpenAI 最新旗舰模型 GPT-6 Astra 在发布一周后,X 平台上涌现大量用户吐槽其性能“变笨”的帖子。匿名开发者 synthwavedd 发文称“Astra 今天感觉明显变笨了”,并调侃这是“发布后脑叶切除手术”。此前曾称赞该模型的开发者 Pranjal Paliwal 在检查 Astra 为其编写的代码后表示:“我们没有 AGI,我们遇到的是性能回退。”开发者 Pankaj Kumar 列举了症状:回答更快、质量更差,并怀疑 OpenAI 调低了“juice value”(即模型在回答前投入的算力)。Salio 与研究员 Md Ismail Sojal 用相同提示词对比发布当天与当前的 Astra,均得到更差的结果。T3Chat 创始人 Theo 则认为 Astra 只是比 Claude Fable 更不稳定,用户蜜月期结束后开始集中晒出糟糕结果。也有观点指出,OpenAI 上一代旗舰 GPT-5.6 Sol 在 7 月就经历过同样的周期,当时 OpenAI 高管 Tibo Sottiaux 否认故意削弱模型,但承认公司一直在实验“推理努力”设置。OpenAI 尚未就 Astra 发布类似 Sol 的声明。

09-07 08:22

OpenAI更新GPT-6 Astra界面,补充模型性能及API定价等信息

Odaily星球日报讯 OpenAI 最新更新 GPT-6 Astra 产品页面,补充了模型性能、企业应用、安全能力及 API 定价等信息。Astra 在 ARC-AGI-3 取得 99.9%,FrontierMath Tier 4 约 97.6%,Terminal-Bench 4.0 达 57.9%,高于 GPT-5.6 Sol 的 37.3%,并略高于 Claude Fable 5.1 的 55.8%;专业任务 Agents’ Last Exam 得分 59.3%,也高于 Claude Opus 5 的 55.5%。 OpenAI 同时明确,Astra 未来数日将陆续开放给 Plus、Pro、Business 和 Enterprise 用户,并进入 API、Azure 和 AWS Bedrock。由此看,产品页此次更新很可能是在为更大范围开放做准备,但具体全面上线时间仍未公布。

09-05 03:23

OpenAI被曝悄然调整GPT-6 Astra评测数据,部分指标曾“逆势”优化

PANews 9月5日,据《财富》报道,OpenAI已正式发布GPT-6 Astra,并称其为“目前全球最智能、且对齐程度最高的模型”,不过OpenAI已多次调整模型评测数据,部分调整使Astra表现更佳,同时部分竞争对手模型的成绩出现下降。其中,Astra的内部“幻觉率”最初公布为4.2%,后曾被下调至2%,随后又恢复至4.2%;Anthropic的Fable 5.1在FrontierMath Tier 4中的成绩也曾从87.8%降至78%,目前已恢复至83%。此外,Astra的ARC-AGI-3成绩则从发布前的98.6%提升至当前页面显示的99.99%。

08-29 13:49

Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol

动察 Beating AI 快讯,Terminal-Bench 发布 4.0,重新校准 Agent 执行任务时的时间、CPU 和内存,并修复 19 个任务、移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到 8 小时,主要是减少超时和环境问题对成绩的干扰。 最新榜单里,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,冲到第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名里,GLM-5.3 是唯一不是 Anthropic 的模型。 在 Terminal-Bench 3.0 中,GLM-5.3 还是 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反过来领先 Sol 4.5 个百分点。