GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%
相关推荐
20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。
OpenAI更新GPT-6 Astra界面,补充模型性能及API定价等信息
Odaily星球日报讯 OpenAI 最新更新 GPT-6 Astra 产品页面,补充了模型性能、企业应用、安全能力及 API 定价等信息。Astra 在 ARC-AGI-3 取得 99.9%,FrontierMath Tier 4 约 97.6%,Terminal-Bench 4.0 达 57.9%,高于 GPT-5.6 Sol 的 37.3%,并略高于 Claude Fable 5.1 的 55.8%;专业任务 Agents’ Last Exam 得分 59.3%,也高于 Claude Opus 5 的 55.5%。 OpenAI 同时明确,Astra 未来数日将陆续开放给 Plus、Pro、Business 和 Enterprise 用户,并进入 API、Azure 和 AWS Bedrock。由此看,产品页此次更新很可能是在为更大范围开放做准备,但具体全面上线时间仍未公布。
Claude Fable 5.1 正式登陆 B.AI API,专为高难度推理与 Agent 工作流打造
ChainCatcher 消息,B.AI 平台宣布 Anthropic 最新 Mythos 级通用模型 Claude Fable 5.1 现已正式接入 API。 该模型与 Claude Mythos 5.1 采用相同底层模型,专为高强度代码编写、长期 Agent 工作流与复杂知识任务深度优化,在 CursorBench 3.2.0 测试中以最高运算强度取得 73.4% 的优异表现。 API 接入现已开放,开发者可享专属优惠——官方渠道低至 8.5 折,自选服务商低至 6 折。B.AI 持续引入全球顶尖模型,为开发者提供更强大、更具性价比的 AI 能力选择。
GPT-6 Astra 发布一周后遭用户吐槽变笨,OpenAI 尚未回应
ChainCatcher 消息,据 Decrypt 报道,OpenAI 最新旗舰模型 GPT-6 Astra 在发布一周后,X 平台上涌现大量用户吐槽其性能“变笨”的帖子。匿名开发者 synthwavedd 发文称“Astra 今天感觉明显变笨了”,并调侃这是“发布后脑叶切除手术”。此前曾称赞该模型的开发者 Pranjal Paliwal 在检查 Astra 为其编写的代码后表示:“我们没有 AGI,我们遇到的是性能回退。”开发者 Pankaj Kumar 列举了症状:回答更快、质量更差,并怀疑 OpenAI 调低了“juice value”(即模型在回答前投入的算力)。Salio 与研究员 Md Ismail Sojal 用相同提示词对比发布当天与当前的 Astra,均得到更差的结果。T3Chat 创始人 Theo 则认为 Astra 只是比 Claude Fable 更不稳定,用户蜜月期结束后开始集中晒出糟糕结果。也有观点指出,OpenAI 上一代旗舰 GPT-5.6 Sol 在 7 月就经历过同样的周期,当时 OpenAI 高管 Tibo Sottiaux 否认故意削弱模型,但承认公司一直在实验“推理努力”设置。OpenAI 尚未就 Astra 发布类似 Sol 的声明。
GPT-6 Astra即将发布:OpenAI官方仓库已出现GPT-6
动察 Beating AI 快讯,OpenAI 官方的 GitHub 仓库里,已经直接出现了 GPT-6。一名 OpenAI 开发者向 Computer Use 示例项目提交 PR,新增 gpt6-js-image 和 gpt6-py-image 两套环境,分支名也直接叫 codex/gpt6-computer-use-images。 这两套环境分别面向 JavaScript 和 Python。前者装好 Playwright 和 Chromium,后者则用 PyAutoGUI、Chromium 和 Linux 桌面环境,让 Agent 可以看屏幕、操作浏览器和桌面。PR 目前还没有合并,而且里面没有 GPT-6 的 API 调用,只是在准备 Computer Use 的运行环境。 Sam Altman 最近在采访中称,过去的模型操作电脑一直太慢或者不好用,但 Astra 让他第一次感觉「已经达到和人类差不多的水平」。他现在会直接让模型去不同应用里找消息,而不是自己一个个打开搜索。
离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成
动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。