GPT-6 Astra考过「科目二」?5分22秒驶入锥桶车位
相关推荐
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
xAI发布Grok 4.7:参数规模增至2.1万亿,基准测试仍落后Claude
动察 Beating AI 快讯,xAI 周一正式发布 Grok 4.7,官方称其在同等价格和速度下较 Grok 4.6 有「显著提升」。Grok 4.7 此前至少经历 5 次延期,目前已上线 Grok 应用、Cursor、Grok Build 及 xAI API。 Grok 4.7 参数规模达到 2.1 万亿,较 Grok 4.6 的 1.5 万亿增加 40%,输入和输出价格分别为每百万 Token 2 美元和 6 美元。xAI 还引入 SpaceX 补充训练数据,包括 Starlink 卫星遥测数据、制造记录和工程故障日志,旨在提升模型对硬件及物理系统的推理能力。 基准测试方面,Grok 4.7 在 GDPval 和 AA-Briefcase 中均排名第二,得分分别为 1695 和 1657,均落后 Claude Fable 5.1 的 1735 和 1678;在电气工程基准测试 EEBench 中则排名第二,仅次于 GPT-6 Astra。CursorBench 4.0 显示,Grok 4.7 的任务成本高于 GPT-6 Astra 和 Claude Sonnet 5,同时整体表现仍落后 Fable 5.1。 马斯克此前曾表示,Grok 4.7 的水平大致相当于 Claude Opus 5.0,但尚未达到更新版本 Opus 5.1 的水平,并透露 Grok 4.8、4.9 及 Grok 5 正在开发中。
GPT-6 Astra 发布一周后遭用户吐槽变笨,OpenAI 尚未回应
ChainCatcher 消息,据 Decrypt 报道,OpenAI 最新旗舰模型 GPT-6 Astra 在发布一周后,X 平台上涌现大量用户吐槽其性能“变笨”的帖子。匿名开发者 synthwavedd 发文称“Astra 今天感觉明显变笨了”,并调侃这是“发布后脑叶切除手术”。此前曾称赞该模型的开发者 Pranjal Paliwal 在检查 Astra 为其编写的代码后表示:“我们没有 AGI,我们遇到的是性能回退。”开发者 Pankaj Kumar 列举了症状:回答更快、质量更差,并怀疑 OpenAI 调低了“juice value”(即模型在回答前投入的算力)。Salio 与研究员 Md Ismail Sojal 用相同提示词对比发布当天与当前的 Astra,均得到更差的结果。T3Chat 创始人 Theo 则认为 Astra 只是比 Claude Fable 更不稳定,用户蜜月期结束后开始集中晒出糟糕结果。也有观点指出,OpenAI 上一代旗舰 GPT-5.6 Sol 在 7 月就经历过同样的周期,当时 OpenAI 高管 Tibo Sottiaux 否认故意削弱模型,但承认公司一直在实验“推理努力”设置。OpenAI 尚未就 Astra 发布类似 Sol 的声明。
ChatGPT Voice现可调用GPT-5.6 Sol和GPT-6 Astra
PANews 9月10日消息,OpenAI产品团队成员Atty Eleti发文称,ChatGPT Voice现可调用GPT-5.6 Sol和GPT-6 Astra。用户可自行选择模型及推理强度;Pro用户可选择上述模型,语音模式会在需要搜索或推理时调用所选模型。该功能基于GPT-Live运行,并将搜索及推理任务委派给前沿模型;语音调用底层文本模型回答时,会计入相应模型的消息额度。
一夜两条路线:Opus5.5冲到第一,GPT-6把同档成本砍半
动察 Beating AI 快讯,Artificial Analysis 完成对昨夜几款新模型的第三方实测。Claude Opus 5.5 max 在 Intelligence Index v4.3 拿到 58 分,目前排名第一。GPT-6 Astra 和 Fable 5.1 都是 53 分,Opus 5 为 51 分。Opus 5.5 在 10 项评测里拿下 6 项最高分。 但这个最高分也用了更多 token。Opus 5.5 max 每项任务平均输出约 11.9 万 tokens,比 Opus 5 的 7.3 万多约 60%。靠 API 降价 20% 和缓存读取降价 60%,单任务成本最终为 5.98 美元,和 Opus 5 的 5.86 美元基本持平。更实用的 medium 档拿到 51 分,已经追平 Opus 5 max,单任务成本只有 1.34 美元。 OpenAI 走的则是另一条路。GPT-6 Sol 和 Luna 的 Intelligence Index 表现与 GPT-5.6 前代接近,但价格明显下降。Sol max 每项任务成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元。编码 Agent 评测里,Sol 从 55 分升到 57 分,成本也下降约一半;Luna 从 43 分降到 41 分,但单任务成本低约 60%。 两家的路线已经开始出现分化:Opus 5.5 用更多推理把能力上限推到新高,GPT-6 Sol 和 Luna 则主要把原有能力做得更便宜。 在 Artificial Analysis 的性能/成本图上,两家的新模型都占据了新的 Pareto 前沿。
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。