马斯克:GPT-6 Astra 模拟测试中推人下悬崖
相关推荐
Muse上线一周,稳居美国免费榜第二:只输ChatGPT,超过Gemini和Claude
动察 Beating AI 快讯,Meta 的个人 AI Agent 产品 Muse 上线一周,目前仍排在美国 App Store 免费 App 总榜第二,仅次于 ChatGPT,高于 Google Gemini 和 Claude。 Muse 是一个可以长期工作的个人 Agent,能连接邮箱、日历等服务,自己浏览网页、拆解任务,并在用户关闭 App 后继续后台执行。
Claude、Grok、ChatGPT出现宕机或访问异常
动察 Beating AI 快讯,多家 AI 服务出现宕机/访问异常,包括: Claude:Claude 4.6/4.8/5/5.1 系列错误率均在上升。 Grok:Grok for Android 存在异常,grok api 服务在美东 1 区出现异常。 ChatGPT:网页版异常,部分用户客户端异常,未登录时登录可能出问题。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
GPT-6 Astra 发布一周后遭用户吐槽变笨,OpenAI 尚未回应
ChainCatcher 消息,据 Decrypt 报道,OpenAI 最新旗舰模型 GPT-6 Astra 在发布一周后,X 平台上涌现大量用户吐槽其性能“变笨”的帖子。匿名开发者 synthwavedd 发文称“Astra 今天感觉明显变笨了”,并调侃这是“发布后脑叶切除手术”。此前曾称赞该模型的开发者 Pranjal Paliwal 在检查 Astra 为其编写的代码后表示:“我们没有 AGI,我们遇到的是性能回退。”开发者 Pankaj Kumar 列举了症状:回答更快、质量更差,并怀疑 OpenAI 调低了“juice value”(即模型在回答前投入的算力)。Salio 与研究员 Md Ismail Sojal 用相同提示词对比发布当天与当前的 Astra,均得到更差的结果。T3Chat 创始人 Theo 则认为 Astra 只是比 Claude Fable 更不稳定,用户蜜月期结束后开始集中晒出糟糕结果。也有观点指出,OpenAI 上一代旗舰 GPT-5.6 Sol 在 7 月就经历过同样的周期,当时 OpenAI 高管 Tibo Sottiaux 否认故意削弱模型,但承认公司一直在实验“推理努力”设置。OpenAI 尚未就 Astra 发布类似 Sol 的声明。
OpenAI更新GPT-6 Astra界面,补充模型性能及API定价等信息
Odaily星球日报讯 OpenAI 最新更新 GPT-6 Astra 产品页面,补充了模型性能、企业应用、安全能力及 API 定价等信息。Astra 在 ARC-AGI-3 取得 99.9%,FrontierMath Tier 4 约 97.6%,Terminal-Bench 4.0 达 57.9%,高于 GPT-5.6 Sol 的 37.3%,并略高于 Claude Fable 5.1 的 55.8%;专业任务 Agents’ Last Exam 得分 59.3%,也高于 Claude Opus 5 的 55.5%。 OpenAI 同时明确,Astra 未来数日将陆续开放给 Plus、Pro、Business 和 Enterprise 用户,并进入 API、Azure 和 AWS Bedrock。由此看,产品页此次更新很可能是在为更大范围开放做准备,但具体全面上线时间仍未公布。
GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%
动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。