Databricks用AI横扫英伟达Kernel榜:235项测试四个赛道第一,Token花费约7万美元
相关推荐
一夜两条路线:Opus5.5冲到第一,GPT-6把同档成本砍半
动察 Beating AI 快讯,Artificial Analysis 完成对昨夜几款新模型的第三方实测。Claude Opus 5.5 max 在 Intelligence Index v4.3 拿到 58 分,目前排名第一。GPT-6 Astra 和 Fable 5.1 都是 53 分,Opus 5 为 51 分。Opus 5.5 在 10 项评测里拿下 6 项最高分。 但这个最高分也用了更多 token。Opus 5.5 max 每项任务平均输出约 11.9 万 tokens,比 Opus 5 的 7.3 万多约 60%。靠 API 降价 20% 和缓存读取降价 60%,单任务成本最终为 5.98 美元,和 Opus 5 的 5.86 美元基本持平。更实用的 medium 档拿到 51 分,已经追平 Opus 5 max,单任务成本只有 1.34 美元。 OpenAI 走的则是另一条路。GPT-6 Sol 和 Luna 的 Intelligence Index 表现与 GPT-5.6 前代接近,但价格明显下降。Sol max 每项任务成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元。编码 Agent 评测里,Sol 从 55 分升到 57 分,成本也下降约一半;Luna 从 43 分降到 41 分,但单任务成本低约 60%。 两家的路线已经开始出现分化:Opus 5.5 用更多推理把能力上限推到新高,GPT-6 Sol 和 Luna 则主要把原有能力做得更便宜。 在 Artificial Analysis 的性能/成本图上,两家的新模型都占据了新的 Pareto 前沿。
GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%
动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。
GPT-6 Astra考过「科目二」?5分22秒驶入锥桶车位
动察 Beating AI 快讯,三名中国台湾地区研究人员搭建 DrivingBench,将 GPT-6 Astra、GPT-5.6 Sol、Grok 4.6 和 Claude Fable 5.1 等通用大模型接入一辆真实的 2022 款丰田卡罗拉,进行类似「科目二」的真实车辆驾驶测试。测试赛道全长约 130 米,由彩色锥桶组成 8 米宽通道,车辆需连续通过多个弯道,最终驶入一个 7×5 米的锥桶车位。 此前从未接受专门驾驶训练的 GPT-6 Astra,在首次测试中因判断失误偏离赛道,但第二次调整策略后,以 5 分 22 秒完成约 134.7 米赛程并成功驶入车位,成为四个模型中唯一「通过科目二」的模型。 测试中,Astra 将弯道及障碍物附近车速控制在 0.5 至 0.8 米/秒,并根据实时摄像头画面持续调整方向。相比之下,Sol、Grok 和 Fable 均未完成测试,其中 Sol 和 Grok 连续三次失败,Fable 第三次行驶至约 45% 位置后停止。 此次测试显示,未经专门驾驶数据训练的通用大模型已能够在低速真实环境中完成基础驾驶任务,但距离实际道路自动驾驶仍存在明显差距。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
GPT-6 Astra解决刘维尔版哥德巴赫,Lean独立复核通过
动察 Beating AI 快讯,匿名数学社区账号 Captain Sude 公布了 GPT-6 Astra 找到的一份新证明,解决了刘维尔版哥德巴赫问题。 这个问题把经典哥德巴赫猜想里的「两个质数」,放宽成「两个质因子总数为奇数的整数」。此前杜伦大学数学家 Alexander P. Mangerel 只能在广义黎曼猜想成立、且偶数足够大时证明。 Astra 现在去掉了这两个限制,证明所有大于 2 的偶数都成立。核心思路是先假设某个偶数无法这样拆分,再一步步推出互相矛盾的结果。 完整证明已经写进 Lean 4。项目可以正常编译,独立审计仓库也成功复现,没有发现 `sorry` 或额外数学公理。 经典哥德巴赫猜想本身仍未解决,因为这里的两个加数依然可以是合数。
85年没解开的德军恩尼格玛密电,GPT-6 Astra用10小时破了
动察 Beating AI 快讯,彭博一名产品开发人员 Carter Leffen 用 GPT-6 Astra,破解了一条 1941 年的德军恩尼格玛密电。他本人并不是密码学家。 这条密文只有 82 个字母,此前一直被密码史料网站 CryptoCellar 列为尚未破解。Astra Extra High 大约花了 10 小时找到答案。 关键线索来自当天另一封已经破译的电报。Astra 发现里面连续出现两次地名「ROSENOW」,随后猜测这个词也藏在目标密文里。它接着写恩尼格玛模拟器和搜索程序,并行测试不同密钥,再用原始电报头和剩余文字验证。 最终还原出的内容很简单:「请告知行军路线。我在 Rosenow。请立即通过无线电回复。」 不过这次也不是完全只靠 Astra。Leffen 负责提出目标和推进调查,Astra 则完成了大量查资料、写代码、跑搜索和验证工作。