AI网络安全榜爆冷:GPT-6、Claude旗舰因安全拒答掉队,小米MiMo追平Grok登顶
相关推荐
Claude、Grok、ChatGPT出现宕机或访问异常
动察 Beating AI 快讯,多家 AI 服务出现宕机/访问异常,包括: Claude:Claude 4.6/4.8/5/5.1 系列错误率均在上升。 Grok:Grok for Android 存在异常,grok api 服务在美东 1 区出现异常。 ChatGPT:网页版异常,部分用户客户端异常,未登录时登录可能出问题。
Artificial Analysis重做智能榜:40%权重改用私有测试
动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。
小米发布MiMo-V2.6模型,称其为当前最强开源模型
动察 Beating AI 快讯,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列。团队表示,MiMo-V2.6 系列包含 Pro 和 Flash 两个原生全模态模型。得益于 RL 算力的扩展,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 46 分,超过 Kimi K3 和 Qwen3.8 Max,成为当前最强的开源模型;但与最强的闭源模型 Claude Fable5.1 和 GPT-6 Astra 相比,仍有差距。 团队称,MiMo-V2.6 系列沿用 V2.5 系列的 API 定价,MiMo-V2.6-Pro 刷新了中国国产模型的性价比纪录:在同等智能水平下,价格仅为海外模型的 1/20 至 1/60。
xAI发布Grok 4.7:参数规模增至2.1万亿,基准测试仍落后Claude
动察 Beating AI 快讯,xAI 周一正式发布 Grok 4.7,官方称其在同等价格和速度下较 Grok 4.6 有「显著提升」。Grok 4.7 此前至少经历 5 次延期,目前已上线 Grok 应用、Cursor、Grok Build 及 xAI API。 Grok 4.7 参数规模达到 2.1 万亿,较 Grok 4.6 的 1.5 万亿增加 40%,输入和输出价格分别为每百万 Token 2 美元和 6 美元。xAI 还引入 SpaceX 补充训练数据,包括 Starlink 卫星遥测数据、制造记录和工程故障日志,旨在提升模型对硬件及物理系统的推理能力。 基准测试方面,Grok 4.7 在 GDPval 和 AA-Briefcase 中均排名第二,得分分别为 1695 和 1657,均落后 Claude Fable 5.1 的 1735 和 1678;在电气工程基准测试 EEBench 中则排名第二,仅次于 GPT-6 Astra。CursorBench 4.0 显示,Grok 4.7 的任务成本高于 GPT-6 Astra 和 Claude Sonnet 5,同时整体表现仍落后 Fable 5.1。 马斯克此前曾表示,Grok 4.7 的水平大致相当于 Claude Opus 5.0,但尚未达到更新版本 Opus 5.1 的水平,并透露 Grok 4.8、4.9 及 Grok 5 正在开发中。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
一夜两条路线:Opus5.5冲到第一,GPT-6把同档成本砍半
动察 Beating AI 快讯,Artificial Analysis 完成对昨夜几款新模型的第三方实测。Claude Opus 5.5 max 在 Intelligence Index v4.3 拿到 58 分,目前排名第一。GPT-6 Astra 和 Fable 5.1 都是 53 分,Opus 5 为 51 分。Opus 5.5 在 10 项评测里拿下 6 项最高分。 但这个最高分也用了更多 token。Opus 5.5 max 每项任务平均输出约 11.9 万 tokens,比 Opus 5 的 7.3 万多约 60%。靠 API 降价 20% 和缓存读取降价 60%,单任务成本最终为 5.98 美元,和 Opus 5 的 5.86 美元基本持平。更实用的 medium 档拿到 51 分,已经追平 Opus 5 max,单任务成本只有 1.34 美元。 OpenAI 走的则是另一条路。GPT-6 Sol 和 Luna 的 Intelligence Index 表现与 GPT-5.6 前代接近,但价格明显下降。Sol max 每项任务成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元。编码 Agent 评测里,Sol 从 55 分升到 57 分,成本也下降约一半;Luna 从 43 分降到 41 分,但单任务成本低约 60%。 两家的路线已经开始出现分化:Opus 5.5 用更多推理把能力上限推到新高,GPT-6 Sol 和 Luna 则主要把原有能力做得更便宜。 在 Artificial Analysis 的性能/成本图上,两家的新模型都占据了新的 Pareto 前沿。