B.AI 推出 Token2049 线上互动挑战赛,Pick 最爱 AI 赢限量好礼
相关推荐
AI网络安全榜爆冷:GPT-6、Claude旗舰因安全拒答掉队,小米MiMo追平Grok登顶
动察 Beating AI 快讯,Artificial Analysis 推出独立的 Cyber Index,专门评测 AI Agent 做企业网络防御的能力。它不是从原来的通用 Intelligence Index 里抽几项测试,而是另外采用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项网络安全评测,分别测试漏洞审计与修补、漏洞发现,以及从发现漏洞到复现并修补的完整流程,三项各占三分之一。 首批榜单中,Grok 4.7(xhigh)和小米 MiMo-V2.6-Pro 同为 56 分,GPT-6 Luna(max)53 分,GLM-5.3-Flash 50 分。MiMo 平均每个任务成本只有 0.18 美元,Grok 4.7 要 11.67 美元;Luna 更低,只要 0.12 美元。 不过,这张榜不能简单理解成模型本身的网络安全能力排名。GPT-6 Sol、GPT-6 Astra 和 Claude Opus 5.5 都参加了测试,但在 CyberGym-E2E-AA 上几乎全部拒答,其中 Sol 和 Astra 拒绝全部任务,Opus 5.5 拒绝 98%。拒答直接记 0 分,Luna 反而愿意继续完成这些任务,所以综合成绩更高。Artificial Analysis 也表示,大量拒答让这些前沿模型的实际能力很难判断。 GLM-5.3 也出现了明显反常。完整版在 Artificial Analysis 的通用能力榜上高于 Flash,但这次 Cyber Index 只有 36 分,Flash 达到 50 分。主要差距来自 CyberGym-E2E-AA:Flash 得到 74%,完整版只有 29%。Artificial Analysis 暂未解释这一差距的原因。
xAI发布Grok 4.7:参数规模增至2.1万亿,基准测试仍落后Claude
动察 Beating AI 快讯,xAI 周一正式发布 Grok 4.7,官方称其在同等价格和速度下较 Grok 4.6 有「显著提升」。Grok 4.7 此前至少经历 5 次延期,目前已上线 Grok 应用、Cursor、Grok Build 及 xAI API。 Grok 4.7 参数规模达到 2.1 万亿,较 Grok 4.6 的 1.5 万亿增加 40%,输入和输出价格分别为每百万 Token 2 美元和 6 美元。xAI 还引入 SpaceX 补充训练数据,包括 Starlink 卫星遥测数据、制造记录和工程故障日志,旨在提升模型对硬件及物理系统的推理能力。 基准测试方面,Grok 4.7 在 GDPval 和 AA-Briefcase 中均排名第二,得分分别为 1695 和 1657,均落后 Claude Fable 5.1 的 1735 和 1678;在电气工程基准测试 EEBench 中则排名第二,仅次于 GPT-6 Astra。CursorBench 4.0 显示,Grok 4.7 的任务成本高于 GPT-6 Astra 和 Claude Sonnet 5,同时整体表现仍落后 Fable 5.1。 马斯克此前曾表示,Grok 4.7 的水平大致相当于 Claude Opus 5.0,但尚未达到更新版本 Opus 5.1 的水平,并透露 Grok 4.8、4.9 及 Grok 5 正在开发中。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
Anthropic 发布 Claude Sonnet 5.5,编程成绩超过 Opus 5.5
ChainCatcher 消息,Anthropic 于本周一发布 Claude Sonnet 5.5,作为今年 6 月推出的 Sonnet 5 的升级版本。官方称该中端模型运行速度较上一代提升超过 30%,在范围明确的日常任务、修复缺陷以及制作文档、幻灯片和表格方面表现最强,同时具备敏锐的设计能力。其定价维持每百万输入 token 2 美元、每百万输出 token 10 美元,为 Opus 5.5 的一半,且每个任务消耗的 token 较 Sonnet 5 减少近三分之一。在 Terminal-Bench 4 测试中,Sonnet 5.5 得分 70.6%,高于 Opus 5.5 的 66.4%,Sonnet 5 仅为 10.3%。独立测试机构 Artificial Analysis 的结果同样显示其领先,分别录得 63.6% 与 59.6%,OpenAI 的 GPT-6 Astra 为 59.1%。在评估 44 类职业真实工作表现的 GDPval-AA 上,Sonnet 5.5 获 1844 分,与 Opus 5.5 的 1846 分基本持平,GPT-6 Sol 为 1487 分。
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。
Muse上线一周,稳居美国免费榜第二:只输ChatGPT,超过Gemini和Claude
动察 Beating AI 快讯,Meta 的个人 AI Agent 产品 Muse 上线一周,目前仍排在美国 App Store 免费 App 总榜第二,仅次于 ChatGPT,高于 Google Gemini 和 Claude。 Muse 是一个可以长期工作的个人 Agent,能连接邮箱、日历等服务,自己浏览网页、拆解任务,并在用户关闭 App 后继续后台执行。