马斯克给Grok Bot接Claude Opus 5.5:以后谁好用就用谁
相关推荐
xAI发布Grok 4.7:参数规模增至2.1万亿,基准测试仍落后Claude
动察 Beating AI 快讯,xAI 周一正式发布 Grok 4.7,官方称其在同等价格和速度下较 Grok 4.6 有「显著提升」。Grok 4.7 此前至少经历 5 次延期,目前已上线 Grok 应用、Cursor、Grok Build 及 xAI API。 Grok 4.7 参数规模达到 2.1 万亿,较 Grok 4.6 的 1.5 万亿增加 40%,输入和输出价格分别为每百万 Token 2 美元和 6 美元。xAI 还引入 SpaceX 补充训练数据,包括 Starlink 卫星遥测数据、制造记录和工程故障日志,旨在提升模型对硬件及物理系统的推理能力。 基准测试方面,Grok 4.7 在 GDPval 和 AA-Briefcase 中均排名第二,得分分别为 1695 和 1657,均落后 Claude Fable 5.1 的 1735 和 1678;在电气工程基准测试 EEBench 中则排名第二,仅次于 GPT-6 Astra。CursorBench 4.0 显示,Grok 4.7 的任务成本高于 GPT-6 Astra 和 Claude Sonnet 5,同时整体表现仍落后 Fable 5.1。 马斯克此前曾表示,Grok 4.7 的水平大致相当于 Claude Opus 5.0,但尚未达到更新版本 Opus 5.1 的水平,并透露 Grok 4.8、4.9 及 Grok 5 正在开发中。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
Grok Bot开始给整个团队打工:共享工具、记忆,还能进Slack
动察 Beating AI 快讯,SpaceXAI 给 Grok Bot 上线 Team Bots,把原本个人使用的 AI Agent 做成了整个团队可以共用的「AI 同事」。团队可以给它配置文件、工作流程、插件和 API 凭证,再直接分享给所有成员使用。目前已在 Teams 和 Enterprise 计划中开启公测。 同一个 Team Bot 可以掌握团队统一的业务知识,但每个人和它的私聊仍然相互隔离。团队成员可以分别找它干活,也可以把它拉进 Slack 频道,所有人一起提问、补充上下文和查看结果。它还能连接 Salesforce、Notion、GitHub 等工具,并保存工作中学到的团队知识。 SpaceXAI 已经在内部把它用在销售、工程、营销和数据分析。工程 Team Bot 会读取 Slack、Notion 和 Linear 的项目进展,自动创建工单,再调用 Cursor Cloud Agents 修复问题。SpaceXAI 称,开发 Team Bots 时,一个 5 人团队靠它协调数百个 Cloud Agents,每天可以提交超过 100 个 PR。 此前 Grok Bot 更像一个属于个人的长期 Agent,可以自己操作云端电脑并持续工作。Team Bots 补上的,是团队共享这一层:大家不用各自重新教一遍 AI,同一套流程、工具和业务知识可以长期放在一个 Bot 里。
AI网络安全榜爆冷:GPT-6、Claude旗舰因安全拒答掉队,小米MiMo追平Grok登顶
动察 Beating AI 快讯,Artificial Analysis 推出独立的 Cyber Index,专门评测 AI Agent 做企业网络防御的能力。它不是从原来的通用 Intelligence Index 里抽几项测试,而是另外采用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项网络安全评测,分别测试漏洞审计与修补、漏洞发现,以及从发现漏洞到复现并修补的完整流程,三项各占三分之一。 首批榜单中,Grok 4.7(xhigh)和小米 MiMo-V2.6-Pro 同为 56 分,GPT-6 Luna(max)53 分,GLM-5.3-Flash 50 分。MiMo 平均每个任务成本只有 0.18 美元,Grok 4.7 要 11.67 美元;Luna 更低,只要 0.12 美元。 不过,这张榜不能简单理解成模型本身的网络安全能力排名。GPT-6 Sol、GPT-6 Astra 和 Claude Opus 5.5 都参加了测试,但在 CyberGym-E2E-AA 上几乎全部拒答,其中 Sol 和 Astra 拒绝全部任务,Opus 5.5 拒绝 98%。拒答直接记 0 分,Luna 反而愿意继续完成这些任务,所以综合成绩更高。Artificial Analysis 也表示,大量拒答让这些前沿模型的实际能力很难判断。 GLM-5.3 也出现了明显反常。完整版在 Artificial Analysis 的通用能力榜上高于 Flash,但这次 Cyber Index 只有 36 分,Flash 达到 50 分。主要差距来自 CyberGym-E2E-AA:Flash 得到 74%,完整版只有 29%。Artificial Analysis 暂未解释这一差距的原因。
Claude、Grok、ChatGPT出现宕机或访问异常
动察 Beating AI 快讯,多家 AI 服务出现宕机/访问异常,包括: Claude:Claude 4.6/4.8/5/5.1 系列错误率均在上升。 Grok:Grok for Android 存在异常,grok api 服务在美东 1 区出现异常。 ChatGPT:网页版异常,部分用户客户端异常,未登录时登录可能出问题。
Claude创业扶持放宽:自筹团队也能拿API额度
动察 Beating AI 快讯,Anthropic 扩大 Claude Startups 创业扶持计划。旧版规则允许早期创业团队加入项目,但想拿 API 额度和额外福利,必须已经获得机构股权投资。现在公司成立不超过 5 年,或最近 2 年获得过融资即可申请。Anthropic 明确写明,自筹资金、Pre-seed 阶段和已获风投的创业公司都在范围内。 获批公司可免费使用 1 年 Claude Team,最多 5 个 Premium 席位。每家公司另有 1000 美元 Claude API 额度,有效期 6 个月。Team 免费资格只面向此前没有订阅过 Team 的公司。 Anthropic 还上线 Claude Startup Stack。Linear、Lovable、ElevenLabs、Granola、Hex 等公司会提供折扣和额度,标称总价值最高 4.5 万美元。成员还能预约 Anthropic Applied AI 团队做一对一技术答疑,并获得构建 Claude Marketplace 连接器和插件、提交审核等方面的协助。 这批额外福利的条款里还有一项容易被忽略的规定。创业公司如果在 Anthropic Applied AI 的咨询中透露产品架构等机密信息,Anthropic 可以继续使用员工仅凭记忆留下的一般性想法、经验和技术。条款还明确,不会限制 Anthropic 独立开发类似或竞争性技术,但不得直接披露这些机密信息,也没有获得相关专利或版权许可。