Grok Build被曝上传整个代码库,密钥和Git历史都可能被偷走
相关推荐
xAI发布Grok 4.7:参数规模增至2.1万亿,基准测试仍落后Claude
动察 Beating AI 快讯,xAI 周一正式发布 Grok 4.7,官方称其在同等价格和速度下较 Grok 4.6 有「显著提升」。Grok 4.7 此前至少经历 5 次延期,目前已上线 Grok 应用、Cursor、Grok Build 及 xAI API。 Grok 4.7 参数规模达到 2.1 万亿,较 Grok 4.6 的 1.5 万亿增加 40%,输入和输出价格分别为每百万 Token 2 美元和 6 美元。xAI 还引入 SpaceX 补充训练数据,包括 Starlink 卫星遥测数据、制造记录和工程故障日志,旨在提升模型对硬件及物理系统的推理能力。 基准测试方面,Grok 4.7 在 GDPval 和 AA-Briefcase 中均排名第二,得分分别为 1695 和 1657,均落后 Claude Fable 5.1 的 1735 和 1678;在电气工程基准测试 EEBench 中则排名第二,仅次于 GPT-6 Astra。CursorBench 4.0 显示,Grok 4.7 的任务成本高于 GPT-6 Astra 和 Claude Sonnet 5,同时整体表现仍落后 Fable 5.1。 马斯克此前曾表示,Grok 4.7 的水平大致相当于 Claude Opus 5.0,但尚未达到更新版本 Opus 5.1 的水平,并透露 Grok 4.8、4.9 及 Grok 5 正在开发中。
SpaceXAI要收拾订阅乱局,Grok和Cursor几周内统一套餐
动察 Beating AI 快讯,SpaceXAI 产品负责人 Maxime Prades 确认,公司正在统一 Grok 和 Cursor 的订阅方案,预计几周内准备好。 一名用户此前吐槽现有套餐太乱,建议只保留 X 和 Cursor 两套订阅,让 X Premium+ 包含 Cursor Pro,并停掉 Grok Build。Prades 没有确认这些具体建议,只说新方案已经在做,还邀请这名用户提前看方案给反馈。 现在的体系确实很绕。Cursor Pro、Pro+、Ultra 都带 Grok Bot;SuperGrok 和 X Premium+ 也能给 Cursor 账户开 Grok Bot。但两边的 Grok Bot 用量不会叠加,订阅仍然各自续费。Cursor 社区最近也反复有人问 SuperGrok Heavy 和 Cursor Ultra 到底该买哪个、额度是否共享。
Grok Bot开始给整个团队打工:共享工具、记忆,还能进Slack
动察 Beating AI 快讯,SpaceXAI 给 Grok Bot 上线 Team Bots,把原本个人使用的 AI Agent 做成了整个团队可以共用的「AI 同事」。团队可以给它配置文件、工作流程、插件和 API 凭证,再直接分享给所有成员使用。目前已在 Teams 和 Enterprise 计划中开启公测。 同一个 Team Bot 可以掌握团队统一的业务知识,但每个人和它的私聊仍然相互隔离。团队成员可以分别找它干活,也可以把它拉进 Slack 频道,所有人一起提问、补充上下文和查看结果。它还能连接 Salesforce、Notion、GitHub 等工具,并保存工作中学到的团队知识。 SpaceXAI 已经在内部把它用在销售、工程、营销和数据分析。工程 Team Bot 会读取 Slack、Notion 和 Linear 的项目进展,自动创建工单,再调用 Cursor Cloud Agents 修复问题。SpaceXAI 称,开发 Team Bots 时,一个 5 人团队靠它协调数百个 Cloud Agents,每天可以提交超过 100 个 PR。 此前 Grok Bot 更像一个属于个人的长期 Agent,可以自己操作云端电脑并持续工作。Team Bots 补上的,是团队共享这一层:大家不用各自重新教一遍 AI,同一套流程、工具和业务知识可以长期放在一个 Bot 里。
Cloudflare重做CLI给AI用:Agent已占48%使用量
动察 Beating AI 快讯,Cloudflare 大幅补全了今年 4 月推出的 `cf` CLI。它从最初只支持少量产品,扩展到 Cloudflare 全部 3000 多个 API 操作,并准备接替现有的 Wrangler。相比之下,Wrangler 目前只有约 280 个命令路径。 `cf` 很多设计都直接面向 Coding Agent。命令结果默认返回 JSON,Claude Code、Codex 等 Agent 可以直接读取。新增的 `cf cli search` 还能让 Agent 用自然语言描述想做的事,再自动找到对应命令,不需要提前知道 Cloudflare 有哪些 API。 Cloudflare 也披露,Agent 已经快占到 Wrangler 使用量的一半。今年 3 月这一比例约为 25%,最近一周升到 48%。Agent 平均使用的不同命令接近人类的两倍,执行 6 个以上命令的可能性接近人类的 4 倍。 配置方式也一起改了。`cf` 改用 TypeScript 格式的 `cloudflare.config.ts`,Agent 可以直接利用类型检查和代码补全发现配置错误。现有项目可以通过 `cf migrate` 迁移,但部分依赖 Wrangler 构建流程的 JavaScript 项目,以及 Rust、Python Workers,目前仍会交给 Wrangler 处理。 Cloudflare 计划在 `cf` 稳定后发布 Wrangler 最后一个主要版本,随后继续维护 18 个月。
Grok Build也有长期记忆了,/dream自动整理每轮项目经验
动察 Beating AI 快讯,Grok Build 上线自动长期记忆。每轮任务结束后,它会在后台记下值得长期保留的项目约定、决定和事实,下次打开同一项目时直接接着用,不用用户重新解释。 这些记忆都以 Markdown 保存。/memory 可以直接查看,/dream 会把近期零散笔记合并成测试、代码风格等不同主题,而且系统也会定期自动执行。 这套思路并不新。Claude Code 今年 2 月就已经加入 Auto Memory,同样会自动记录项目知识,并整理成 MEMORY.md 和主题文件,/memory 也能查看管理。Codex 此后也加入了自动提取和整理历史记忆的机制。
个人Agent也有实战榜了:Muse暂列第一,领先Instinct和Grok Bot
动察 Beating AI 快讯,独立评测项目 Assistant Benchmark 开始用真实任务横评个人 AI 助手。它直接让 Agent 订酒店、选餐厅、买东西、回邮件、连接第三方服务,再按实际完成情况打分。每个评分维度都有一个公开的固定任务,并要求有真实运行记录才给分。 目前 Muse 在已经完成的 7 个评分维度中平均 9.1 分,暂列第一;Instinct 测完 11 个维度,平均 8.4 分;Grok Bot 测完 7 个维度,平均 7.3 分。Muse 在购物、邮件和第三方应用连接上都拿到 10 分。 不过这更适合看成一份持续更新的真实体验榜。Muse 的 9.1 目前只是已测 7 个维度的平均分,并不是完整成绩。每个维度目前也只用一个固定任务测试,后续补测后分数和排名都可能变化。