Claude Code提示词砍八成?Opus 5又加回72%
相关推荐
Claude Code之父:720次提示词注入攻击0成功,一年前想都不敢想
据动察 Beating 监测,Claude Code 负责人 Boris Cherny 称,Anthropic 已经「在实际使用中基本解决」提示词注入攻击。一年前,他自己都没想到能做到这个程度。 提示词注入攻击一直是 Agent 的大麻烦。恶意网页可以藏一段指令,诱导 Agent 偷密码、上传密钥,甚至执行用户根本没要求的操作。 Anthropic 现在靠三层防护来拦:Claude 本身先抵抗恶意指令,外部内容进入上下文前再检测一次,真正执行操作前,Auto Mode 还会再审一次。 第三方测试用了 72 种此前没见过的攻击,重复 720 次。Sonnet 5、Fable 5 和 Opus 5 开启 Auto Mode 后,一次都没成功。 同一测试中,GPT-5.6 Sol 使用 Codex Auto-review 的攻击成功率为 5.83%,Full Access 则达到 19.03%。 这也解释了 Anthropic 为什么敢把 Auto Mode 设成默认。它是 Claude Code 防提示词注入攻击的最后一道检查。
20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。
马斯克给Grok Bot接Claude Opus 5.5:以后谁好用就用谁
动察 Beating AI 快讯,马斯克宣布,Grok Bot 接下来会按任务选择最合适的后端模型或 API。他直接点名 Claude Opus 5.5、Midjourney 和 Suno,还会使用其他主流 AI 模型和 API。用他的话说,哪个最可能给出最好的结果,就用哪个。 Grok Bot 是 SpaceXAI 推出的常驻 AI Agent。每个 Bot 都有自己的云电脑,可以登录网页和应用,持续处理邮件、表格、客服和编程等任务。SpaceXAI 此前还专门让 Grok 4.7 学会理解 Grok Bot 的运行框架。 现在马斯克明确把这套 Agent 推向多模型路线。Grok Bot 可以根据任务调用 Claude Opus 5.5、Midjourney、Suno 等外部模型和 API。它更像负责拆任务、调模型和执行工作的上层 Agent,底下不再只依赖 Grok。
AI订阅大摸底:Claude补贴比国产Coding Plan还狠
动察 Beating AI 快讯,SemiAnalysis 把 OpenAI、Anthropic、Meta、SpaceXAI、MiniMax、月之暗面、智谱、Cursor 和 Cognition 的 AI 订阅套餐逐个测了一遍。它分别测试输入、缓存写入、缓存读取和输出会消耗多少订阅额度,再按自己 9 月的 Agent 使用结构计算,其中约 96.6% 是缓存读取。最后再套用各家的 API 标价,看同样一批 token 如果直接走 API,需要花多少钱。SemiAnalysis 将这个数字称为「API 等价价值」。 Claude 的 Sonnet 和 Opus 补贴最狠。同样每月 200 美元的 Max 20x,使用 Sonnet 5.5 最多可跑出约 12,529 美元的 API 用量,相当于月费的 62.6 倍;Opus 5.5 约为 11,726 美元,相当于 58.6 倍。换成更贵的旗舰模型 Fable 5.1,却只剩 2,485 美元,也就是 12.4 倍。同一个套餐能差近 5 倍,因为不同模型和不同类型的 token,扣掉后台额度的速度并不一样。Anthropic 给 Sonnet 和 Opus 留了大量额度,对 Fable 则明显收紧。 国产 Coding Plan 同样大量补贴重度用户,但力度仍追不上 Claude。SemiAnalysis 测得,132 美元的 MiniMax Token Ultra 可折算约 3,088 美元 MiniMax-M3 API 用量,相当于月费的 23.4 倍;168 美元的智谱 GLM Coding Max 约为 11.6 倍;199 美元的 Kimi Code Ultra 约为 6.7 倍。即使是其中最高的 MiniMax,每美元折算价值也只有 Claude Sonnet、Opus 的四成左右。 OpenAI 最近反而开始主动收紧补贴。新购 Pro 200 的各档模型 token 额度被直接减半,此前购买的套餐可暂时保留旧额度到 10 月 29 日。现在 200 美元 ChatGPT Pro 使用 GPT-6.1 Sol,折算价值约 2,084 美元,相当于月费的 10.4 倍;同价 Claude Opus 是它的 5.6 倍。即使撇开两款模型 API 单价的差异,只算实际 token,两者也是约 286 亿对 102 亿,Claude 仍多 2.8 倍。 但到
Claude Code开始拆自己:Function Hooks正式上线为Mods
动察 Beating AI 快讯,Anthropic 正式上线 Claude Code Mods。它就是此前预览的 Function Hooks,正式产品名现在定为 Mods。底层仍使用 Function Hooks,一个 Mod 本质上就是能直接修改 Claude Code 的插件。 Mods 可以改 Claude Code 的行为和界面。它能在 prompt 发给模型前改写内容,也能拦截、修改或重试工具调用,处理权限请求,甚至替换部分界面。用户还可以直接让 Claude 写 Mod、安装并立即加载。 Anthropic 也开始把 Claude Code 自带功能拆成 Mods。/diff 已经率先迁移,用户可以关闭它,也可以换成自己的版本。官方计划继续迁移更多内置功能,让 Claude Code 最后只保留一个更小的核心。Mods 仍通过现有 Plugin 安装和分享,CLI 和桌面端都能使用。 不过,Mods 没有沙箱隔离,拥有和 Claude Code 本身相同的本机权限。Anthropic 建议只安装可信来源的 Mod。
MiniMax把OpenAI新Agents API做成开源版,Codex、Claude Code都能接
动察 Beating AI 快讯,MiniMax 开源 OpenAgentCore,做了一套兼容 OpenAI Agents API 的自托管实现。开发者可以继续使用 OpenAI 官方 SDK,只需要换掉 API 地址,后台运行的 Agent 可以选择 Codex、Claude Code 或 MiniMax Code。 Agents API 可以理解成一套「调用 Agent 的统一接口」。普通模型 API 主要负责一问一答。Agent 要连续干几个小时甚至几天,还要管理上下文、调用工具、协调子 Agent、保存任务进度。OpenAI 的 Agents API 把这些能力放到一个长期运行的 Session 里统一管理。 OpenAI 官方版本使用 OpenAI 托管的 Codex 执行框架。开发者可以自己选择代码在哪运行,但 Agent 的任务编排、上下文管理和运行状态仍由 OpenAI 负责。OpenAgentCore 则把这套后端也交给开发者自己部署。