返回 7*24 快讯
来源MarsBit

Claude Code提示词砍八成?Opus 5又加回72%

据动察 Beating 监测,Claude Code 团队成员 Thariq 发文称,团队删掉了超过 80% 的系统提示词,编程成绩没有下降。系统提示词就是 Claude Code 每次调用模型前,预先塞给它的规则和环境说明。 Qoder 工程师陈成随后抓取了 Claude Code 实际发出的请求。他发现,大幅精简发生在 Opus 4.8,并非 Opus 5。Opus 4.7 的系统提示词约有 15225 个字符,4.8 降到 4467 个,Opus 5 又增至 7694 个,比 4.8 长了 72%。 「砍掉八成」本身没有错。Claude Code 确实把几大段行为规则从 12443 个字符压到 2308 个,减少约 81%。过去那些「不要乱写注释」「不要创建多余文档」的细则,大多被一句「参照现有代码风格」取代。 但 Opus 5 上线后,Claude Code 又为它加了两段专属规则,主要约束它反复解释错误和频繁汇报进度。Fable 5 也有单独的用户沟通规则。 所以,Claude Code 确实删掉了大批通用规则,但新模型出现新毛病后,仍会继续补上专用规则。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

07-29 18:04

阿里Qoder开源AI编程体检工具,Claude Code和Codex也能用

据动察 Beating 监测,阿里云旗下 AI 编程工具 Qoder 开源 Better Harness,并采用 MIT 许可证。它会检查一个代码项目有没有给 Coding Agent 准备好规则、工具和验证流程。 检查范围包括代码仓库、Agent 配置和真实任务记录。它会看项目能否正常启动,测试命令是否清楚,Agent 有没有权限限制,改完代码后是否真的跑了相关测试。 检查结束后,它会列出 Agent 容易出错的环节。每个问题都有证据、影响、修复范围和复验方法。用户可以直接让 Agent 修改,再重新检查。 Better Harness 已支持 Qoder、Claude Code、Codex、Cursor 和 Qwen Code。各平台能力还没有完全拉齐,Qoder 当前最完整。 Qoder 还用它检查了 Better Harness 自己的代码仓库,最终得到 58 分。这也说明它仍处于早期阶段,开源后还在快速修补问题。

07-15 14:30

传Claude Opus5最快本周发布,填补Fable5退场空档

据动察 Beating 监测,爆料账号 leo 称,Anthropic 正在为 Claude Opus 5 做最后准备。模型最快本周发布,也可能推迟到下周。其能力预计接近 Fable 5,但运行成本更低。 Anthropic 已把 Fable 5 的订阅内使用期延长至 7 月 19 日,但暂不准备再次延期。

06-25 09:21

Claude Code更新泄露Fable 5将以每周配额模式回归

据动察 Beating 监测,爆料人 @synthwavedd 在对 Anthropic 命令行 AI 助手 Claude Code 的最新版本 v2.1.190 进行反编译和代码分析时发现,更新包中包含多处暗示最强前沿模型 Claude Fable 5 准备回归的状态提示语。 与之前 v2.1.186 版本将 Fable 5 完全归为单独购买额度(usage credits)的方案不同,最新代码移除了有关限时包含的说明,并引入了每周配额模型(weekly allotment model)。最新加入的代码显示,当用户达到额度上限时,客户端将提示「本周已用完包含的 Fable 5 使用额度」,并提示运行 /usage-credits 以继续使用。 Fable 5 曾在今年 6 月初作为 Anthropic 的「神话级」(Mythos-class)前沿模型短暂发布,但随后由于美国政府的出口安全限制以及国家安全顾虑被全球停用。分析认为,Claude Code 的底层状态更新意味着 Anthropic 正在做技术准备,一旦政策许可或授权获批,便可通过绑定订阅与每周限额的组合机制,迅速重新向全球用户开放这一顶级推理模型。

06-22 10:50

字节Seed 2.1 Pro预览版亮相:冲进Code Arena前端前八,直追Claude Opus 4.6

据动察 Beating 监测,基准测试平台 Arena.ai 官方公布了字节跳动尚未公开的新模型 Seed 2.1 Pro Preview 的评测成绩。在专门评估 AI 构建真实网页应用与多文件协同修改能力的 Code Arena: Frontend 基准测试中,该模型以 1539 分的成绩位列全球第 8 名,与 Anthropic 的旗舰模型 Claude Opus 4.6 表现相当。 该模型在 React 开发和前端 UI 交互设计上展现出极强实力,在 7 个子类别中有 5 个冲进全球前 10(包括 React 排名第 7、HTML 排名第 14、品牌与营销排名第 6、内容创作工具与数据分析排名第 9、基于参考的设计与消费产品排名第 10)。在这些强项中,排名领先于它的只有极少数头部模型,如 Anthropic 的 Claude 系列以及智谱 AI 刚刚开源的 GLM-5.2。 官方透露,Seed 2.1 Pro 将在未来几周内正式对公众发布。这也是继今年 2 月中旬推出 Seed 2.0 Pro 之后,字节跳动在代码生成和智能体构建领域的最新进展。

08-10 11:59重要

Claude Code之父:720次提示词注入攻击0成功,一年前想都不敢想

据动察 Beating 监测,Claude Code 负责人 Boris Cherny 称,Anthropic 已经「在实际使用中基本解决」提示词注入攻击。一年前,他自己都没想到能做到这个程度。 提示词注入攻击一直是 Agent 的大麻烦。恶意网页可以藏一段指令,诱导 Agent 偷密码、上传密钥,甚至执行用户根本没要求的操作。 Anthropic 现在靠三层防护来拦:Claude 本身先抵抗恶意指令,外部内容进入上下文前再检测一次,真正执行操作前,Auto Mode 还会再审一次。 第三方测试用了 72 种此前没见过的攻击,重复 720 次。Sonnet 5、Fable 5 和 Opus 5 开启 Auto Mode 后,一次都没成功。 同一测试中,GPT-5.6 Sol 使用 Codex Auto-review 的攻击成功率为 5.83%,Full Access 则达到 19.03%。 这也解释了 Anthropic 为什么敢把 Auto Mode 设成默认。它是 Claude Code 防提示词注入攻击的最后一道检查。

07-25 09:26

Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%

据动察 Beating 监测,第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。 Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。 模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。 短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。