Anthropic训练AI查AI:不给正常案例,误报率直接冲到97%
相关推荐
Anthropic IPO最大隐忧浮现:模型越卖越便宜
动察 Beating AI 快讯,OpenAI CFO Sarah Friar 表示,GPT-5.6 Luna 在 7 月底降价 80% 后,使用量增长了 10 倍。Luna 目前 API 价格仅为每百万 Token 输入 0.20 美元、输出 1.20 美元。 8 月中旬,Luna 在 OpenRouter 上的 Token 使用量已经超过 Anthropic Opus 5 和 Sonnet 5 总和的两倍。不过这里不全是官方降价的功劳。OpenAI 当时还通过 OpenRouter 给 Luna 和 Terra 额外打了 5 折,Luna 实际价格一度只有原来的约 1/10。 Anthropic 已经开始压低使用成本。新发布的 Fable 5.1 输入、输出基础价格没有下降,但缓存读取费直接砍掉 75%。Anthropic 估算,普通工作负载账单可降低约 25%,大量使用 Agent 的任务最高降低约 45%。 价格战正好撞上 Anthropic 准备 IPO。公司 7 月底年化收入运行率已经超过 650 亿美元,招股书预计本月公开。模型能力越来越接近后,如果开发者开始更频繁地按价格切换模型,Anthropic 能否继续靠高端模型收取溢价,会成为投资者必须重新计算的一笔账。
Anthropic给Claude思考链上锁:改一句上下文就作废,专堵模型蒸馏
动察 Beating AI 快讯,Anthropic 开始给 Claude 的隐藏思考加「上下文锁」。Fable 5.1 通过 API 生成的加密思考,以后必须和生成它时的系统提示、工具和历史消息一起原样传回来。前面的内容只要被改过,API 就会报错,或者直接丢掉这段思考。 这项改动就是为了防模型蒸馏。此前研究人员发现,Claude 的加密思考虽然用户自己看不懂,却可以重新交给 Anthropic 的兼容模型读取。攻击者可以先让 Opus 产生高质量推理,再把加密块塞给防护更弱的 Haiku,诱导它把 Opus 的完整思考念出来。相当于不只抄大模型的答案,连草稿纸上的解题过程也一起拿走。 Anthropic 6 月发布 Fable 5 时就堵过一轮,开始把加密思考绑定模型,不能再拿给 Haiku 这类小模型帮忙解密。Fable 5.1 这次又加上「对话绑定」:模型不换,只要改了前面的提示词、工具或聊天记录,旧思考同样作废。 以前防的是「换模型偷思考」,现在连「换上下文套思考」也一起堵了。
Shopify CEO向Anthropic施压:若Claude Code拒绝支持AGENTS.md,或考虑内部禁用
动察 Beating AI 快讯,Shopify CEO Tobi Lütke 公开表示,如果 Claude Code 继续拒绝读取 AGENTS.md 及.agents/skills,他正在考虑在 Shopify 内部禁用 Claude Code。 Tobi 指出,随着 Codex、Cursor、Claude Code 等 AI 编程工具被企业团队同时使用,越来越多 Coding Agent 开始支持通过统一的 AGENTS.md 配置项目规范、测试流程及 Agent 指令。但 Claude Code 目前主要依赖 CLAUDE.md 和.claude/skills,可能导致同一代码仓库被不同 Agent 读取到不同规则,形成所谓的「脑裂」(split brain)。 他认为,对于个人开发者而言维护多套配置文件影响有限,但对于 Shopify 这类拥有大量工程师的企业,多套 Agent Context 需要持续同步,一旦出现差异,就可能导致 Agent 执行行为偏离团队规范。 此次争议表面上是配置文件格式之争,背后则涉及 AI Coding Agent 进入企业后,项目规范、Skills 和 Context 究竟应采用厂商专属标准,还是形成跨 Agent 通用标准的问题。
DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2
火星财经消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。
AI灭绝论刷屏后,Anthropic给外部审查员开到接近员工级权限
动察 Beating AI 快讯,Anthropic 前研究员 Jacob Coxon 的辞职帖三天多冲到 1.6 亿浏览,AI 灭绝风险这周迅速冲进美国主流舆论场。OpenAI 首席科学家 Jakub Pachocki 此前已经呼吁同行必要时协调减速;Coxon 爆火后,Sam Altman 又在内部表示愿意和其他实验室一起放慢研发,OpenAI 也开始推动强制性的全国 AI 安全监管。 现在 Anthropic 也拿出了具体动作。公司承诺让第三方安全团队长期驻场,给他们工位、门禁、公司电脑,以及接近内部风险评估团队的工具和权限。他们可以检查训练流程、安全措施和事故,还能独立对外发布结论。Anthropic 可以删掉涉及安全、法律和客户隐私的信息,但不能因为结论难看就删。Anthropic CEO Dario 称,这种做法比目前任何 AI 公司都走得更远。 Dario 对「减速」的态度也变了。他说,2023 年业界讨论暂停 AI 时,自己还觉得没什么意义。现在 AI 已经越来越多参与下一代 AI 的研发,能力进步开始加速,他认为光做安全研究已经不够,模型能力本身也该慢下来。 他还点名 OpenAI 的 Hugging Face 失控事件,警告照现在的速度再过 6 到 12 个月,类似的 Agent 群可能已经有能力建立覆盖大范围互联网系统的僵尸网络,造成数千亿美元损失。下一步,他希望美国等民主国家的头部 AI 公司统一安全标准和研发速度,再尝试和中国协调全球 AI 发展速度。不过先进芯片和模型蒸馏仍要继续限制,让美国在减速时保持领先。
Anthropic称Kimi曾拿Claude代答:10天近30万条请求
动察 Beating AI 快讯,Anthropic 发布最新 AI 滥用调查报告,称月之暗面曾把部分 Kimi 用户请求直接转给 Claude,再把 Claude 的回答展示给用户。Anthropic 称,在一个 10 天窗口内,近 30 万条用户请求被这样转发,绝大多数进入 Opus。月之暗面为此使用了 5,380 个违规账号。这些用户当时以为自己仍在使用 Kimi。 Anthropic 还称,月之暗面会保存部分交互,并通过「跨会话重放」提取 Claude 的完整推理过程,用来训练自家模型。5 月至 7 月,相关蒸馏交互超过 2300 万次。 部分真实用户请求里还带着企业内部代码和有效凭证,也一起被转给了 Claude。Anthropic 表示,它不知道这些用户是否被告知数据会流向第三方。 这些说法目前主要来自 Anthropic 单方调查,尚未得到独立验证。针对美国三家机构此前提出的类似蒸馏指控,中国商务部回应称相关说法「于事无凭,于法无据」,并称蒸馏是业内通行技术。