返回 7*24 快讯
来源MarsBit

Claude防蒸馏或难以奏效:小模型能直接套出大模型思维链

据动察 Beating 监测,大模型厂商为了防止能力被蒸馏,会隐藏完整思维链,只给用户一份摘要。但最新研究发现,这层保护可能没有想象中牢固:把 Opus 的加密思维链交给同厂更弱的 Haiku,再越狱 Haiku,就能让它直接复述 Opus 的原始推理。研究者在 Claude、GPT 和 Gemini 上都跑通了。 这件事其实已经铺垫了几个月。5 月,密码学家 Matthew Green 发现这些加密思维链可以跨会话、跨账号重放,但当时还没找到稳定读取内容的方法。新论文把最后一步补上了:不用破解加密算法,直接让厂商自己的模型帮你「解密」。 更早的 3 月,现 Engram 联合创始人兼研究负责人 John X. Morris 等人还证明了另一条路:即使完全拿不到原始思维链,只看答案和推理摘要,也能反推出一套详细的合成推理,再用于训练小模型。 这也让此前流传的「国内 AI 公司早已找到办法获取 Claude、Codex 原始推理,再拿去训练模型」的说法,在技术上更说得通了。但这仍只能证明方法可行,不能证明任何国内 AI 实验室实际这么做过。 论文还测了 Kimi K3。只给它塞几个 Opus 的推理 Token,K3 后面的推理就会明显向 Opus 靠拢;部分 Claude、GPT 的原始推理片段,从 Kimi K3 中提取出来最高比其他模型容易约 6 个数量级,但作者明确说无法据此证明蒸馏。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

07-05 12:25

传GPT-5.6下周开放,Gemini 3.5 Pro押后携2M上下文上线

据动察 Beating 监测,科技博主 leo 爆料称,OpenAI 可能在 7 月 7 日至 9 日对公众开放 GPT-5.6,最早时间指向 7 月 7 日。新模型套餐额度会更宽松,OpenAI 也在上线前加强安全策略。 Google DeepMind 的 Gemini 3.5 Pro 被传暂定 7 月 17 日上线。另一博主 Astro Polo 称,Gemini 3.5 Pro 将支持 200 万 token 上下文窗口,比 Claude Sonnet 5、Claude Opus 4.8、Claude Fable 5 当前的 100 万 token 上下文高出一倍,更适合处理长代码库、大文档和长对话。

07-30 19:39

最会卖货也最不对齐:Claude Opus 5登顶售货机AI评测,却屡屡串通、威胁、撕毁协议

据 动察 Beating 监测,AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。 在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。 Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。 Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。

07-24 13:34

Claude语音接入Opus和Sonnet:开口就能改日程、写邮件

据动察 Beating 监测,Anthropic 升级 Claude 语音模式。付费用户现在可以选择 Opus、Sonnet 和 Haiku,不再只能使用速度更快、能力较弱的 Haiku。 用户可在对话中切换模型,也能随时改用文字。Claude 默认沿用上一次文字聊天选择的模型,并调用该系列速度最快的版本。 语音模式还能调用 Gmail、Google Calendar、Google Docs 和 Slack。用户可以让 Claude 查邮件、改日程或起草回复,执行前仍会请求授权。 新版本已在手机、桌面端和网页端开放测试。免费用户只能使用 Haiku 和一个连接工具。语音现支持英语、日语、韩语等多种语言,暂不含中文。 这次主要升级模型推理和工具调用能力。Anthropic 没有更换语音模型,因此说话自然度和打断体验未必明显变化。

08-11 17:03

Spotify把Claude、Gemini和Codex塞进一个总控台,1300名工程师已在用

据动察 Beating 监测,Spotify 推出 AI 编程工具 Xirp。它把 Claude Code、Gemini CLI 和 Codex 接进同一个工作台,可以同时跑多个 Agent。中途换工具,项目上下文也能直接带过去。 Spotify 已经用 Xirp 跑了超过 3.6 万次 Agent 会话。官方称已有 1300 多名 Spotify 工程师使用。Xirp 可以同时协调 50 多个会话,每个任务单独放进一个 Git worktree,多个 Agent 能在同一代码库并行干活,互不干扰。 更核心的是「团队记忆」。接上 Spotify Portal 后,Agent 能直接读取服务架构、依赖关系、负责人和历史架构决策。一次会话积累的上下文也会存回 Portal,其他工程师或 Agent 可以接着做。 Xirp 更像一个 Coding Agent「总控台」。Spotify 不押注某一家模型,而是让 Claude、Gemini、Codex 随时可换。Spotify 此前已经把内部开发平台 Backstage 开源,又推出了商业版 Portal;现在 Xirp 再把多 Agent 调度接了进来。

08-09 11:04

OpenAI教用户给Claude Code换上GPT模型,误封后两边员工现场互损

据动察 Beating 监测,OpenAI 产品负责人 Tibo 此前公开教用户给 Claude Code「换脑」:保留 Claude Code 的 harness,把底层模型换成 GPT。 开发者 Alex Getman 照着配置后,Claude 账号很快被封。他公开求助 Tibo 和 Anthropic,询问这套用法到底是否违规。 Tibo 随即开始阴阳:「我很想帮你,可惜我不在 Anthropic 工作。」他还补了一句,因为把 Claude Code harness 配其他模型就封号,「确实挺奇怪」,并问还有没有其他人中招。 Claude Code 负责人 Boris Cherny 很快下场。他明确表示,Anthropic 不会因为 harness 搭配其他模型就封号,这次几乎肯定是其他风控误触发。账号随后恢复。 Boris 还顺手回敬 Tibo:「如果你想来 Anthropic,我们正在招人。」Tibo 则表示自己很喜欢现在的团队,而且接下来几周还有不少新产品要发,暂时哪也不去。 事情解决后,Tibo 又发帖庆祝,称 GPT-5.6 Sol 几乎哪里都能用,包括 Claude Code harness。为了庆祝这件事和自己「不跳槽」,他还直接重置了 ChatGPT Work 和 Codex 所有付费用户的使用额度。

07-27 15:06

Claude Code提示词砍八成?Opus 5又加回72%

据动察 Beating 监测,Claude Code 团队成员 Thariq 发文称,团队删掉了超过 80% 的系统提示词,编程成绩没有下降。系统提示词就是 Claude Code 每次调用模型前,预先塞给它的规则和环境说明。 Qoder 工程师陈成随后抓取了 Claude Code 实际发出的请求。他发现,大幅精简发生在 Opus 4.8,并非 Opus 5。Opus 4.7 的系统提示词约有 15225 个字符,4.8 降到 4467 个,Opus 5 又增至 7694 个,比 4.8 长了 72%。 「砍掉八成」本身没有错。Claude Code 确实把几大段行为规则从 12443 个字符压到 2308 个,减少约 81%。过去那些「不要乱写注释」「不要创建多余文档」的细则,大多被一句「参照现有代码风格」取代。 但 Opus 5 上线后,Claude Code 又为它加了两段专属规则,主要约束它反复解释错误和频繁汇报进度。Fable 5 也有单独的用户沟通规则。 所以,Claude Code 确实删掉了大批通用规则,但新模型出现新毛病后,仍会继续补上专用规则。