模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己
相关推荐
网传DeepSeek Harness本周开启内测,对标Claude Code
BlockBeats 消息,7 月 28 日,据 Max For AI 爆料,名为「Harness」的 DeepSeek 版 Claude Code 即将开始内测。社群疯传的内测招募截图显示,DeepSeek Harness 计划于本周晚些时候开启内测,首批用户将从小范围群聊中筛选。入选者需要提交个人资料、签署《保密承诺函》,并获得产品访问权限。 更值得注意的是,图里还明确提醒:一旦泄密,不仅会被取消资格,还会影响之后 DeepSeek 各类模型、产品内测以及合作机会的入选。如果消息属实,V4 正式版和 Harness 将很快公布。 动察 Beating 稍早前报道,DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。Harness 封闭测试结束后约 1 至 2 周会开放 V4,发布时间可能在 8 月 10 日至 20 日之间。如果消息属实,DeepSeek V4 上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
Spotify把Claude、Gemini和Codex塞进一个总控台,1300名工程师已在用
据动察 Beating 监测,Spotify 推出 AI 编程工具 Xirp。它把 Claude Code、Gemini CLI 和 Codex 接进同一个工作台,可以同时跑多个 Agent。中途换工具,项目上下文也能直接带过去。 Spotify 已经用 Xirp 跑了超过 3.6 万次 Agent 会话。官方称已有 1300 多名 Spotify 工程师使用。Xirp 可以同时协调 50 多个会话,每个任务单独放进一个 Git worktree,多个 Agent 能在同一代码库并行干活,互不干扰。 更核心的是「团队记忆」。接上 Spotify Portal 后,Agent 能直接读取服务架构、依赖关系、负责人和历史架构决策。一次会话积累的上下文也会存回 Portal,其他工程师或 Agent 可以接着做。 Xirp 更像一个 Coding Agent「总控台」。Spotify 不押注某一家模型,而是让 Claude、Gemini、Codex 随时可换。Spotify 此前已经把内部开发平台 Backstage 开源,又推出了商业版 Portal;现在 Xirp 再把多 Agent 调度接了进来。
日本要拿Fugu当「国产AI」进自卫队,结果指挥模型一直是Qwen
据动察 Beating 监测,日本政府正在考虑把 Sakana Fugu 用于自卫队指挥统制,《读卖新闻》甚至把它列为「国产 AI」的主要候选之一。防卫用途还要求排除中国 AI,相关开发人员也要满足日本的安全审查要求。 但这个「国产 AI」其实很微妙。Fugu 本身更像一套 AI 调度系统:一个小型指挥模型负责分配任务,真正干活的是后面的 GPT、Claude、Gemini 等闭源大模型。Sakana 今天还明确承认,过去这个指挥模型一直基于阿里的 Qwen 训练。 如果 Fugu 真要进入防卫用途,Qwen 这一层就得换掉。Sakana 已经先用谷歌 DeepMind 开源的 Gemma 4 E2B 重训指挥模型,性能基本没掉。下一步还准备换成从预训练开始就在日本完成的国产模型。 日本正在努力把 Fugu 的「司令塔」国产化,但真正提供前沿能力的模型依然还是来自美国。这个被当成「国产 AI」代表的系统,最后很可能变成:日本模型负责指挥,美国模型负责干活,中国模型不许进门。
OpenAI教用户给Claude Code换上GPT模型,误封后两边员工现场互损
据动察 Beating 监测,OpenAI 产品负责人 Tibo 此前公开教用户给 Claude Code「换脑」:保留 Claude Code 的 harness,把底层模型换成 GPT。 开发者 Alex Getman 照着配置后,Claude 账号很快被封。他公开求助 Tibo 和 Anthropic,询问这套用法到底是否违规。 Tibo 随即开始阴阳:「我很想帮你,可惜我不在 Anthropic 工作。」他还补了一句,因为把 Claude Code harness 配其他模型就封号,「确实挺奇怪」,并问还有没有其他人中招。 Claude Code 负责人 Boris Cherny 很快下场。他明确表示,Anthropic 不会因为 harness 搭配其他模型就封号,这次几乎肯定是其他风控误触发。账号随后恢复。 Boris 还顺手回敬 Tibo:「如果你想来 Anthropic,我们正在招人。」Tibo 则表示自己很喜欢现在的团队,而且接下来几周还有不少新产品要发,暂时哪也不去。 事情解决后,Tibo 又发帖庆祝,称 GPT-5.6 Sol 几乎哪里都能用,包括 Claude Code harness。为了庆祝这件事和自己「不跳槽」,他还直接重置了 ChatGPT Work 和 Codex 所有付费用户的使用额度。
DeepSeek版Claude Code即将上线,Harness将与V4正式版同步发布
据动察 Beating 监测,网友提供的群聊截图显示,DeepSeek Harness 团队计划把首款 Harness 产品与 V4 正式版一同发布。它是一款代码智能体产品,内部对标 Claude Code,负责让模型读写文件、调用工具、执行命令,并持续完成工程任务。 DeepSeek 此前宣布,V4 正式版计划于 7 月中旬上线,并同步启用峰谷定价。现在已是 7 月 20 日,原定时间窗口已经过去。如果计划没有再次调整,V4 和 Harness 都已进入发布倒计时。 DeepSeek 过去主要让开发者把 V4 接入 Claude Code、OpenCode 等第三方工具,这次终于要自己下场抢代码 Agent 的产品入口。
Claude防蒸馏或难以奏效:小模型能直接套出大模型思维链
据动察 Beating 监测,大模型厂商为了防止能力被蒸馏,会隐藏完整思维链,只给用户一份摘要。但最新研究发现,这层保护可能没有想象中牢固:把 Opus 的加密思维链交给同厂更弱的 Haiku,再越狱 Haiku,就能让它直接复述 Opus 的原始推理。研究者在 Claude、GPT 和 Gemini 上都跑通了。 这件事其实已经铺垫了几个月。5 月,密码学家 Matthew Green 发现这些加密思维链可以跨会话、跨账号重放,但当时还没找到稳定读取内容的方法。新论文把最后一步补上了:不用破解加密算法,直接让厂商自己的模型帮你「解密」。 更早的 3 月,现 Engram 联合创始人兼研究负责人 John X. Morris 等人还证明了另一条路:即使完全拿不到原始思维链,只看答案和推理摘要,也能反推出一套详细的合成推理,再用于训练小模型。 这也让此前流传的「国内 AI 公司早已找到办法获取 Claude、Codex 原始推理,再拿去训练模型」的说法,在技术上更说得通了。但这仍只能证明方法可行,不能证明任何国内 AI 实验室实际这么做过。 论文还测了 Kimi K3。只给它塞几个 Opus 的推理 Token,K3 后面的推理就会明显向 Opus 靠拢;部分 Claude、GPT 的原始推理片段,从 Kimi K3 中提取出来最高比其他模型容易约 6 个数量级,但作者明确说无法据此证明蒸馏。