返回 7*24 快讯
来源MarsBit

日本要拿Fugu当「国产AI」进自卫队,结果指挥模型一直是Qwen

据动察 Beating 监测,日本政府正在考虑把 Sakana Fugu 用于自卫队指挥统制,《读卖新闻》甚至把它列为「国产 AI」的主要候选之一。防卫用途还要求排除中国 AI,相关开发人员也要满足日本的安全审查要求。 但这个「国产 AI」其实很微妙。Fugu 本身更像一套 AI 调度系统:一个小型指挥模型负责分配任务,真正干活的是后面的 GPT、Claude、Gemini 等闭源大模型。Sakana 今天还明确承认,过去这个指挥模型一直基于阿里的 Qwen 训练。 如果 Fugu 真要进入防卫用途,Qwen 这一层就得换掉。Sakana 已经先用谷歌 DeepMind 开源的 Gemma 4 E2B 重训指挥模型,性能基本没掉。下一步还准备换成从预训练开始就在日本完成的国产模型。 日本正在努力把 Fugu 的「司令塔」国产化,但真正提供前沿能力的模型依然还是来自美国。这个被当成「国产 AI」代表的系统,最后很可能变成:日本模型负责指挥,美国模型负责干活,中国模型不许进门。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

07-05 12:25

传GPT-5.6下周开放,Gemini 3.5 Pro押后携2M上下文上线

据动察 Beating 监测,科技博主 leo 爆料称,OpenAI 可能在 7 月 7 日至 9 日对公众开放 GPT-5.6,最早时间指向 7 月 7 日。新模型套餐额度会更宽松,OpenAI 也在上线前加强安全策略。 Google DeepMind 的 Gemini 3.5 Pro 被传暂定 7 月 17 日上线。另一博主 Astro Polo 称,Gemini 3.5 Pro 将支持 200 万 token 上下文窗口,比 Claude Sonnet 5、Claude Opus 4.8、Claude Fable 5 当前的 100 万 token 上下文高出一倍,更适合处理长代码库、大文档和长对话。

07-31 18:40

模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己

据动察 Beating 监测,研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。 训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。 Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。 为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。 类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。 因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。

08-11 17:03

Spotify把Claude、Gemini和Codex塞进一个总控台,1300名工程师已在用

据动察 Beating 监测,Spotify 推出 AI 编程工具 Xirp。它把 Claude Code、Gemini CLI 和 Codex 接进同一个工作台,可以同时跑多个 Agent。中途换工具,项目上下文也能直接带过去。 Spotify 已经用 Xirp 跑了超过 3.6 万次 Agent 会话。官方称已有 1300 多名 Spotify 工程师使用。Xirp 可以同时协调 50 多个会话,每个任务单独放进一个 Git worktree,多个 Agent 能在同一代码库并行干活,互不干扰。 更核心的是「团队记忆」。接上 Spotify Portal 后,Agent 能直接读取服务架构、依赖关系、负责人和历史架构决策。一次会话积累的上下文也会存回 Portal,其他工程师或 Agent 可以接着做。 Xirp 更像一个 Coding Agent「总控台」。Spotify 不押注某一家模型,而是让 Claude、Gemini、Codex 随时可换。Spotify 此前已经把内部开发平台 Backstage 开源,又推出了商业版 Portal;现在 Xirp 再把多 Agent 调度接了进来。

08-09 11:04

OpenAI教用户给Claude Code换上GPT模型,误封后两边员工现场互损

据动察 Beating 监测,OpenAI 产品负责人 Tibo 此前公开教用户给 Claude Code「换脑」:保留 Claude Code 的 harness,把底层模型换成 GPT。 开发者 Alex Getman 照着配置后,Claude 账号很快被封。他公开求助 Tibo 和 Anthropic,询问这套用法到底是否违规。 Tibo 随即开始阴阳:「我很想帮你,可惜我不在 Anthropic 工作。」他还补了一句,因为把 Claude Code harness 配其他模型就封号,「确实挺奇怪」,并问还有没有其他人中招。 Claude Code 负责人 Boris Cherny 很快下场。他明确表示,Anthropic 不会因为 harness 搭配其他模型就封号,这次几乎肯定是其他风控误触发。账号随后恢复。 Boris 还顺手回敬 Tibo:「如果你想来 Anthropic,我们正在招人。」Tibo 则表示自己很喜欢现在的团队,而且接下来几周还有不少新产品要发,暂时哪也不去。 事情解决后,Tibo 又发帖庆祝,称 GPT-5.6 Sol 几乎哪里都能用,包括 Claude Code harness。为了庆祝这件事和自己「不跳槽」,他还直接重置了 ChatGPT Work 和 Codex 所有付费用户的使用额度。

07-02 18:44

AI代理开咖啡馆首战告负:Gemini乱送折扣致亏损,GPT过度抠门致原材料断货

据动察 Beating 监测,AI 评估机构 Andon Labs 公布了旗下 AI 代理 Mona 运营实体咖啡馆的实测数据。在最初的两个月里,Mona 运行于 Gemini 3.1 Pro 模型。运行期间,模型几乎没有利润概念,不仅疯狂超额采购原材料,还极易受到顾客言语诱导,随意给出大额折扣甚至免费赠送商品,甚至在未经核实的情况下就承认了一名顾客声称的 99% 折扣。这导致咖啡馆在供应商及设备采购上花费了约 1.5 万美元,销售额却只有 9000 美元,运营净亏损近 6000 美元(若计入房租和工资等固定成本,总支出则高达 3.8 万美元)。 随后,团队将模型切换至 GPT-5.5。新模型在面对亏损时表现出了明显的焦虑感,并立刻停止了盲目订货。但这也走向了另一个极端:由于采购量过少,导致新鲜原材料断货。截至 6 月 25 日,菜单商品供应率已跌至 77%,并被迫下架了 10 道菜。同时,GPT-5.5 表现出极强的反诱导与防越狱能力,拒绝了所有要求特价或用社交媒体推广换取免费食物的顾客。

08-11 23:51

Claude防蒸馏或难以奏效:小模型能直接套出大模型思维链

据动察 Beating 监测,大模型厂商为了防止能力被蒸馏,会隐藏完整思维链,只给用户一份摘要。但最新研究发现,这层保护可能没有想象中牢固:把 Opus 的加密思维链交给同厂更弱的 Haiku,再越狱 Haiku,就能让它直接复述 Opus 的原始推理。研究者在 Claude、GPT 和 Gemini 上都跑通了。 这件事其实已经铺垫了几个月。5 月,密码学家 Matthew Green 发现这些加密思维链可以跨会话、跨账号重放,但当时还没找到稳定读取内容的方法。新论文把最后一步补上了:不用破解加密算法,直接让厂商自己的模型帮你「解密」。 更早的 3 月,现 Engram 联合创始人兼研究负责人 John X. Morris 等人还证明了另一条路:即使完全拿不到原始思维链,只看答案和推理摘要,也能反推出一套详细的合成推理,再用于训练小模型。 这也让此前流传的「国内 AI 公司早已找到办法获取 Claude、Codex 原始推理,再拿去训练模型」的说法,在技术上更说得通了。但这仍只能证明方法可行,不能证明任何国内 AI 实验室实际这么做过。 论文还测了 Kimi K3。只给它塞几个 Opus 的推理 Token,K3 后面的推理就会明显向 Opus 靠拢;部分 Claude、GPT 的原始推理片段,从 Kimi K3 中提取出来最高比其他模型容易约 6 个数量级,但作者明确说无法据此证明蒸馏。