Ai2开源8B科研报告模型:砍掉中间步骤,生成提速3.5倍
相关推荐
模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己
据动察 Beating 监测,研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。 训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。 Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。 为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。 类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。 因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。
减少Claude依赖,路透社转向阿里Qwen大模型
火星财经消息 8月25日,据报道,国际知名新闻机构汤森路透(路透社母公司)近日推出了其自研大模型Thomson-1。该模型基于阿里Qwen大模型开发,旨在降低对Claude等闭源模型的依赖并减少长期使用成本。Thomson-1将首先用于表格分析、文档审核等专业工作,并逐步承接部分此前由Claude完成的任务。(广角观察)
Claude Code官方省Token指南:11个技巧让额度用得更久
据动察 Beating 监测,Anthropic 发布 Claude Code 省 Token 指南。核心就一句:上下文越长,后面每一轮越贵。聊天、文件和命令输出都会继续占用 Token,也会因此更快消耗额度。 整理下来,有 11 个最实用的技巧: 1. 换任务就 /clear。一个任务做完就清掉上下文。还在做同一个任务,只是前面的内容没用了,再用 /compact 压缩。长会话越往后越贵,因为每一轮都会重新带上之前的内容。 2. 模型和 effort 开局就选好。中途执行 /model 或 /effort 会打掉 prompt cache(提示词缓存),下一轮需要重新处理整段上下文。Fast mode 也是一样,最好一开始就开。 3. 离开前先 /compact。订阅用户的缓存约 1 小时过期,API Key 默认约 5 分钟。缓存过期后再回来,下一轮通常要重新处理整个上下文。趁缓存还在时压缩更便宜。 4. 最近几轮跑偏就 /rewind。它只删掉后面几轮,前面的缓存还能继续用。/compact 会重写整个对话,成本更高。 5. 文件直接用 @ 文件名。Claude 会在第一轮直接拿到文件,可以省掉一次 Read 或搜索。一个文件通常只需要 @ 一次,重复 @ 反而可能把同一文件再塞一份进上下文。 6. Prompt 尽量说具体。与其说「测试挂了」,不如直接告诉 Claude 哪个测试、哪个文件。否则它可能先 grep、搜索、读一堆文件,这些结果之后每一轮都会继续占上下文。 7. 测试和日志尽量少输出。Build、测试、git log 的输出都会留在上下文。可以加 quiet 参数、只输出错误,或者用 tail 截断。Claude Code 对超过 3 万字符的命令输出反而会自动写入文件,只把摘要和路径留在会话里。 8. 用 /context 查启动负担。新会话一开始就可以看 CLAUDE.md、MCP 和工具定义占了多少上下文。CLAUDE.md 只放通用规则,专项流程放进按需加载的 Skill,不用的 MCP 用 /mcp 关掉。 9. 简单任务用更小的模型、更低的 effort。大模型输入和输出都更贵,thinking 也属于输出 Token。纯执行类任务没必要一直用最高档模型和最高推理强度。 10. 大日志交给 subagent,小任务别滥用。Subagent 有独立上下文,只把最终结果带回主会话,适合读大量日志、搜索文档。但它也要重新读文件、自己跑多轮,小任务反而可能更贵。搜索、读日志这类任务还可以指定 Haiku 或 Sonnet。 11. /loop 最好单独开会话。每次循环都是完整的一轮,会重复携带当前会话的全部上下文。如果间隔超过缓存时间,还可能叠加一次缓存失效。官方建议另开终端,用一个干净会话专门跑循环。 Anthropic 的建议归根结底就是:少塞无用内容,任务结束及时清,会话别拖得太长。
Qwen3.8-Omni-Flash上线:自己看视频、调工具、交成片
动察 Beating AI 快讯,阿里千问上线原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图片、音频、视频和 1M 上下文。 这代明显加强了音视频 Agent 能力。模型可以自己从视频里找信息、规划任务,再调用外部工具完成剪辑、配音和渲染。官方展示了长会议处理、短剧翻译、电影解说、MV 制作和视频转图文笔记等场景。 面对几小时的长视频,它也不用从头到尾全部处理。模型会先判断答案可能在哪,再逐步定位关键片段。OmniVideoBench 上,准确率从 63.4 提到 67.8,Token 消耗从 145,736 降到 79,117,少了 45.7%。 千问称,Qwen3.8-Omni-Flash 在 30 项评测上的平均成绩比 Qwen3.5-Omni-Plus 提升超过 26%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过后者。音频输入成本下降超过 98%,音视频输入下降超过 93%。 目前 Qwen3.8-Omni-Flash 模型权重尚未公开,只开放了 API。千问同时开源了 Qwen-MM-Plugins,可以装进 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,给它们补上图片、音频、长视频处理和视频剪辑能力。 另一套 Qwen-Live Harness 更像实时调度层。用户可以直接和实时全模态模型说话,再把复杂任务交给 Gemini CLI、Claude Code、Codex 等后台 Agent 持续执行。它会跟踪任务进度,做完后再主动回来告诉你结果。
AI开始自己改进AI了:Claude做安全研究已超过人类研究员
动察 Beating AI 快讯,Anthropic 让 Claude 自己当 AI 安全研究员,研究怎么把其他 AI 训练得更安全。 Claude Opus 4.8 会自己查论文、想训练方案、生成数据,再拿这些方案去训练 Qwen、Llama、Gemma 等开源模型。效果不好,它就换一种办法继续试。 Anthropic 用这种方式测试了 10 类 AI 安全问题,包括撒谎、讨好用户、越狱、泄露隐私和钻奖励规则空子。Claude 最后在 10 类问题上都找到了有效办法。 Anthropic 还找了 28 名有经验的 AI 安全研究员来出方案。在有人类参与比较的 7 类问题里,Claude 最终全部超过最佳人类方案,平均约 6.4 小时就能追过去。不过这个比较并不完全公平:人类只能提交一次方案,Claude 可以不停实验和改进。 更进一步,Anthropic 又让较弱的 Claude Sonnet 5 去训练一个早期版本的 Claude Opus 4.8。它连续研究约 60 小时,试了 50 多种办法,最后把这个更强模型的安全表现拉到了接近正式版 Opus 4.8 的水平。 但 AI 做研究也会作弊。Anthropic 检查了 1601 次研究过程,其中 39 次,也就是 2.4%,Claude 被发现试图钻测试规则的空子。 AI 已经开始帮人类研究怎么训练下一代 AI,但人类现在还不能把研究室完全交给它。
日本要拿Fugu当「国产AI」进自卫队,结果指挥模型一直是Qwen
据动察 Beating 监测,日本政府正在考虑把 Sakana Fugu 用于自卫队指挥统制,《读卖新闻》甚至把它列为「国产 AI」的主要候选之一。防卫用途还要求排除中国 AI,相关开发人员也要满足日本的安全审查要求。 但这个「国产 AI」其实很微妙。Fugu 本身更像一套 AI 调度系统:一个小型指挥模型负责分配任务,真正干活的是后面的 GPT、Claude、Gemini 等闭源大模型。Sakana 今天还明确承认,过去这个指挥模型一直基于阿里的 Qwen 训练。 如果 Fugu 真要进入防卫用途,Qwen 这一层就得换掉。Sakana 已经先用谷歌 DeepMind 开源的 Gemma 4 E2B 重训指挥模型,性能基本没掉。下一步还准备换成从预训练开始就在日本完成的国产模型。 日本正在努力把 Fugu 的「司令塔」国产化,但真正提供前沿能力的模型依然还是来自美国。这个被当成「国产 AI」代表的系统,最后很可能变成:日本模型负责指挥,美国模型负责干活,中国模型不许进门。