减少Claude依赖,路透社转向阿里Qwen大模型
相关推荐
汤森路透推出自研 AI 模型 Thomson-1,基于阿里开源 Qwen
火星财经消息,据 Business Insider 报道,汤森路透于周一推出首款自研 AI 模型 Thomson-1。该模型基于 Snowdon,通过对阿里巴巴开源 Qwen 模型进行“重新对齐”构建而成。开源意味着任何人可免费下载并调整模型。Thomson-1 将接管部分此前由 Anthropic 的 Claude 处理的任务,但并非旨在完全取代与 Anthropic 及其他实验室的合作,初期聚焦公司专业领域,从文档审查起步。此举旨在应对 Claude 及 OpenAI Codex 等模型带来的高昂 AI 成本,并体现对更廉价中国开源 AI 的使用。CTO Joel Hron 表示,主要原因是更好发挥汤森路透自身专业能力并控制成本。公司今年 5 月曾扩大与 Anthropic 的合作,用于 AI 法律助手 CoCounsel,该产品目前仍主要依赖 Claude。Hron 称:“我们的主要目标是让 Thomson 逐渐成为驱动 CoCounsel 越来越多能力的模型。”汤森路透与英国帝国理工学院联合团队耗时数月改造 Qwen 以构建 Snowdon,并确保其“在伦理和政治上经过去偏见处理且可安全使用”。Hron 指出,拥有自有模型可基于自身知识产权进行建设,而非持续向外部 AI 公司付费,他将其比作租房与买房:租房能遮风挡雨,但无法积累长期权益。
模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己
据动察 Beating 监测,研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。 训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。 Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。 为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。 类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。 因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。
阿里更新旗舰模型Qwen3.8-Max
火星财经消息,9月2日,阿里更新旗舰模型Qwen3.8-Max,性能较旧版本显著提升。在针对编程(Coding)和专业办公(Cowork)进行专项后训练后,Qwen3.8-Max新版本整体性能增强。在聚焦前端编程能力(WebDev)的全球权威三方榜单CodeArena中,提升22分至1691分,领先Claude Opus5、Kimi K3等一众模型,位居总榜第一。同时,CodeArena更新的模型性价比榜单(帕累托前沿)显示,Qwen3.8-Max新版本每百万Tokens综合平均仅5美元,直接“斩杀”所有价格大于5美元的其他模型。据了解,Qwen3.8-Max是阿里千问迄今最强大的大语言模型,总参数达2.4万亿,支持100万上下文Tokens;更新后的Qwen3.8-Max涌现出更强的智能体编程能力,更适合企业真实复杂任务、科研、长周期任务等。(财联社)
AI开始自己改进AI了:Claude做安全研究已超过人类研究员
动察 Beating AI 快讯,Anthropic 让 Claude 自己当 AI 安全研究员,研究怎么把其他 AI 训练得更安全。 Claude Opus 4.8 会自己查论文、想训练方案、生成数据,再拿这些方案去训练 Qwen、Llama、Gemma 等开源模型。效果不好,它就换一种办法继续试。 Anthropic 用这种方式测试了 10 类 AI 安全问题,包括撒谎、讨好用户、越狱、泄露隐私和钻奖励规则空子。Claude 最后在 10 类问题上都找到了有效办法。 Anthropic 还找了 28 名有经验的 AI 安全研究员来出方案。在有人类参与比较的 7 类问题里,Claude 最终全部超过最佳人类方案,平均约 6.4 小时就能追过去。不过这个比较并不完全公平:人类只能提交一次方案,Claude 可以不停实验和改进。 更进一步,Anthropic 又让较弱的 Claude Sonnet 5 去训练一个早期版本的 Claude Opus 4.8。它连续研究约 60 小时,试了 50 多种办法,最后把这个更强模型的安全表现拉到了接近正式版 Opus 4.8 的水平。 但 AI 做研究也会作弊。Anthropic 检查了 1601 次研究过程,其中 39 次,也就是 2.4%,Claude 被发现试图钻测试规则的空子。 AI 已经开始帮人类研究怎么训练下一代 AI,但人类现在还不能把研究室完全交给它。
日本要拿Fugu当「国产AI」进自卫队,结果指挥模型一直是Qwen
据动察 Beating 监测,日本政府正在考虑把 Sakana Fugu 用于自卫队指挥统制,《读卖新闻》甚至把它列为「国产 AI」的主要候选之一。防卫用途还要求排除中国 AI,相关开发人员也要满足日本的安全审查要求。 但这个「国产 AI」其实很微妙。Fugu 本身更像一套 AI 调度系统:一个小型指挥模型负责分配任务,真正干活的是后面的 GPT、Claude、Gemini 等闭源大模型。Sakana 今天还明确承认,过去这个指挥模型一直基于阿里的 Qwen 训练。 如果 Fugu 真要进入防卫用途,Qwen 这一层就得换掉。Sakana 已经先用谷歌 DeepMind 开源的 Gemma 4 E2B 重训指挥模型,性能基本没掉。下一步还准备换成从预训练开始就在日本完成的国产模型。 日本正在努力把 Fugu 的「司令塔」国产化,但真正提供前沿能力的模型依然还是来自美国。这个被当成「国产 AI」代表的系统,最后很可能变成:日本模型负责指挥,美国模型负责干活,中国模型不许进门。
B.AI 本周福利持续更新,1 折调用通道上线,Qwen3.8-Max 免费开放
ChainCatcher 消息,B.AI 本周迎来多项重磅更新。 福利方面,新用户凭 Bitget Wallet、Binance Wallet 或 imToken 钱包一键登录,立领 100 万 免费 Credits;通过邀请码登录再得 30 万,叠加专属钱包登录礼累计最高 130 万,邀请人同步享有好友充值及订阅永久返利。充值优惠同步释放,BNB Chain 渠道专享 1:1 等额配额赠送,其他多种支付方式享 1:0.5 返赠,单用户最高可获 $100 等值积分。 模型侧再迎新突破,「自选服务商」阵容本周重磅扩容,新增 Nebula 渠道,推出低至 1 折的历史性调用折扣;同时,阿里通义千问旗舰模型 Qwen3.8-Max 正式登陆平台,现已开放限时免费体验。目前,自选模式已全面覆盖 Claude、GPT、Gemini 等全球主流大模型系列,叠加充值赠送与多档折扣,持续为全球开发者与企业用户释放极致算力性价比。