返回 7*24 快讯
来源MarsBit

AI可能根本没有「语言墙」:只练一种语言,其他语言也会跟着变强

据动察 Beating 监测,苹果研究团队拿 9 款模型、11 种语言做了一轮强化学习实验,想搞清楚:如果训练数据只有一种语言,模型学到的解题能力能不能拿去做其他语言的题? 答案是,可以,而且效果相当明显。只用一种语言训练,模型在很多其他语言上也会一起变强。 比如在法语测试上,直接用法语训练,成绩平均提升 25.6 个百分点;完全不用法语训练,只拿西班牙语的题来练,最后考法语也能提升 24.6 个百分点,只差 1 个百分点。 模型学到的不只是某一种语言里的题,还有一部分可以换语言继续用的解题方法。所以以后想把模型的中文推理练强,未必所有强化学习数据都得重新做成中文。 但训练语言也不能随便换,特定语言确实可能触发特定能力退化。同样一套强化学习,换一种训练语言,有些模型在其他语言和任务上反而会明显退步。最夸张的一组实验里,Qwen3-4B 用斯瓦希里语训练后,一组训练时没见过的英语测试比原模型掉了 19.2 个百分点;多语言一起训练时,这项测试反而提升了 4.5 个百分点。 这篇论文验证的主要还是数学、逻辑、图、几何等答案可以自动判断对错的推理题。这些题换一种语言后,底层解法往往没有变。对于阅读理解、隐喻、语义判断、文化知识这些真正依赖语言本身的任务,论文没有验证。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-10 20:43

日本要拿Fugu当「国产AI」进自卫队,结果指挥模型一直是Qwen

据动察 Beating 监测,日本政府正在考虑把 Sakana Fugu 用于自卫队指挥统制,《读卖新闻》甚至把它列为「国产 AI」的主要候选之一。防卫用途还要求排除中国 AI,相关开发人员也要满足日本的安全审查要求。 但这个「国产 AI」其实很微妙。Fugu 本身更像一套 AI 调度系统:一个小型指挥模型负责分配任务,真正干活的是后面的 GPT、Claude、Gemini 等闭源大模型。Sakana 今天还明确承认,过去这个指挥模型一直基于阿里的 Qwen 训练。 如果 Fugu 真要进入防卫用途,Qwen 这一层就得换掉。Sakana 已经先用谷歌 DeepMind 开源的 Gemma 4 E2B 重训指挥模型,性能基本没掉。下一步还准备换成从预训练开始就在日本完成的国产模型。 日本正在努力把 Fugu 的「司令塔」国产化,但真正提供前沿能力的模型依然还是来自美国。这个被当成「国产 AI」代表的系统,最后很可能变成:日本模型负责指挥,美国模型负责干活,中国模型不许进门。

08-07 10:28

千问大版本功能上新:推出思考研究、定时任务与办公助理,支持旗舰模型Qwen3.8-MAX

据 动察 Beating 监测,千问今日宣布重大功能升级,推出思考研究、定时任务、办公助理、语音通话及智能体广场等多项新功能,同步支持最新旗舰模型 Qwen3.8-MAX。思考研究模式在原深度思考基础上升级,强化复杂推理、工具调用与结构化输出能力,可基于用户提供的背景资料直接生成结构清晰的完整文档。定时任务功能允许用户预设执行时间,由千问自动完成行业简报梳理、邮件分类汇总等周期性工作,每日定时推送核心信息。 办公助理功能可连接用户的备忘录、日历及邮件等应用,操作电脑和浏览器完成查资料、下载附件等多步骤任务,最终直接输出 Office 文档、应用和网站等成品,支持手机与 PC 跨端协同。语音通话能力实现 7×24 小时在线,覆盖互动陪玩、睡前故事、带娃讲题、语音打车等场景。智能体广场首批上线智能寄件、网盘整理、超清扫描等服务,覆盖物流、房产、本地生活、理财、汽车等十余个领域。此次升级标志着千问从对话式 AI 助手向可执行多步骤复杂任务的生产力平台全面进化。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。

08-05 17:24

Liquid AI发布2.6B参数端侧模型,3项评测超过Qwen3.5-9B

据动察 Beating 监测,Liquid AI 发布 LFM2.5-2.6B,并开放模型权重。这款端侧 Agent 模型只有 26 亿参数,量化后内存占用约 2.5GB,在手机端也能达到每秒约 30 Token 的生成速度。 官方评测中,它在工具调用、多轮指令遵循和结构化输出三项测试上超过 Qwen3.5-9B。后者有 97 亿参数,接近它的 4 倍。不过,Qwen3.5-9B 在代码和部分复杂 Agent 任务中仍然领先。

07-31 18:40

模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己

据动察 Beating 监测,研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。 训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。 Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。 为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。 类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。 因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。

07-23 14:40

阿里云:真武芯片超节点已成功适配Qwen3.8

BlockBeats 消息,7 月 23 日,阿里真武 M890 超节点已成功适配 Qwen3.8,并上线阿里云百炼平台提供模型推理服务,成为国内首个成功运行超 2 万亿参数大模型的超节点。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。

07-23 11:56

YC等美国AI初创联名反对封杀Kimi、Qwen:封禁只会养肥Anthropic

据动察 Beating 监测,美国创业组织 Little Tech Association 联合 Y Combinator 等 179 个签署方致信特朗普政府,反对全面禁止中国开放权重模型。 信中点名 Kimi K3 和 Qwen3.8 Max。开放权重模型可以下载到本地部署和修改,不必把数据交给模型厂商。 联署方称,不少美国初创已经把中国开放模型用于正式业务。全面封禁不会阻止这些模型在海外传播,只会抬高美国企业的成本。 Particle 创始人 Suhail Doshi 警告,禁令可能让数百家依赖开放模型的公司陷入危机,Anthropic 等闭源模型厂商反而会受益。 目前,特朗普政府尚未提出正式禁令。白宫正在调查中国模型是否通过蒸馏复制美国模型,但内部并未认真讨论全面封杀,商务部也没有起草实体清单方案。