ArtificialAnalysis:千问3.7问鼎国产模型冠军,全球前五
相关推荐
B.AI 本周福利持续更新,1 折调用通道上线,Qwen3.8-Max 免费开放
ChainCatcher 消息,B.AI 本周迎来多项重磅更新。 福利方面,新用户凭 Bitget Wallet、Binance Wallet 或 imToken 钱包一键登录,立领 100 万 免费 Credits;通过邀请码登录再得 30 万,叠加专属钱包登录礼累计最高 130 万,邀请人同步享有好友充值及订阅永久返利。充值优惠同步释放,BNB Chain 渠道专享 1:1 等额配额赠送,其他多种支付方式享 1:0.5 返赠,单用户最高可获 $100 等值积分。 模型侧再迎新突破,「自选服务商」阵容本周重磅扩容,新增 Nebula 渠道,推出低至 1 折的历史性调用折扣;同时,阿里通义千问旗舰模型 Qwen3.8-Max 正式登陆平台,现已开放限时免费体验。目前,自选模式已全面覆盖 Claude、GPT、Gemini 等全球主流大模型系列,叠加充值赠送与多档折扣,持续为全球开发者与企业用户释放极致算力性价比。
值得买科技OpenHubs首批上线Qwen3.8-Max
火星财经消息 8月3日,阿里云正式发布Qwen3.8-Max大模型,值得买科技一站式大模型服务平台OpenHubs同步上线Qwen3.8-Max。OpenHubs平台通过统一账号体系、标准化API接口和集中化管理能力,实现主流大模型的统一接入、调用、监控、统计与账单管理。据了解,此前OpenHubs已率先上线月之暗面最新旗舰模型Kimi K3,并已汇聚Qwen、Kimi、DeepSeek、智谱GLM、MiniMax、豆包Seed等主流大模型。(广角观察)
模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己
据动察 Beating 监测,研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。 训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。 Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。 为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。 类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。 因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。
OpenAI把GPT-5.6 Sol提速14倍:750 token/s先上API
据动察 Beating 监测,OpenAI 开始预览 GPT-5.6 Sol 的 Ultrafast 模式。它由 Cerebras 提供算力,最高输出速度达到 750 token/s,最高是 Standard 模式的 14 倍。目前只向少量 API 客户开放。 OpenAI 已在故障排查、研究、客服、金融分析和开发 Agent 等场景中测试 Ultrafast。对于需要连续多次调用模型的 Agent,单次响应提速也能直接缩短整个任务的执行时间。 这比 OpenAI 7 月底推出的 Fast 模式又快了一档。Fast 模式最高是 Standard 的 2.5 倍,Ultrafast 则把上限推到 14 倍。OpenAI 暂未公布 Ultrafast 的价格,也没有宣布何时进入 ChatGPT。
Spotify把Claude、Gemini和Codex塞进一个总控台,1300名工程师已在用
据动察 Beating 监测,Spotify 推出 AI 编程工具 Xirp。它把 Claude Code、Gemini CLI 和 Codex 接进同一个工作台,可以同时跑多个 Agent。中途换工具,项目上下文也能直接带过去。 Spotify 已经用 Xirp 跑了超过 3.6 万次 Agent 会话。官方称已有 1300 多名 Spotify 工程师使用。Xirp 可以同时协调 50 多个会话,每个任务单独放进一个 Git worktree,多个 Agent 能在同一代码库并行干活,互不干扰。 更核心的是「团队记忆」。接上 Spotify Portal 后,Agent 能直接读取服务架构、依赖关系、负责人和历史架构决策。一次会话积累的上下文也会存回 Portal,其他工程师或 Agent 可以接着做。 Xirp 更像一个 Coding Agent「总控台」。Spotify 不押注某一家模型,而是让 Claude、Gemini、Codex 随时可换。Spotify 此前已经把内部开发平台 Backstage 开源,又推出了商业版 Portal;现在 Xirp 再把多 Agent 调度接了进来。
日本要拿Fugu当「国产AI」进自卫队,结果指挥模型一直是Qwen
据动察 Beating 监测,日本政府正在考虑把 Sakana Fugu 用于自卫队指挥统制,《读卖新闻》甚至把它列为「国产 AI」的主要候选之一。防卫用途还要求排除中国 AI,相关开发人员也要满足日本的安全审查要求。 但这个「国产 AI」其实很微妙。Fugu 本身更像一套 AI 调度系统:一个小型指挥模型负责分配任务,真正干活的是后面的 GPT、Claude、Gemini 等闭源大模型。Sakana 今天还明确承认,过去这个指挥模型一直基于阿里的 Qwen 训练。 如果 Fugu 真要进入防卫用途,Qwen 这一层就得换掉。Sakana 已经先用谷歌 DeepMind 开源的 Gemma 4 E2B 重训指挥模型,性能基本没掉。下一步还准备换成从预训练开始就在日本完成的国产模型。 日本正在努力把 Fugu 的「司令塔」国产化,但真正提供前沿能力的模型依然还是来自美国。这个被当成「国产 AI」代表的系统,最后很可能变成:日本模型负责指挥,美国模型负责干活,中国模型不许进门。