返回 7*24 快讯
来源MarsBit

千问27B打到Opus4.6门口:Muse Glimmer 8项全败

据动察 Beating 监测,千问正式开源 Qwen3.8-27B,官方跑分也一起公布。这个只有 27B 参数的本地模型,在官方列出的 8 项可直接对比测试中,全部超过 Meta 刚发布的 30B 模型 Muse Glimmer。 差距在 Agent 和编程上尤其明显。Terminal-Bench 2.1,Qwen3.8-27B 得分 73.0,Muse Glimmer 为 51.7;SWE-bench Pro 是 61.7 对 51.2;OSWorld-Verified 则是 84.3 对 65.9。通用推理、文档和视觉测试也全部领先。 更夸张的是和 Claude Opus 4.6 对比。两边都有成绩的 19 项测试中,Qwen3.8-27B 赢了 15 项。SWE-bench Pro、LiveCodeBench、OSWorld、AndroidWorld 和多项视觉任务都已经反超;Terminal-Bench、GPQA、HLE 和 NL2Repo 仍落后。 一个能在个人电脑本地跑的 27B 模型,官方跑分已经摸到了上一代闭源旗舰的水平。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-11 11:22

Meta推出新模型Muse Glimmer 扎克伯格力挺开放权重模型

火星财经消息,Meta首席执行官扎克伯格周一表示,美国应降低针对开放权重AI模型的政策壁垒,以更好地推动科技发展。与此同时,这家社交媒体巨头发布了一款新的开放权重模型,并表示未来还将推出更多此类模型。Meta此次发布的新模型名为Muse Glimmer,其规模远小于竞争对手推出的领先AI模型,主要面向智能体任务设计,并可在配备GPU的Mac或PC上运行,旨在满足用户对直接在个人设备上运行AI系统的需求。开放权重模型通常比OpenAI、Anthropic等所谓“前沿AI实验室”推出的领先模型成本更低。同时,这类模型的核心参数可公开获取,开发者能够下载、部署、修改并在本地运行;而闭源模型通常只能通过云平台或API调用,用户无法查看或调整模型内部结构。(财联社)

08-10 18:03

Meta Platforms 推出开源智能体模型 Muse Glimmer

火星财经消息,Meta Platforms(META.O)推出 Muse Glimmer,一款可在 Mac 或 PC 上运行的开源智能体模型。

08-11 18:28

Meta要终结中国开源模型?Muse核心成员唱衰Kimi,结果被评论区围攻

据动察 Beating 监测,Meta 超级智能实验室成员、Muse Spark 核心贡献者 Zengyi Qin 公开唱衰中国开源模型。他称,Meta 有多一个数量级的算力和更好的数据,Muse Spark 最终会超过 Kimi 等中国模型。 他还把判断推到了商业层面:JPMorgan 等美国大客户会因为合规改用美国开放模型,中国实验室也会失去这部分推理收入。Meta 自己有 Facebook、Instagram 挣钱,中国模型公司却更依赖模型收入。 评论区很快开始反问:Meta 过去两年一直不缺算力和数据,怎么没压住中国模型?还有人追问,JPMorgan 到底给 Kimi 贡献了多少收入。 有人甚至讽刺,如果这就是「Muse Spark 核心成员」的推理水平,反而开始担心 Muse 的模型表现。 Muse Spark 1.2 即将开放权重,Meta 确实会给 Kimi、DeepSeek、Qwen 多添一个重量级美国对手。但从「多了一个强敌」直接推到「中国模型会被算力碾压、美国收入也会流失」,中间还差了一大截。

08-07 00:30

MetaMask推出自托管AI钱包Agent Wallet,支持AI代理自主执行链上交易

PANews 8月7日消息,据Decrypt报道,加密钱包服务商MetaMask宣布推出“Agent Wallet”自托管AI钱包,允许AI代理(AI Agent)在用户设定的权限范围内自主执行链上交易,进一步布局AI驱动的加密交易基础设施。 MetaMask表示,Agent Wallet面向使用AI代理进行市场监控、机会识别和自动交易的交易者与开发者。

08-06 03:17

Meta 首席人工智能官:Muse Code 测试版已上线

ChainCatcher 消息,据金十报道,Meta Platforms 首席人工智能官宣布,Muse Code 测试版已上线。这是来自 Meta 超级智能实验室(MSL)的首个编程智能体,基于 Muse Spark 1.2 构建。

08-05 18:46

千问查漏洞3轮召回率追平Opus5,成本只有一半

据动察 Beating 监测,安全公司 Aikido 用代码审计 Agent 测试了 7 款模型,包括 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash,以及 GPT-5.6 Sol、Luna 和 Terra。测试包含 32 个近期公开漏洞,每款模型运行 3 次。 Qwen3.8-Max 三轮合计找到 26 个漏洞,召回率达到 81.3%,与 Opus 5 并列第一。它的 F1 综合分(兼顾漏报和误报)为 83.2%,略低于 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。 千问的问题是单次发挥不稳定。26 个漏洞中,只有 10 个连续三轮都能找到,Opus 5 和 Sol 都有 19 个。不过,千问总成本约 821 美元,只有 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。