返回 7*24 快讯
来源MarsBit

OpenRouter推出Fusion复合模型:多模型并联合成,半价匹敌Fable 5

据动察 Beating 监测,OpenRouter 推出 Fusion 复合模型接口,支持将用户提示词并行分发给多个大语言模型,再通过裁判模型与合成模型输出最终解答。在 Perplexity AI 发布的 DRACO 深度研究基准测试中,基于 Fusion 的多种模型组合展现出对传统单模型的压制力。在各项配置中,将 Fable 5 与 GPT-5.5 组成面板并在 Opus 4.8 的合成下取得了 69.0% 的最高分,显著超越了 Fable 5 单模型运行的 65.3% 成绩。测试表明,由于不同厂商模型的底层训练与逻辑差异,多模型混搭的多样性在复杂任务中能带来更强的视角互补。 即使是同一种模型进行左右互搏也表现出明显增幅,将 Opus 4.8 与自身组成双面板进行自我合成,得分能从独立运行的 58.8% 提升至 65.5%。对于高性价比需求,由 Gemini 3 Flash、Kimi K2.6 与 DeepSeek V4 Pro 组成的低成本面板同样在合成下取得了 64.7% 的分数,在调用成本减半的情况下,与 Fable 5 的差距缩短至 0.6 个百分点。 基准测试包含 10 个维度的 100 项复杂研究任务。为了防止模型在检索中意外访问到在线评测标准导致得分失真,OpenRouter 在服务端配置了过滤检索域名列表。目前 Fusion 已对 API 用户开放,默认标识符为 openrouter/fusion,用户也可在网页端自定义参与合成的模型面板。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

07-25 09:26

Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%

据动察 Beating 监测,第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。 Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。 模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。 短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。

07-24 18:05

OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5

据动察 Beating 监测,Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。 所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。 GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。

07-15 14:30

传Claude Opus5最快本周发布,填补Fable5退场空档

据动察 Beating 监测,爆料账号 leo 称,Anthropic 正在为 Claude Opus 5 做最后准备。模型最快本周发布,也可能推迟到下周。其能力预计接近 Fable 5,但运行成本更低。 Anthropic 已把 Fable 5 的订阅内使用期延长至 7 月 19 日,但暂不准备再次延期。

07-01 20:02

Anthropic将Kimi K2.7与Opus 4.8、GPT-5.5纳入同场安全测试

火星财经消息 7月1日消息,硅谷AI巨头Anthropic今日发布公告,解除对其Fable 5和Mythos 5两款先进模型的出口控制,并在同步更新的最新安全技术说明中,将中国的Kimi K2.7与Claude Opus 4.8、GPT-5.5纳入同场核心安全能力评估。报告指出,在安全测试中,Kimi K2.7、GPT-5.5与Opus 4.8均成功识别出相同的核心漏洞,而在涉及单一漏洞利用的演示任务上,Kimi K2.7给出了与Fable 5一致的结果。(广角观察)

06-26 08:44

美政府干预GPT-5.6发布,或重演Fable下架厄运

据动察 Beating 监测,因联邦安全审查要求,OpenAI 首席执行官 Sam Altman 确认将推迟 GPT-5.6 的全面发布,改向少数伙伴提供限量预览。在预览期间,美政府将对访问客户进行逐一审批。美国商务部长 Howard Lutnick 亦致电警告 OpenAI,在获得跨部门联合批准前不得全面发布。Altman 已向政府表态分步预览并非首选的长期模式,OpenAI 将寻求更可持续的未来发布机制。 美政府对前沿大模型的干预在业内引发了变相准入许可制的担忧。本月初,亚马逊首席执行官 Andy Jassy 向白宫报告安全漏洞,导致白宫限制 Anthropic 旗舰模型的境外访问,迫使 Anthropic 彻底下架 Fable 与 Mythos。

07-22 16:17

Kimi K3白领任务逼近Fable5,成本升至上代10倍

据动察 Beating 监测,Artificial Analysis 更新 AA-Briefcase 榜单。这个评测让模型从近 2000 份邮件、Slack 记录和公司文件中找信息,再交付表格、演示文稿和界面原型。它共设 4 个长期项目和 91 项保密任务。 Kimi K3 得分 1543 Elo,仅次于 Claude Fable 5 的 1574。它超过 GPT-5.6 Sol 的 1501,也领先 Claude Sonnet 5 和 Claude Opus 4.8。 K3 的客观要求通过率为 51%,Fable 5 为 56%。但 K3 的分析质量得分略高,1754 对 1744。它主要输在成品展示,低于 GPT-5.6 Sol 和 Opus 4.8。 性能提升也伴随着更高的 Token 消耗。K3 平均每项任务花费 10.57 美元,约为 Kimi K2.6 的 10 倍。它平均执行 83 轮,输出 12 万 Token,耗时 56.4 分钟。完成同类任务所需时间约为 Fable 5 的 2.5 倍。