返回 7*24 快讯
来源MarsBit

Meta新模型连夺三榜第一,法律Agent反超Grok 4.5

据动察 Beating 监测,AI 评测机构 Vals AI 公布 Muse Spark 1.1 成绩。模型在医疗文书、税务问答和法律 Agent 三项评测中排名第一,得分分别为 88.89%、79.72% 和 20.00%。 在税务评测 TaxEval v2 中,它超过 Fable 5、Opus 4.8 和 GPT-5.5。该评测包含超过 1200 道未公开测试题,既检查答案,也检查推理过程。头部模型差距较小,前十名相差不到 3 个百分点。 法律 Agent 评测中,Muse Spark 1.1 得分 20.00%,超过 Grok 4.5 的 12.92% 和 Fable 5 的 11.25%。测试要求模型使用文档、表格和文件工具完成真实法律工作。 它在网页应用编程评测中得分 72.16%,超过 GPT-5.5、Grok 4.5 和 GPT-5.4,但仍落后于 Fable 5 和多款 Claude 模型。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-11 18:28

Meta要终结中国开源模型?Muse核心成员唱衰Kimi,结果被评论区围攻

据动察 Beating 监测,Meta 超级智能实验室成员、Muse Spark 核心贡献者 Zengyi Qin 公开唱衰中国开源模型。他称,Meta 有多一个数量级的算力和更好的数据,Muse Spark 最终会超过 Kimi 等中国模型。 他还把判断推到了商业层面:JPMorgan 等美国大客户会因为合规改用美国开放模型,中国实验室也会失去这部分推理收入。Meta 自己有 Facebook、Instagram 挣钱,中国模型公司却更依赖模型收入。 评论区很快开始反问:Meta 过去两年一直不缺算力和数据,怎么没压住中国模型?还有人追问,JPMorgan 到底给 Kimi 贡献了多少收入。 有人甚至讽刺,如果这就是「Muse Spark 核心成员」的推理水平,反而开始担心 Muse 的模型表现。 Muse Spark 1.2 即将开放权重,Meta 确实会给 Kimi、DeepSeek、Qwen 多添一个重量级美国对手。但从「多了一个强敌」直接推到「中国模型会被算力碾压、美国收入也会流失」,中间还差了一大截。

08-14 12:50

Hermes Agent跟进Grok Bot:把多Agent做成普通人也能用的AI团队

据动察 Beating 监测,Nous Research 开始公测 Hermes Agent 的 Bot Mode。目前先以独立插件提供,收集反馈后计划整合进 Hermes Desktop。 Hermes 原本就支持多个独立 Profile,也能通过 Kanban 让不同 Agent 分工协作。Bot Mode 这次没有重做底层,主要是把这些能力重新做成一个更直观的产品界面。官方直接写明,一个 Bot 本质上就是一个 Hermes Profile。 现在每个 Profile 都会显示成一个有名字、头像和身份的 Bot。它们各自保留模型、Skill、记忆和聊天记录。用户可以直接 @ 另一个 Bot 派活,Bot 之间也有固定收件箱,可以互相发消息。每个 Bot 还能单独设置定时任务。 这套产品形态明显在跟进刚上线的 Grok Bot。社区有人直接问,这是不是补上了 Hermes 相比 Grok Bot 缺少的功能,Hermes 联合创始人 Teknium 回答「Yep」。

08-06 03:17

Meta 首席人工智能官:Muse Code 测试版已上线

ChainCatcher 消息,据金十报道,Meta Platforms 首席人工智能官宣布,Muse Code 测试版已上线。这是来自 Meta 超级智能实验室(MSL)的首个编程智能体,基于 Muse Spark 1.2 构建。

07-30 11:12重要

Grok全新语音模型拿下Agent评测第一,API价格涨60%

据动察 Beating 监测,SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。 Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。 性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。

08-14 23:26

千问27B打到Opus4.6门口:Muse Glimmer 8项全败

据动察 Beating 监测,千问正式开源 Qwen3.8-27B,官方跑分也一起公布。这个只有 27B 参数的本地模型,在官方列出的 8 项可直接对比测试中,全部超过 Meta 刚发布的 30B 模型 Muse Glimmer。 差距在 Agent 和编程上尤其明显。Terminal-Bench 2.1,Qwen3.8-27B 得分 73.0,Muse Glimmer 为 51.7;SWE-bench Pro 是 61.7 对 51.2;OSWorld-Verified 则是 84.3 对 65.9。通用推理、文档和视觉测试也全部领先。 更夸张的是和 Claude Opus 4.6 对比。两边都有成绩的 19 项测试中,Qwen3.8-27B 赢了 15 项。SWE-bench Pro、LiveCodeBench、OSWorld、AndroidWorld 和多项视觉任务都已经反超;Terminal-Bench、GPQA、HLE 和 NL2Repo 仍落后。 一个能在个人电脑本地跑的 27B 模型,官方跑分已经摸到了上一代闭源旗舰的水平。

08-11 11:22

Meta推出新模型Muse Glimmer 扎克伯格力挺开放权重模型

火星财经消息,Meta首席执行官扎克伯格周一表示,美国应降低针对开放权重AI模型的政策壁垒,以更好地推动科技发展。与此同时,这家社交媒体巨头发布了一款新的开放权重模型,并表示未来还将推出更多此类模型。Meta此次发布的新模型名为Muse Glimmer,其规模远小于竞争对手推出的领先AI模型,主要面向智能体任务设计,并可在配备GPU的Mac或PC上运行,旨在满足用户对直接在个人设备上运行AI系统的需求。开放权重模型通常比OpenAI、Anthropic等所谓“前沿AI实验室”推出的领先模型成本更低。同时,这类模型的核心参数可公开获取,开发者能够下载、部署、修改并在本地运行;而闭源模型通常只能通过云平台或API调用,用户无法查看或调整模型内部结构。(财联社)