Meta:“西瓜”模型研发进展顺利
相关推荐
Meta给Muse上裂变拉新:邀1人送10亿Token,最多拿200亿
动察 Beating AI 快讯,Meta 的个人 AI Agent Muse 上线邀请码。Alexandr Wang 宣布,朋友注册时使用你的邀请码,双方各得 10 亿 Muse Token,最多可以邀请 20 人。拉满后,邀请者还能提前体验电话等新功能。 这个奖励相当大。Muse 免费版目前每周提供 1 亿 Token,成功邀请 1 人拿到的奖励,数量上等于 10 周免费额度;拉满 20 人就是 200 亿 Token,相当于 200 周的基础免费额度。 Muse 上周刚在美国上线,可以自己浏览网页、连接 App,并代用户发邮件、购物和订行程。上线后一直稳居美国 App Store 总榜前几名。Meta 现在直接用大额 Token 奖励,把首批用户变成拉新渠道。
Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和
动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。
Meta涨超4%创逾一个月新高,发布最强AI模型Muse Spark 1.3
火星财经消息 9月3日,Meta盘初涨约4.5%,最高触及619.42美元,创7月22日以来新高。消息面上,Meta发布迄今最强大AI模型Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计。Meta首席AI官Alexandr Wang表示,该模型在编码能力上超越OpenAI的GPT-5.6 Sol,与Anthropic的Claude Fable 5.1表现持平。(科股宝播报)
Meta发布Muse Spark1.3模型,推进个人AI代理开发
动察 Beating AI 快讯,Meta 周三发布 Muse Spark 1.3 模型更新,称该版本在编码和智能代理(agentic)任务方面性能显著提升。 Meta AI 负责人亚历山大·王(Alexandr Wang)表示,新模型「与前沿模型竞争力相当」,并将为未来个人 AI 代理产品铺路,帮助用户实现可全天候代表用户工作的 AI 助手。Muse Spark 1.3 价格与上一版本保持一致,王称这一价格策略「具有进攻性」。 Meta 还表示,其「贡献者层级」(contributor tier)选项受到开发者欢迎,该计划通过允许 Meta 使用开发者作品改进模型,大幅降低编码产品成本,目前已有「有意义的两位数比例」开发者选择该选项。 亚历山大·王称,随着模型能力提升,安全问题已成为 Meta 内部的重要议题,公司正在增加安全和对齐投入。Muse Spark 1.3 当天将在 Muse Code 和 Meta API 上线,最高推理版本将在完成额外安全测试后推出。
Alexandr Wang:Muse的早期使用量已远超我们的预期
PANews 9月9日消息,Meta Platforms(META.O)首席人工智能官Alexandr Wang:Muse的早期使用量已远超我们的预期。如今,Muse用户的使用量是我们测试组用户的10倍。
Muse Spark 1.3 Max正式开放:最强推理档终于能用了
动察 Beating AI 快讯,Meta 正式开放 Muse Spark 1.3 Max。它是 Muse Spark 1.3 的最高推理强度,此前 1.3 发布时,max 还在做额外安全测试,只给少量合作伙伴预览。现在安全测试完成,已经能在 Muse Code 和 Meta Model API 里直接使用。 Meta 首席 AI 官 Alexandr Wang 称,Max 在编程和 Agent 任务上明显强于 high 和 xhigh。Artificial Analysis 的 Coding Agent Index 中,Muse Code + Muse Spark 1.3 Max 得到 68 分,已经进入第一梯队。