Reka发19B Rho-1:一个模型同时处理图文、视频和机器人动作
相关推荐
前Google DeepMind工程负责人做Fo:AI干不了,直接叫真人上
动察 Beating AI 快讯,前 Google DeepMind 工程负责人 Shivani Poddar 创办的 Wajo,正在主推个人 AI Agent Fo。它可以替用户打电话、发邮件、订服务和付款。AI 自己办不了的事情,会直接转给真人助理继续处理。 比如联系没有 API 的理发店、私人教练或本地商家,Fo 如果自己搞不定,就让真人帮用户打电话、沟通需求、把事情办完。真人只会拿到完成任务需要的信息,不会直接看到用户的全部聊天记录。 Wajo 还拿 104 个现实任务做了自测,每个任务重复 3 次。整个测试不使用真人兜底,Fo 的任务完成率为 71%,OpenClaw 为 42%,前者相对高约 69%。另一组安全测试专门检查 AI 会不会擅自联系别人、泄露隐私或做未经授权的决定,Fo 的通过率为 94%。
Meta开放Muse硬件SDK:ESP32、树莓派都能接入
动察 Beating AI 快讯,Meta 发布 Muse Gadgets,把用于连接 Muse 的 ESP32 固件和 Linux SDK 开源。开发者可以用现成的 ESP32 开发板、树莓派或 Linux 设备,自制 Muse 硬件。屏幕、麦克风、扬声器、按钮和传感器都可以接入,代码采用 Apache 2.0 协议。 Meta 还推出 Muse Home Link。这个 USB-C 小设备把 Muse 接进家庭局域网,再通过社区开发的技能控制灯、电视、音箱和打印机等设备。目前已有 Philips Hue、Sonos、Apple TV、Google Nest 和 Samsung TV 等集成。Meta 首批生产了 5000 台,美国 Muse 订阅用户可以免费领取,10 月开始发货。 此前 Meta 已经公布自己的 Muse Charm,但还没有正式上市。现在开发者不用等官方硬件,也可以自己给 Muse 做屏幕、桌面设备和智能家居入口。
DeepMind成立AGI研究院,首席AGI科学家称Astra还不算AGI
动察 Beating AI 快讯,Google DeepMind 宣布成立 DeepMind Institute,专门研究 AGI 会怎样影响科学、经济和社会。 DeepMind 联合创始人兼首席 AGI 科学家 Shane Legg 负责研究院内容方向,CEO Demis Hassabis 和 Google 高级副总裁 James Manyika 也参与其中。 Legg 也不认同最近「AGI 已经到来」的说法。OpenAI 总裁 Greg Brockman 和英伟达 CEO 黄仁勋此前都把 GPT-6 Astra 与 AGI 到来联系起来。Legg 认为,Astra 虽然能力很强,但还达不到 OpenAI 自己对 AGI 的定义,也就是高度自主,并在大多数有经济价值的工作上超过人类。 DeepMind Institute 首批发布三篇文章,讨论 AI 安全、经济政策和「新乌托邦主义」。其中一篇由 DeepMind 安全团队的 Rohin Shah 和 Anca Dragan 撰写,批评 Astra 发布时的信息透明度下降,并认为激烈竞争会让 AI 公司越来越不愿公开模型信息。 Anthropic 今年 3 月也成立了类似的 Anthropic Institute,把红队、社会影响和经济研究团队整合到一起。
DeepMind突传实现RSI:三个大写字母点燃社区
动察 Beating AI 快讯,AI 社区突然疯传 Google DeepMind 已经实现 RSI。 RSI 即递归自我改进,被很多人视为通往超级智能最关键的一步。AI 可以自己改进训练方法、代码和模型,造出更强的下一代,再让下一代继续升级。真正跑通后,AI 研发可能进入自我加速循环。 起因是爆料账号 lyra 给 Google DeepMind 发了一句「huge congRatulationS Indeed!」,其中三个异常大写字母正好拼成 RSI。随后 Lentils 又贴出一张疑似内部模型列表,里面出现 rsi-model-liverl-le。他还声称 Google 内部有 10 个同系列训练模型槽位,但没有贴出对应截图。 传闻也未必是假的。路透社 8 月报道,谷歌联合创始人 Sergey Brin 已要求 DeepMind 加快 Gemini 研发,并重点推动递归自我改进。DeepMind 6 月的官方报告也把「recursive improvement」列为 AGI 走向 ASI 的四条潜在路径之一。
DeepMind给人类基因组做了张AI地图:90亿种DNA变化直接查
动察 Beating AI 快讯,Google DeepMind 发布 AlphaGenome Atlas,把人类基因组约 90 亿种可能的单字母 DNA 变化提前全部算好,做成一个可以直接搜索的数据库。整个数据集约 1PB,比 AlphaFold Database 大 30 多倍。 人类基因组约有 30 亿个 DNA 字母,每个位置都可能换成另外 3 种,因此共有约 90 亿种单字母变化。过去研究人员要用 AlphaGenome 单独分析变异,现在可以直接在 Atlas 里查结果,不需要每次重新跑模型。 Atlas 还给每个变异提供一个 AVI 分数,综合 AlphaGenome 和 AlphaMissense 的预测,帮助研究人员先找出最可能产生影响的变异。它既覆盖约 2% 的蛋白质编码区域,也覆盖更难研究的另外 98% 非编码区域。 已有研究团队用它找出此前漏掉的罕见病相关变异,并通过实验确认其中一个变异确实会导致 RNA 剪接异常。
Meta首席AI官Alexandr Wang驳斥SemiAnalysis「刷榜论」:老测试早已饱和
动察 Beating AI 快讯,AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是针对公开评测优化得太狠。两款模型在 Terminal-Bench 2.1 分别拿到 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1;换到刚发布不久的 Terminal-Bench 4.0,却只剩 19.1% 和 33.3%。Astra 和 Fable 5.1 分别还有 57.7% 和 55.8%。 SemiAnalysis 怀疑,问题出在公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接拿测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。模型于是越来越擅长这套考试,却未必能泛化到新任务。不过 SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。 Meta 首席 AI 官 Alexandr Wang 随后反驳,称这个论点「很蠢」。他举例,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 掉到 4.0 的 37.3%。他的解释是 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 远未饱和。Terminal-Bench 4.0 的确删除了 8 道饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整时间、CPU 和内存等资源限制。