返回 7*24 快讯
来源MarsBit

蚂蚁灵波发布空间感知模型LingBot-Depth 2.0

7月7日,蚂蚁集团旗下具身智能公司灵波科技发布空间感知模型LingBot-Depth 2.0。该模型基于1.5亿规模数据进行训练,在边缘清晰度、细小物体识别、远距离深度估计以及复杂场景鲁棒性等方面实现全面升级。此外,灵波还同步推出了LingBot-Depth 2.0的视觉基座模型——LingBot-Vision,构建起机器人从“看懂”到“看准”的能力链路,旨在应对机器人视觉在空间感知、精细识别和复杂环境适应等方面的核心挑战。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

07-29 20:11

Tether开源端侧视觉语言模型VisionPsy-Nano

火星财经消息,7 月 29 日,据 Tether 博客,Tether Data 旗下 AI 研究项目 QVAC 开源发布 VisionPsy-Nano,这是一款为端侧及边缘部署打造的紧凑型视觉语言模型,参数量约 4.6 亿,可将此前需云端基础设施才能实现的多模态理解能力直接带到移动设备上。在所有已评测的 5 亿参数以下端侧视觉语言模型中,该模型取得最高综合归一化评分 62.3 分,在 17 项基准测试中的 16 项均优于 Liquid AI、Hugging Face 等竞品模型。 Tether 此次发布两个版本,其中 Flash 版本专为低延迟优化,在保留约 99% 完整模型质量的同时大幅提升推理速度。两个版本均以 Apache 2.0 协议开源。Tether 首席执行官 Paolo Ardoino 表示,这证明了本地优先、高效的 AI 是可行路径,能让强大且私密的 AI 在人们已有设备上运行。

07-20 17:09

Chance AI发布视觉推理智能Chance Vision 1.5

火星财经消息 7月20日,在WAIC 2026期间,视觉智能公司Chance AI发布新一代视觉推理智能Chance Vision 1.5,并集中展示Chance AI App及以摄像头为入口的Camera-First Visual Agent技术路径。该模型在高难度多模态理解与推理基准MMMU-Pro官方公开榜单取得86.9%综合准确率,达到该基准的 SOTA。(广角观察)

07-13 12:48

商汤发布并开源SenseNova-Vision

火星财经消息 7月13日消息,商汤正式发布并全面开源日日新SenseNova-Vision理解生成统一视觉大模型。SenseNova-Vision的核心变革是:让视觉成为通用基础模型的原生能力,彻底融入大模型体系。所有经典视觉任务如目标检测、图像分割、深度预测、3D重建等,由此都实现了原生统一。(广角观察)

07-10 10:53

蚂蚁灵波发布LingBot-VA 2.0

火星财经消息,7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0。它代表了具身智能发展的一种关键路线选择:机器人“大脑”不再依托数字世界模型能力的“嫁接”,而是从动态建模、因果预测、实时执行等与环境交互的原始需求出发,进行原生设计。

07-09 11:47

蚂蚁灵波科技开源实时交互世界模型LingBot-World 2.0

火星财经消息,蚂蚁灵波科技宣布开源新一代实时交互世界模型LingBot-World 2.0。该模型全面升级世界预测与交互能力,支持小时级实时生成、720p/60fps高清实时输出以及更丰富的交互动作与事件,并在业界首次将Agent机制引入世界模型。LingBot-World 2.0不仅可广泛应用于游戏内容生成、影视预演、虚拟仿真、数字孪生等场景,同时支持机器人与具身智能训练场景。

07-09 10:34

蚂蚁灵波开源面向具身智能的视频生成基础模型 LingBot-Video

火星财经消息 7月9日消息,蚂蚁灵波今日开源LingBot-Video,系全球首个基于MoE架构、面向具身智能的开源视频生成基础模型。该模型融合7万小时具身数据,围绕机器人核心需求重设计视频预训练范式,在推理效率、物理合理性、动作理解与任务完成度上系统性提升,为视频基模从数字创作走向具身智能提供新底座。 评测层面,LingBot-Video在北大联合字节发布的RBench上总分0.620,超越Wan2.6、Seedance 1.5 Pro、Cosmos3 Super;内部benchmark对比Cosmos3、Wan 2.2等五款开源模型,具身领域表现领先。架构采用DiT+MoE,30B总参生成时仅激活约3B,推理效率约为同规模Dense的3倍。(广角观察)