返回 7*24 快讯
来源MarsBit

Cohere放出2.4B视觉小模型:文档理解超过Ministral 3 3B

据动察 Beating 监测,Cohere 开源了目前自家最小的视觉语言模型 North Micro Vision,只有 2.4B 参数,采用 Apache 2.0 许可。它主攻文档、表格、图表、截图和 OCR,可以直接处理原始比例和分辨率的图片,不必先压成固定尺寸。 模型由 2B 语言模型和 400M 视觉编码器组成。官方测试中,DocVQA 得分达到 92.1%,超过 Ministral 3 3B 的 89.6% 和 Gemma 4 E2B 的 73.2%,距离 Qwen3.5-2B 的 92.6% 也很近。视觉定位 RefCOCO 得分 73.2%,同样明显高于 Ministral 和 Gemma。 不过它并非同尺寸最强模型。Qwen3.5-2B 在多数通用视觉、OCR 和多模态基准上仍更强,North Micro Vision 的优势更集中在文档理解和视觉定位。它也不是推理模型,不支持工具调用,数学和代码能力有限。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

05-21 09:17

Cohere开源Command A+:218B参数MoE大模型,主打企业级Agent与数据主权

据动察 Beating 监测,Cohere 正式开源 2180 亿参数的稀疏混合专家模型 Command A+,采用 Apache 2.0 协议支持企业级 Agent 构建与私有化部署。新模型专为关键基础设施的数据主权需求设计,支持企业在无厂商锁定的情况下进行物理隔离部署。 新模型总参数量为 2180 亿(218B),但单次推理仅激活 250 亿(25B)参数,实现了计算效率与生成性能的平衡。优化后的推理效率使其仅需两张 NVIDIA H100 或单张 B200 GPU 即可运行,Hugging Face 也同步上线了 W4A4 等低精度量化版本,进一步降低了部署门槛。 Command A+ 原生支持多模态图文输入,提供 12.8 万(128K)Token 的输入上下文窗口以及 6.4 万 Token 的输出长度。它针对复杂的逻辑推理、自主工具调用、数据库查询等 Agentic 工作流以及长文档处理进行了深度优化,并支持包含所有欧盟官方语言在内的 48 种语言。

07-29 20:11

Tether开源端侧视觉语言模型VisionPsy-Nano

火星财经消息,7 月 29 日,据 Tether 博客,Tether Data 旗下 AI 研究项目 QVAC 开源发布 VisionPsy-Nano,这是一款为端侧及边缘部署打造的紧凑型视觉语言模型,参数量约 4.6 亿,可将此前需云端基础设施才能实现的多模态理解能力直接带到移动设备上。在所有已评测的 5 亿参数以下端侧视觉语言模型中,该模型取得最高综合归一化评分 62.3 分,在 17 项基准测试中的 16 项均优于 Liquid AI、Hugging Face 等竞品模型。 Tether 此次发布两个版本,其中 Flash 版本专为低延迟优化,在保留约 99% 完整模型质量的同时大幅提升推理速度。两个版本均以 Apache 2.0 协议开源。Tether 首席执行官 Paolo Ardoino 表示,这证明了本地优先、高效的 AI 是可行路径,能让强大且私密的 AI 在人们已有设备上运行。

07-06 15:11

腾讯混元3.0正式版开源:换用Apache 2.0扫清出海限制,幻觉率减半

据动察 Beating 监测,腾讯正式发布了 295B 参数的混元 3.0(Hy3)混合专家模型(MoE)正式版。最核心的变化是,开源许可证换成了最宽松的 Apache 2.0,废除了此前禁止欧盟、英国和韩国使用的地域条款。 今年 4 月预览版刚发布时,因为严格的地域限制和 1 亿月活商用红线,许多出海或跨国团队只能望而却步。正式版则扫清了所有合规障碍,还针对落地难题做了硬核调优:它融合了快慢思考机制,并塞入一个 3.8B 参数的多 Token 预测(MTP)层做并行生成,有效拉低了推理延迟。经过细粒度数据清洗与训练约束,正式版把大模型胡说八道的幻觉率从 12.5% 压到了 5.4%,多轮交互测试的出错率也从 17.4% 砍到了 7.9%。 针对智能体开发时工具调用容易跑偏的顽疾,混元 3.0 也做了定向补强。无论是在 Cline 还是 CodeBuddy 等主流脚手架里,跨框架的工具调用准确率波动都被压在 4% 以内,输出更稳定。官方同步发布的 FP8 量化版本,也把本地部署和微调的显存门槛降了下来。

06-27 23:19

苹果Vision Pro兼智能眼镜主管Paul Meade将加盟OpenAI

据动察 Beating 监测,知情人士透露,苹果公司负责 Vision Pro 头显及智能眼镜硬件工程的副总裁 Paul Meade 将于下周离职,随后加入 OpenAI 硬件部门,负责研发未来的一系列 AI 硬件设备。Meade 在苹果工作了 16 年,曾是 iPad 和 iPhone 项目的核心工程管理负责人,于 2017 年加入负责头显研发的视觉产品集团(Vision Products Group,简称 VPG),并自 2019 年起全面主管硬件工程。 随着 Vision Pro 销售表现低迷,苹果近期大幅调整了硬件路线图,将研发重心从封闭式头显转向类似 Meta 的智能眼镜。曾任 VPG 负责人的 Mike Rockwell 已调往 Siri 团队,导致 VPG 被拆分为独立的硬件和软件组织。Meade 离职的另一大背景是苹果硬件工程部门近期的大规模重组。在 John Ternus 确定于 9 月 1 日接替 Tim Cook 出任首席执行官后,新任首席硬件官 Johny Srouji 启动了重组,使得 Meade 在内的多位副总裁汇报层级被推至新任副总裁 Tom Marieb 之下,实际上降了一级。 Meade 加入 OpenAI 后,将与 Jony Ive、Tang Tan 及 Evans Hankey 等苹果前设计高管再度共事。三名高管创办的 AI 硬件初创公司已于去年被 OpenAI 以 65 亿美元收购。目前,苹果与 OpenAI 的发言人均拒绝发表评论。

06-08 11:46

苹果AI大重构内幕:Vision Pro负责人罗克韦尔跨界救火,铁腕清洗Siri团队

据动察 Beating 监测,2025 年初,苹果软件工程部旁的会议室里,一场没有 CEO 蒂姆·库克(Tim Cook)出席的高管闭门会议紧急召开。由于首代 Apple Intelligence 市场反响惨淡,Siri 的关键重构面临延期,且谷歌、OpenAI 等对手正全速狂奔,高管埃迪·库伊(Eddy Cue)甚至在内部警告「AI 十年内可能颠覆 iPhone 业务」。当时库克已对时任 AI 负责人约翰·詹南德雷亚(John Giannandrea)失去信心,其余高管决定越过负责人直接商讨方案,向库克递交建议。会议不仅促使库克打破长期的「甩手掌柜」风格、开始亲自深度介入并微调 AI 开发细节,更开启了苹果 AI 业务的全面自救与重组。 会议中,刚主持开发完 Vision Pro 的迈克·罗克韦尔(Mike Rockwell)站了出来,主动请缨担任 「AI 救火队员」。罗克韦尔希望直接向库克汇报并晋升高级副总裁,软件主管克雷格·费德里吉(Craig Federighi)则坚决捍卫软件工程部的控制权,坚持 AI 业务不能脱离本部门。虽然罗克韦尔因认为费德里吉缺乏紧迫感一度想要退缩,但最终接受妥协,出任向费德里吉汇报的 Siri 负责人。上任后,罗克韦尔迅速清洗了 Siri 原有领导层,引入 Vision Pro 核心骨干,并在技术路线上面对现实:意识到自研模型落后于行业水平,罗克韦尔联合费德里吉、库伊与竞争对手谷歌达成协议,直接使用谷歌 Gemini 模型和谷歌云技术支撑新 Siri 运行。 引入外部模型的自救方案将在 WWDC 2026 迎来首秀。苹果将发布对标 ChatGPT 的独立 Siri 应用以及生成式照片编辑功能,彻底推翻了高管层此前排斥聊天机器人和生成式修图的态度。WWDC 2026 也是库克在 9 月 1 日正式卸任、交棒给新 CEO 约翰·特纳斯(John Ternus)前的收官一役。新 Siri 的成败不仅影响库克职业生涯的评判,也直接关系到特纳斯时代的前途。受制于底层 AI 技术瓶颈,桌面机器人(延至 2028 年)、智能屏幕(延至 2026 年底)和 AI 眼镜(延至 2027 年底)等硬件已全线被迫延期,重构成果将决定苹果能否夺回下一代计算时代的主导权。

05-29 12:37

前苹果Vision Pro主管创立,世界模型公司Reactor融资5900万美元

据动察 Beating 监测,由前 Apple Vision Pro 开发主管创立的世界模型公司 Reactor 正式宣布走出隐身模式,完成了高达 5900 万美元的种子轮与 A 轮融资。资金由光速创投(Lightspeed Venture Partners)领投,Amplify Partners、WndrCo、云九资本以及 FPV Ventures 参投。资金将主要用于加速世界模型基础设施的研发与全球化部署,帮助开发者在 10 行代码内,将前沿世界模型实时流式传输至应用程序中。 主流 AI 视频通常偏重生成速度,Reactor 则主攻交互速度与超低延迟,目标是将画面延迟压缩至 50 毫秒以内。通过提供统一的开发接口与工具包,开发者不用操心复杂的底层服务器架构,就能做出实时响应的交互式 AI 应用。画面像素、音频和物理动作均在眨眼间按需生成,不再需要预先渲染,这也为媒体娱乐、具身智能和机器人带来了实时反应的全新可能。 Reactor 的两位联合创始人背景亮眼:CEO Alberto Taiuti 曾是知名 3D 与视频生成工具 Luma AI 的联合创始人兼前 CTO,而 CTO Bryce Schmidtchen 曾与 Alberto 共同在苹果担任 Apple Vision Pro 的技术主管。过去半年来,团队吸引了来自苹果、Meta、谷歌、Luma AI、Netflix 和 Replicate 等顶尖机构的成员加入。