返回 7*24 快讯
来源MarsBit

蚂蚁集团宣布开源多模态大模型Ling-3.0-flash-VL

火星财经消息,9 月 9 日,蚂蚁集团开源公告称,正式发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构拓展而来,总参数量为 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256KToken。 围绕「如何更可靠、更高效地完成真实任务」,Ling-3.0-flash-VL 重点探索以下方向: 给大模型加上视觉能力,一个普遍的担忧是它会拉低文本智能。但训练实践给出了相反的结论:原生多模态联合训练不仅拓展了应用边界,也拉升了文本智能。Ling-3.0-flash-VL 引入了视觉反馈机制——观察执行结果、对比目标、发现偏差、持续修正——把任务从一次性的「生成」,变成「观察→行动→验证→修正」的闭环,让执行结果更可靠。 Ling-3.0-flash-VL 继承了 Ling-3.0-flash 在 Agent 工作流中作为高效执行节点的核心优势,在视觉反馈闭环中兼顾输出质量与执行效率,以更低成本和更短时间推进完整任务。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-05 07:38

蚂蚁Ling-3.0-flash正式开源,FP8版仅128GB

据动察 Beating 监测,蚂蚁百灵(inclusionAI)正式开放 Ling-3.0-flash 权重,同时提供 BF16 原版和 FP8 量化版。两版均采用 MIT 许可证,已上线 Hugging Face 和 ModelScope,可用 SGLang 或 vLLM 自行部署。 BF16 版权重约 255GB,FP8 版约 128GB,体积接近减半。FP8 用更低精度保存参数,可以降低存储和显存门槛。官方列出的 4 项测试中,FP8 与 BF16 的最大分差为 1.57 分。 Ling-3.0-flash 总参数 1240 亿,每次生成只激活 51 亿。模型支持 25.6 万 Token 上下文,主要面向编程、搜索、深度研究和工具调用等 Agent 任务。官方评测显示,它在多数基准上达到或超过万亿参数的前代模型 Ring-2.6-1T。

09-10 06:43

DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化

动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。

09-10 16:19

B.AI 宣布 DeepSeek-V4.1-Flash 多模态模型上线

ChainCatcher 消息,B.AI 平台宣布 DeepSeek 原生多模态 MoE 大模型 DeepSeek-V4.1-Flash 正式上线。该模型采用 5520 亿参数主干与 Causal Encoder-Decoder 架构,输入与输出采用非对称计算规模。模型支持 100 万 Token 上下文与 384K Output,面向长周期编程 Agent、多模态工作流与高并发 Agent 系统。目前 Web Chat 与 API 双端接入均已开放。

09-11 10:20

腾讯T1专攻Agent长任务:连续操作300多轮,跑分涨20分

动察 Beating AI 快讯,腾讯把 Qwen3.5-122B-A10B 专门拿去练终端 Agent,做出了 T1。它主要处理 Linux 终端里的复杂任务,单个任务最多能连续调用工具 300 多轮。Terminal-Bench 2.1 得分从底模的 43.8% 升到 64.0%,涨了 20.2 分。 这 20.2 分里,大头来自强化学习。SFT 只把分数拉到 49.4%,后面的强化学习又涨了 14.6 分。团队准备了约 1.5 万个终端任务,每个任务都配有自动测试。Agent 没把整个任务做完,只要完成了其中一些要求,也能拿到相应奖励。 长任务还有一个麻烦。Agent 真正干活和之后拿这段经历训练时,同一句内容可能被重新切成不同 token,MoE 也可能换一批专家处理。T1 会把当时生成的 token 和选中的专家都记下来,训练时直接照着重放,把这种训推偏差压低了约三分之一。

09-11 09:30

离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成

动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。