蚂蚁百灵医疗模型Sante:仅51亿激活参数,诊断单项胜过GPT-5.6 Sol
相关推荐
蚂蚁集团宣布开源多模态大模型Ling-3.0-flash-VL
火星财经消息,9 月 9 日,蚂蚁集团开源公告称,正式发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构拓展而来,总参数量为 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256KToken。 围绕「如何更可靠、更高效地完成真实任务」,Ling-3.0-flash-VL 重点探索以下方向: 给大模型加上视觉能力,一个普遍的担忧是它会拉低文本智能。但训练实践给出了相反的结论:原生多模态联合训练不仅拓展了应用边界,也拉升了文本智能。Ling-3.0-flash-VL 引入了视觉反馈机制——观察执行结果、对比目标、发现偏差、持续修正——把任务从一次性的「生成」,变成「观察→行动→验证→修正」的闭环,让执行结果更可靠。 Ling-3.0-flash-VL 继承了 Ling-3.0-flash 在 Agent 工作流中作为高效执行节点的核心优势,在视觉反馈闭环中兼顾输出质量与执行效率,以更低成本和更短时间推进完整任务。
Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
Gemini3.8 Flash正式上线:价格不变,多项评测胜过Opus5
动察 Beating AI 快讯,Google 正式上线 Gemini 3.8 Flash。新模型继续主打长时间软件工程和自主 Agent。上下文约 100 万 Token,最高输出 6.5 万 Token。Google 的托管 Antigravity Agent 也已经默认换成 3.8 Flash。 Google 自家对比表里,3.8 Flash 在 14 组分数中拿下 8 组第一。DeepSWE v1.1 从 65.3% 升到 71.0%,接近 Opus 5 的 74.0%。Terminal-bench 2.1 则达到 89.4%,略高于 Opus 5 的 89.1% 和 GPT-5.6 Sol 的 88.8%。金融 Agent、法律 Agent、复杂图表推理和长视频理解也拿到最高分。 不过它没有全面超过旗舰。Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%。OSWorld-2.0 也以 59.0% 落后于 Opus 5 的 75.4%。 3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。
Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol
动察 Beating AI 快讯,Terminal-Bench 发布 4.0,重新校准 Agent 执行任务时的时间、CPU 和内存,并修复 19 个任务、移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到 8 小时,主要是减少超时和环境问题对成绩的干扰。 最新榜单里,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,冲到第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名里,GLM-5.3 是唯一不是 Anthropic 的模型。 在 Terminal-Bench 3.0 中,GLM-5.3 还是 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反过来领先 Sol 4.5 个百分点。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。