蚂蚁百灵推出金融模型:能查年报、做估值、处理5000+条Excel公式,下周开源
相关推荐
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
蚂蚁集团宣布开源多模态大模型Ling-3.0-flash-VL
火星财经消息,9 月 9 日,蚂蚁集团开源公告称,正式发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构拓展而来,总参数量为 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256KToken。 围绕「如何更可靠、更高效地完成真实任务」,Ling-3.0-flash-VL 重点探索以下方向: 给大模型加上视觉能力,一个普遍的担忧是它会拉低文本智能。但训练实践给出了相反的结论:原生多模态联合训练不仅拓展了应用边界,也拉升了文本智能。Ling-3.0-flash-VL 引入了视觉反馈机制——观察执行结果、对比目标、发现偏差、持续修正——把任务从一次性的「生成」,变成「观察→行动→验证→修正」的闭环,让执行结果更可靠。 Ling-3.0-flash-VL 继承了 Ling-3.0-flash 在 Agent 工作流中作为高效执行节点的核心优势,在视觉反馈闭环中兼顾输出质量与执行效率,以更低成本和更短时间推进完整任务。
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
Ondo Finance 将于 Korea Blockchain Week 与 TOKEN2049 期间举办闭门论坛
Foresight News 消息,Ondo Finance 宣布加速布局亚太市场,将于 Korea Blockchain Week 首尔站与 TOKEN2049 新加坡站期间,分别举办闭门论坛,集结区域内最具影响力的机构与行业声音,进一步巩固其在亚太机构市场的领先地位。 在新加坡,Ondo 将于 10 月 6 日 TOKEN2049 期间举办闭门论坛「Open Interest」,由 Ondo Perps 首席执行官及战略团队分享产品方向与行业趋势判断,随后展开机构专家 panel 讨论。已确认出席的嘉宾包括富兰克林邓普顿(Franklin Templeton)、新加坡交易所(SGX Group)、暹罗商业银行(Siam Commercial Bank)及 Ericsenz Capital,Ondo 现有合作伙伴 SBI Holdings 也将同台出席。 此外,Ondo 亦将于 Korea Blockchain Week 期间举办闭门论坛,现有合作伙伴 Mirae Asset Global Investments 确认出席,同时邀请到 Hanwha Asset Management、Meritz Securities 等机构嘉宾,以及加密行业知名声音 Fireant 与 WeCryptoTogether。
Google推出Gemini 3.8 Flash推理模型,今日起向Pro与Ultra用户开放
PANews 9月2日消息,Google Gemini 宣布其最新 Gemini 3.8 Flash 模型今日起向 Pro 与 Ultra 用户开放。官方称,该模型在日常话题行动建议、文本分析和复杂编码等任务中,将提供更可靠、更全面的回答,以增强高频使用场景下的实用性与执行效率。
Gemini3.8 Flash正式上线:价格不变,多项评测胜过Opus5
动察 Beating AI 快讯,Google 正式上线 Gemini 3.8 Flash。新模型继续主打长时间软件工程和自主 Agent。上下文约 100 万 Token,最高输出 6.5 万 Token。Google 的托管 Antigravity Agent 也已经默认换成 3.8 Flash。 Google 自家对比表里,3.8 Flash 在 14 组分数中拿下 8 组第一。DeepSWE v1.1 从 65.3% 升到 71.0%,接近 Opus 5 的 74.0%。Terminal-bench 2.1 则达到 89.4%,略高于 Opus 5 的 89.1% 和 GPT-5.6 Sol 的 88.8%。金融 Agent、法律 Agent、复杂图表推理和长视频理解也拿到最高分。 不过它没有全面超过旗舰。Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%。OSWorld-2.0 也以 59.0% 落后于 Opus 5 的 75.4%。 3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。