返回 7*24 快讯
来源Blockbeats

蚂蚁百灵金融模型正式开源:MIT许可,123道金融搜索题也放出

动察 Beating AI 快讯,蚂蚁百灵正式开源金融模型 Ling-3.0-flash-Fin。模型拥有 1240 亿总参数、51 亿激活参数,支持 256K 上下文。官方放出的 BF16 权重约 255GB,采用 MIT 许可证,可以用 vLLM 和 SGLang 自行部署。 一起开源的还有金融搜索基准 FinFIRST。它由蚂蚁集团开发,中金公司投行团队提供专业支持,50 多名金融专业人士参与出题和验证。最终只有 9.78% 的候选题通过筛选,留下 123 道题。其中 61.8% 需要计算,32.5% 需要同时查多个来源。 每道题会拆成多个评分点,分别检查 AI 有没有找对数据、用对信源、核准时间和统计口径,以及计算结果是否正确。整套数据共有 701 个细分评分点。现在题目、参考答案和评分标准全部公开,采用 Apache 2.0 许可证。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-05 07:38

蚂蚁Ling-3.0-flash正式开源,FP8版仅128GB

据动察 Beating 监测,蚂蚁百灵(inclusionAI)正式开放 Ling-3.0-flash 权重,同时提供 BF16 原版和 FP8 量化版。两版均采用 MIT 许可证,已上线 Hugging Face 和 ModelScope,可用 SGLang 或 vLLM 自行部署。 BF16 版权重约 255GB,FP8 版约 128GB,体积接近减半。FP8 用更低精度保存参数,可以降低存储和显存门槛。官方列出的 4 项测试中,FP8 与 BF16 的最大分差为 1.57 分。 Ling-3.0-flash 总参数 1240 亿,每次生成只激活 51 亿。模型支持 25.6 万 Token 上下文,主要面向编程、搜索、深度研究和工具调用等 Agent 任务。官方评测显示,它在多数基准上达到或超过万亿参数的前代模型 Ring-2.6-1T。

08-26 14:15

「牛来」模型GLM-5.3-Flash正式开源:320B 参数仅激活 18B,价格只有 GLM-5.2 十分之一

动察 Beating AI 快讯,白天认领 Ox Alpha 后,智谱晚上正式开源 GLM-5.3-Flash,模型权重已经上线 Hugging Face,采用 MIT 许可。它总参数 320B,但每次只激活 18B,原生支持文字、图片和视频,也是 GLM-5 系列首个原生多模态模型。 官方称,GLM-5.3-Flash 整体性能超过 GLM-5.2,编程和 Agent 评测已经接近 Claude Opus 4.8,但价格只有 GLM-5.2 的十分之一。它还换了一套新的基础模型,首次在 GLM 主系列引入稀疏注意力和线性注意力混合架构,并用 30T Token 多模态数据预训练。 此前社区对 Ox Alpha 的 DeepSWE 小样本测试一度跑出 80%,但那只有 10 道题。扩大样本后成绩回落到约 63%,测试者也主动纠正了最初的说法。这个成绩依然属于第一梯队,但没有最初 80% 那么夸张。 权重开源后,开发者可以直接用 vLLM、SGLang、KTransformers 等框架自己部署,不需要再走匿名模型的 API。

09-09 04:20

蚂蚁集团宣布开源多模态大模型Ling-3.0-flash-VL

火星财经消息,9 月 9 日,蚂蚁集团开源公告称,正式发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构拓展而来,总参数量为 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256KToken。 围绕「如何更可靠、更高效地完成真实任务」,Ling-3.0-flash-VL 重点探索以下方向: 给大模型加上视觉能力,一个普遍的担忧是它会拉低文本智能。但训练实践给出了相反的结论:原生多模态联合训练不仅拓展了应用边界,也拉升了文本智能。Ling-3.0-flash-VL 引入了视觉反馈机制——观察执行结果、对比目标、发现偏差、持续修正——把任务从一次性的「生成」,变成「观察→行动→验证→修正」的闭环,让执行结果更可靠。 Ling-3.0-flash-VL 继承了 Ling-3.0-flash 在 Agent 工作流中作为高效执行节点的核心优势,在视觉反馈闭环中兼顾输出质量与执行效率,以更低成本和更短时间推进完整任务。

08-28 15:09

智谱GLM-5.3正式开源:换掉MIT,百亿美元模型服务商要过安全审查

动察 Beating AI 快讯,智谱正式开源 744B 参数的旗舰模型 GLM-5.3,FP8 与 BF16 权重已在 Hugging Face 放出。与上一代 GLM-5.2 不同,这次没有继续使用 MIT,而是换成了新的「GLM-5.3 License」。 新许可证对普通开发者依然比较宽松,可以使用、修改、分发、部署、微调甚至销售模型和衍生版本。但智谱专门给大型「模型即服务」公司加了一条限制:如果公司及关联方任意连续 12 个月总收入超过 100 亿美元,商业使用 GLM-5.3 前必须先通过智谱的安全审查。普通产品把模型嵌入具体功能,不受这一条限制。 GLM-5.3 两周前就已经发布,但智谱当时因为模型的网络安全能力增长超出预期,决定先做额外安全评估和加固,再开放权重。现在模型也已经支持 SGLang、vLLM、Transformers、KTransformers 等框架自行部署。

09-01 07:37

FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。

08-11 08:48

蚂蚁开源Ling-3.0-tiny:79亿参数,M4Pro本地跑到90Token/s

据动察 Beating 监测,蚂蚁百灵正式开放 Ling-3.0-tiny 权重,提供 BF16、FP8 和 INT4 三个版本,Hugging Face 页面标注为 MIT 许可。模型共有 79 亿参数,每个 Token 只激活 13 亿,主要面向本地部署和 Agent 场景。 Ling-3.0-tiny 有 128 个路由专家,每个 Token 只选择其中 8 个,再加 1 个所有 Token 都会使用的共享专家。注意力部分采用 3:1 的 KDA 与 MLA 混合架构,也就是每 3 层 Kimi Delta Attention 后接 1 层 MLA。 官方称 FP8 版在 M4 Pro MacBook 上可达到约 86–90 Token/s;DGX Spark 上约为 100–105 Token/s。