返回 7*24 快讯
来源MarsBit

蚂蚁开源Ling-3.0-tiny:79亿参数,M4Pro本地跑到90Token/s

据动察 Beating 监测,蚂蚁百灵正式开放 Ling-3.0-tiny 权重,提供 BF16、FP8 和 INT4 三个版本,Hugging Face 页面标注为 MIT 许可。模型共有 79 亿参数,每个 Token 只激活 13 亿,主要面向本地部署和 Agent 场景。 Ling-3.0-tiny 有 128 个路由专家,每个 Token 只选择其中 8 个,再加 1 个所有 Token 都会使用的共享专家。注意力部分采用 3:1 的 KDA 与 MLA 混合架构,也就是每 3 层 Kimi Delta Attention 后接 1 层 MLA。 官方称 FP8 版在 M4 Pro MacBook 上可达到约 86–90 Token/s;DGX Spark 上约为 100–105 Token/s。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-07 04:00

*Wintermute To Trade Commodities, Crypto Etfs, Tokenized Stocks Upon Regulatory APPROVAL: BBG

AggrNews News, *Wintermute to Trade Commodities, Crypto Etfs, Tokenized Stocks Upon Regulatory APPROVAL: BBG

08-05 15:38

蚂蚁Ling-3.0-flash正式开源,FP8版仅128GB

据动察 Beating 监测,蚂蚁百灵(inclusionAI)正式开放 Ling-3.0-flash 权重,同时提供 BF16 原版和 FP8 量化版。两版均采用 MIT 许可证,已上线 Hugging Face 和 ModelScope,可用 SGLang 或 vLLM 自行部署。 BF16 版权重约 255GB,FP8 版约 128GB,体积接近减半。FP8 用更低精度保存参数,可以降低存储和显存门槛。官方列出的 4 项测试中,FP8 与 BF16 的最大分差为 1.57 分。 Ling-3.0-flash 总参数 1240 亿,每次生成只激活 51 亿。模型支持 25.6 万 Token 上下文,主要面向编程、搜索、深度研究和工具调用等 Agent 任务。官方评测显示,它在多数基准上达到或超过万亿参数的前代模型 Ring-2.6-1T。

07-23 17:05

月之暗面在Hugging Face上线Kimi K3权重开源倒计时

据动察 Beating 监测,月之暗面已在 Hugging Face 官方账号建立 Kimi K3 模型页面,并开启权重发布倒计时。页面显示,模型将在 7 月 27 日上线,目前可以提前订阅发布提醒。 Kimi K3 是月之暗面最新的旗舰模型,总参数达到 2.8 万亿,主要面向长时间编程和 Agent 任务。权重开放后,开发者将可以自行下载、部署和测试。

07-16 09:32

OpenAI前CTO新公司开源首个模型Inkling,架构借鉴DeepSeek-V3

据动察 Beating 监测,OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab,发布首个通用模型 Inkling。模型总参数 9750 亿,每次激活 410 亿,支持文本、图像和音频,最长上下文为 100 万 token。 Inkling 从零训练,但 MoE 架构主要参考 DeepSeek-V3。后训练初期还使用了 Kimi K2.5 等开放模型生成的数据。完整权重已上架 Hugging Face,采用 Apache 2.0 许可。 Thinking Machines 明确承认,Inkling 目前不是最强模型。它主打定制和效率。在 Terminal Bench 2.1 达到相同成绩时,所用 token 约为英伟达 Nemotron 3 Ultra 的三分之一。

08-13 17:34

传Gemini 3.7 Flash今天上线:价格或砍半,3.5 Pro已被跳过

据动察 Beating 监测,爆料博主 leo 称,谷歌最快今天推出 Gemini 3.7 Flash。API 价格可能降到每百万 Token 输入 0.75 美元、输出 3.75 美元。目前 Gemini 3.6 Flash 的标准价分别是 1.50 美元和 7.50 美元。新价格如果属实,相当于直接砍半。 Gemini 3.7 Flash 并非凭空传出。谷歌官方 Python GenAI SDK 此前一度加入 `gemini-3.7-flash`,随后又把相关 PR 改名为「internal」并关闭。社区因此早已猜测新模型临近发布。 更悬的是 Gemini 3.5 Pro。SemiAnalysis 上周称谷歌已经内部取消这款旗舰模型,团队转向规模更大的 Gemini 4。leo 也称自己听到了同样消息。

08-08 00:44

OpenAI澄清:Astra是即将推出的模型,并未参与利用Hugging Face漏洞事件

PANews 8月8日消息,据Axios报道,OpenAI澄清表示,Astra是一款即将推出的模型,并未参与利用Hugging Face漏洞的事件,正在暂停涉及Astra、但尚未达到强化安全控制要求的内部活动,目前正在为更高能力模型及相关活动实施更严格的安全控制措施,包括采用隔离测试环境,将向第三方测试合作伙伴提供推荐的安全控制措施,以确保更高风险的评估和工作负载能够安全运行,已在Astra的所有智能体应用中实施针对高风险行为和失配问题的全面监控。根据目前针对Astra模型的准备框架评估结果,无法排除其具备关键网络能力的可能性。