加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源MarsBit

讯飞星火X2.5正式发布,重点提升代码与智能体能力

火星财经消息,科大讯飞正式发布星火X2.5大模型。该模型采用MoE架构,参数规模为293B-A30B,重点提升代码和智能体能力,并持续增强数学、理解等通用能力。模型基于全国产算力完成全流程训练及推理,持续优化国产超长序列训推难题,目前已上线讯飞开放平台。此前,星火X2.5-4B和1.7B两款端侧模型已开源,支持最长100万Token上下文,可本地部署于长文档处理、代码辅助、数据分析等场景。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-07 09:45

Hy4 preview优化「想太多」:复杂任务轮次和Token消耗双降

动察 Beating AI 快讯,腾讯混元和 WorkBuddy 给 Hy4 preview 做了一轮专项优化,已经在 WorkBuddy 全量上线。官方称,这次主要针对复杂任务里的长思考和过度自我验证,在不损失任务效果的前提下,显著减少任务轮次和输入、输出 token 消耗。 Hy4 preview 是腾讯 8 月底发布的开源旗舰 MoE,总参数 770B、激活参数 49B,支持 1M 上下文,重点面向代码、办公和科研等长任务。腾讯发布时就主动把「复杂任务长思考、过度自我验证」列为已知问题。

09-01 07:37

FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s

动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。

07-25 03:18

AMD发布全开源MoE大模型Instella-MoE,16B参数规模挑战主流开源模型

火星财经消息,7 月 25 日,AMD 宣布推出全开源混合专家模型(MoE)Instella-MoE,该模型拥有 160 亿总参数,每个 Token 激活 28 亿参数,号称在同规模开源语言模型中具备领先性能。 AMD 表示,Instella-MoE 完全基于自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 软件栈从零训练完成,并采用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架构创新,以提升训练和推理效率。 性能测试显示,Instella-MoE-16B-A3B 基础模型平均得分达到 76.7 分,在全开源模型中排名领先,超过 SmolLM3-3B、OLMo-3-7B 等模型,并在仅激活 28 亿参数的情况下,与更大规模模型竞争。 此外,该模型支持 64K Token 长上下文处理,并完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等完整训练流程。 AMD 此次同步公开 Instella-MoE 全部模型权重、训练配置、数据配比、中间检查点及推理代码,推动开放 AI 模型研究与复现。 AMD 表示,Instella-MoE 展示了基于 AMD 硬件和开放软件生态进行大规模 MoE 模型训练的能力,未来将继续推进更大规模、更强推理能力和更高效率的开源语言模型研发。

06-23 07:19

杰富瑞:中国AI进入Token消耗扩张期,低成本模型重塑竞争格局

火星财经消息,6 月 23 日,杰富瑞在 6 月 22 日发布的 AI 系列报告中称,随着代码、Agent、办公和内容生成场景加速普及,AI 使用正在从「聊天」转向「工作流」,推动 Token 消耗快速增长。OpenRouter 数据显示,截至 6 月 22 日前一周,平台 Token 消耗环比增长 4.7%,达到 46.7 万亿。 在这一趋势中,中国模型的份额正在扩大。报告称,在 OpenRouter 口径下,中国模型当周 Token 消耗为 18.8 万亿,高于美国模型的 5.8 万亿。DeepSeek V4 Flash 以 4.94 万亿 Token 排名第一,其后是小米 MiMo-V2.5、MiniMax M3 和腾讯 Hy3 preview。 这一变化背后,是中国模型在性能和成本之间取得更具竞争力的平衡。杰富瑞称,中国模型与美国模型的智能差距正在收窄,而 API 调用成本仅为美国模型的一小部分。报告将这种成本优势归因于 MoE、注意力机制优化以及更高的模型算力利用率。 不过,Token 使用量上升并不意味着支出同步上升。杰富瑞的 Silicon Data LLM Token Expenditure Index 在 6 月 14 日至 19 日期间维持在 1.64 至 1.68,低于 5 月 31 日的 2.04,显示企业和开发者在扩大调用量的同时,也在转向更便宜、更高效的模型。 杰富瑞认为,这种「更多调用、更低单价」的组合将利好百度、阿里巴巴、腾讯、金山云、AI Labs 以及快手可灵等公司。云服务商将受益于模型调用和 MaaS 需求增长,AI 应用则有望在代码、Agent、办公软件和中长内容生成中找到更明确的商业化路径。 报告特别提到,火山引擎即将举行 FORCE 大会,市场将关注豆包大模型日 Token 消耗、订阅套餐定价、Seedance 2.0、TRAE、Arkclaw、Coze 等代码和 Agent 产品进展,以及 MaaS 收入目标。腾讯方面,微信 AI「小微」正在小规模测试,杰富瑞预计其可能在 2026 年第四季度正式发布。 应用端的用户基础也在扩大。5 月全球 AI 移动应用月活排名中,ChatGPT 仍以约 9.58 亿位居第一,但中国应用已占据多个前列位置,包括豆包、Qwen、夸克、DeepSeek 和元宝。报告认为,中国 AI 应用下一阶段的关键,将从用户增长转向高频场景渗透和商业化。 长期来看,杰富瑞引用 F&S 和 CAICT 数据称,中国大模型市场预计 2024 年至 2030 年复合增长率约为 64%,到 2030 年规模将超过 1000 亿元人民币。企业端和本地部署预计将成为主要收入来源。

09-19 08:22

DFlash团队进军Mac,27B模型跑到144Token/s

动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。

09-18 03:12

全国首个海洋Token工厂落地青岛

火星财经消息,9月17日,2026海洋合作发展论坛“探索深海——海洋未来产业的价值变革”平行论坛现场,全国首个面向海洋产业的专属智能要素供给平台——海洋Token(词元)工厂正式发布并落地青岛。据介绍,海洋Token工厂整体架构包含数据、算力、算法三个部分。数据方面,平台可提供海上作业规范、海洋环境要素等130多类涉海数据,建成面向海洋一线需求的专属数据库;算力方面,已形成总算力规模超过800P的海洋算力资源池,且仍在持续扩容;算法方面,汇聚观海、海星等20多个海洋领域专有大模型,以及“九天”大模型等30多款通用模型。按照规划,海洋Token工厂将深度贯穿深海油气勘探等实战场景,服务行业领军企业需求。(财联社)