返回 7*24 快讯
来源MarsBit

华为云发布新一代ModelArts Next模型训推平台

火星财经消息 6月5日消息,华为云正式发布新一代模型训推平台ModelArts Next,提供RL服务、机密推理、模型路由、模型矩阵四大核心能力,MaaS模型路由支持成本优先、效果优先、均衡模式三种策略;企业级RLaaS服务实现一分钟创建任务、全程可视化观测、训推一致性保障;机密推理能力依托硬件级可信执行环境,在AI编码、金融风控等高敏感场景中,确保模型处理的数据“只进不出”;模型矩阵能力实现了主流SOTA模型(如DeepSeek、Kimi、智谱GLM等)Day0上线,结合自研模型Pangu,能力覆盖编程、多模态等丰富场景。(广角观察)
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-10 12:17

DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用

据动察 Beating 监测,过去两年,大模型推理优化一直在拿 KV Cache 开刀。它是模型读完上下文后留下的中间计算结果,内容越长,越吃显存和带宽。DeepSeek-V2 借助 MLA,相比 DeepSeek 67B 将 KV Cache 减少 93.3%;Kimi Linear 相比全 MLA 又最多减少 75%。大家都在让长上下文更便宜。 但这些方案都有一道墙:缓存通常只能在同一个模型内部复用。Agent 从小模型切到大模型后,目标模型还得把前面几万甚至几十万 Token 重新计算一遍。模型路由越频繁,这笔重复计算越难忽略。 英伟达最新论文开始拆这堵墙。团队发现,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显的线性关系。用 500 段、每段 1024 Token 的文本校准一次,就能拟合出一套映射,把一个模型算好的 KV Cache 转给另一个模型继续用。 Qwen3-14B 切到 32B 时,32K 上下文重新计算约需 7 秒,转换缓存只要约 0.28 秒,快约 25 倍。换句话说,以后甚至可以先让小模型负责「读」:把长上下文算成 KV Cache;真正需要更强能力时,再把缓存转给大模型,让大模型直接开始「想」和生成。 这会让模型路由省下更多算力。现在让简单任务跑小模型,主要省的是生成成本;一旦切到大模型,长上下文往往还得由大模型重新算一遍。跨模型 KV Cache 如果做成熟,连这部分 prefill 都能交给小模型完成。Agent 可以长期用便宜模型维护上下文,碰到难题才叫醒大模型,而且不用每次都从头「读档」。

07-21 10:28重要

华尔街机构:Kimi K3并非「DeepSeek时刻」再现,反而强化算力需求

火星财经消息,7 月 21 日,Kimi K3 发布后,美股半导体板块因市场担忧出现「DeepSeek 时刻 2.0」而下跌,但瑞银、野村、美银证券和花旗均认为,这款模型并未削弱算力需求,反而可能推动 AI 基础设施需求进一步扩张。 Kimi K3 拥有 2.8 万亿参数、100 万 token 上下文窗口,并支持常开推理、原生多模态及 MoE 架构。机构认为,其规模和长上下文将增加 KV 缓存占用,并推高 HBM、服务器 DDR5、企业级固态硬盘、云基础设施及高速互联需求。花旗将这一趋势称为「又一次杰文斯悖论」,即模型效率和价格改善可能带来更多应用与 token 消耗。 瑞银指出,开源模型通常因上下文窗口更长而更加依赖内存和存储;花旗认为,K3 大规模部署或需要由 64 块以上 GPU 组成的超节点。野村则认为,全球大模型竞争将促使前沿实验室和超大规模云平台继续投入,利好台积电、英伟达、存储厂商、光模块供应商及数据中心运营商等 AI 基础设施环节。 不过,美银证券提示,若模型效率提升速度持续超过工作负载增长,而实际使用量未能同步扩张,AI 基础设施建设仍可能出现一定回落。

07-17 10:30

傍上Kimi与DeepSeek,九安医疗上演四天三板

BlockBeats 消息,7 月 17 日,据 Bitget 行情数据,伴随 Kimi K3 发布,叠加 DeepSeek 明年上市预期,A 股九安医疗上演四天三板,今日 10% 涨停。 消息面上九安医疗同时参股 DeepSeek 与月之暗面(Kimi),Kimi K3 昨日发布后登顶前端代码榜,领先 Claude Fable 5。同时网传 DeepSeek 最快明年二季度登陆上海科创板。 此外,九安医疗「AIoT 糖尿病家庭医助」项目持续推进,已组建 30 余人 AI 团队,基于约 47.98 万用户私域数据训练垂直大模型,预计 2026 年第二季度上线完整版 AI 模块进行小范围灰度测试。

06-29 10:01

Coinbase通过默认采用GLM和Kimi等开放权重模型,将AI支出削减近半

PANews 6月29日消息,Coinbase首席执行官Brian Armstrong发文分享了公司在AI支出方面的优化经验。他指出,在代币使用量指数级增长的同时,通过更好的默认设置、路由和缓存策略,已将AI支出削减近半,而非依赖使用上限和警报机制。在默认设置方面,Coinbase正通过LLM网关将开源权重模型(如智谱的GLM 5.2和月之暗面的Kimi 2.7)设为默认选项,同时鼓励工程师为特定任务选择正确模型。该公司91%的员工从未触及使用上限,因此团队选择转向更便宜的默认设置而非降低上限。

06-27 19:37

Coinbase已将AI支出削减近半,尝试将GLM 5.2、Kimi 2.7等开放权重模型设为默认选项

火星财经消息,6 月 27 日,Coinbase CEO Brian Armstrong 发文表示,若想在 token 使用量指数级增长的同时保持 AI 支出稳定,关键不在于设置使用摩擦或支出提醒,而在于更好的默认模型、路由和缓存机制。Coinbase 正在通过 LLM 网关尝试默认使用 GLM 5.2、Kimi 2.7 等开放权重模型,同时仍鼓励工程师根据任务选择合适模型。其称,91% 的员工从未触及使用上限,因此公司没有选择降低额度并增加提醒,而是转向更低成本的默认模型。 在模型路由方面,Coinbase 会在自定义流程中预处理提示词,并根据缓存命中率和模型定价,将任务路由至最合适模型。例如,规划阶段可能需要前沿模型,但执行阶段使用前沿模型可能过度。其认为,未来不应由人类选择模型,AI 可以自动完成该任务。 Armstrong 还表示,缓存未命中是推高成本最容易的方式。Coinbase 的请求均具备缓存感知能力,以便尽可能复用热缓存。例如,在正确实现缓存后,LibreChat 的缓存命中率已从 5% 提升至 60%。此外,Coinbase 也要求工程师保持上下文精简,包括切换任务时开启新会话、缩小文件上下文范围、断开未使用工具等。目标不是压制 AI 使用量,而是构建可支撑指数级增长的基础设施。通过上述实践,Coinbase 已将 AI 支出削减近一半,同时 token 使用量仍在继续增长。

07-21 16:52

国家超算互联网上线Kimi K3 API服务,3万亿参数大模型一键调用

火星财经消息 7月21日,国家超算互联网近日上线Kimi K3模型API调用服务,企业与开发者无需繁琐环境配置,即可快速调用这一2.8万亿参数开源大模型能力。目前,该API兼容OpenAI与Anthropic接口规范,支持快速、低成本搭建多元化AI应用。当前,超算互联网模型API服务已汇聚MiniMax、DeepSeek、Qwen、GLM、Kimi等开源大模型,涵盖文本生成、图片生成、视频生成、语音合成、多模态等全维度AI能力。(广角观察)