值得买科技OpenHubs首批上线Qwen3.8-Max
相关推荐
国家超算互联网上线Kimi K3 API服务,3万亿参数大模型一键调用
火星财经消息 7月21日,国家超算互联网近日上线Kimi K3模型API调用服务,企业与开发者无需繁琐环境配置,即可快速调用这一2.8万亿参数开源大模型能力。目前,该API兼容OpenAI与Anthropic接口规范,支持快速、低成本搭建多元化AI应用。当前,超算互联网模型API服务已汇聚MiniMax、DeepSeek、Qwen、GLM、Kimi等开源大模型,涵盖文本生成、图片生成、视频生成、语音合成、多模态等全维度AI能力。(广角观察)
DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用
据动察 Beating 监测,过去两年,大模型推理优化一直在拿 KV Cache 开刀。它是模型读完上下文后留下的中间计算结果,内容越长,越吃显存和带宽。DeepSeek-V2 借助 MLA,相比 DeepSeek 67B 将 KV Cache 减少 93.3%;Kimi Linear 相比全 MLA 又最多减少 75%。大家都在让长上下文更便宜。 但这些方案都有一道墙:缓存通常只能在同一个模型内部复用。Agent 从小模型切到大模型后,目标模型还得把前面几万甚至几十万 Token 重新计算一遍。模型路由越频繁,这笔重复计算越难忽略。 英伟达最新论文开始拆这堵墙。团队发现,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显的线性关系。用 500 段、每段 1024 Token 的文本校准一次,就能拟合出一套映射,把一个模型算好的 KV Cache 转给另一个模型继续用。 Qwen3-14B 切到 32B 时,32K 上下文重新计算约需 7 秒,转换缓存只要约 0.28 秒,快约 25 倍。换句话说,以后甚至可以先让小模型负责「读」:把长上下文算成 KV Cache;真正需要更强能力时,再把缓存转给大模型,让大模型直接开始「想」和生成。 这会让模型路由省下更多算力。现在让简单任务跑小模型,主要省的是生成成本;一旦切到大模型,长上下文往往还得由大模型重新算一遍。跨模型 KV Cache 如果做成熟,连这部分 prefill 都能交给小模型完成。Agent 可以长期用便宜模型维护上下文,碰到难题才叫醒大模型,而且不用每次都从头「读档」。
MiniMax H3开源尚未结束:2K视频模块即将补齐,本地生成还会提速
据动察 Beating 监测,MiniMax H3 团队在 Reddit AMA 中透露,H3 还有几块能力会继续开放。现在必须通过官方 API 才能使用的 2K 视频模块已经确定会放出,同时还会开放一套减少计算量的加速方案,让本地运行 H3 更快、更省资源。 目前 H3 本地只能完整生成 768p 视频。后续开放的 2K 模块会把已有视频和原始参考素材重新送进模型,再生成一遍高分辨率视频,进一步还原文字、人物和画面细节。未来有望在本地跑完整的 2K 工作流。 团队还承认了两个现有问题。H3 在同时参考图片、视频和声音生成时,画面确实更容易发糊;远景和小人物也容易出现糊脸、变形。这些都属于模型本身的问题,MiniMax 已经在继续优化。
DeepSeek API出现性能下降情况,现已恢复
8月4日,海外开源AI Coding Agent平台OpenCode发文称:DeepSeek V4 Flash当前因前所未有的访问量而出现容量不足问题,可能会遇到报错,正在紧急修复中。也有网友发文表示:DeepSeek V4 Flash官方API上午几乎不可用,和Kimi K3刚发布时情况差不多,国产模型能力赶上来了,但可用性与容量仍有改善空间。DeepSeek官方披露,今日上午DeepSeek V4 Flash API出现性能下降情况,目前问题已解决,服务已恢复。(一财)
港股智谱大跌20%,MiniMax跌逾11%
火星财经消息,7 月 28 日,智谱股价在香港市场一度跌 20%,MiniMax 股价跌逾 11%,此前月之暗面开放 Kimi K3 模型供公众下载。
高盛:MiniMax-W重申“买入”评级 目标价860港元
高盛发布研报称,MiniMax-W的多模态策略为其关键差异化优势,H3模型已进入推出前最后阶段,预期即将面世,相信会对多模态行业格局带来深远影响,重申MiniMax“买入”评级,目标价860港元。高盛指出,MiniMax创办人兼首席执行官闫俊杰近日在分析员会议上,透露未来重点将专注于为旗下每个模型追求最佳的性价比,特别是目前M3模型每日处理万亿级Token,开放平台/API收入已达健康毛利率水平,目标最终实现高双位数毛利率,又预期9月至10月将推出的M3 Pro将拥有显著成本效益。(新浪财经)