返回 7*24 快讯
来源Blockbeats

Aethir推出自研开源LLM API平台Aethir Mesh,DeepSeek V4、Kimi K2.6等顶级模型推理全程跑在Aethir GPU上

BlockBeats 消息,6 月 4 日,据官方消息,Aethir 正式发布 Aethir Mesh——一个运行于 Aethir 去中心化 GPU 基础设施之上的自研开源大模型 API 平台,目前提供统一 API 端点直连 DeepSeek V4、Kimi K2.6、GLM-5.1、MiniMax-M2.5、Qwen3.6-27B 等主流开源模型。 与 OpenRouter 等聚合路由方案不同,Aethir Mesh 由 Aethir 自有算力直接提供推理服务,无转售溢价、无第三方路由。 Aethir Claw 用户可将 Mesh API Key 直接写入智能体配置,实现从 VPS 托管到模型推理的全栈闭环,推理数据全程不离开 Aethir 生态。 平台现已上线:https://agent.aethir.com/twitterCNmesh
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-04 13:58

DeepSeek API出现性能下降情况,现已恢复

8月4日,海外开源AI Coding Agent平台OpenCode发文称:DeepSeek V4 Flash当前因前所未有的访问量而出现容量不足问题,可能会遇到报错,正在紧急修复中。也有网友发文表示:DeepSeek V4 Flash官方API上午几乎不可用,和Kimi K3刚发布时情况差不多,国产模型能力赶上来了,但可用性与容量仍有改善空间。DeepSeek官方披露,今日上午DeepSeek V4 Flash API出现性能下降情况,目前问题已解决,服务已恢复。(一财)

07-21 16:52

国家超算互联网上线Kimi K3 API服务,3万亿参数大模型一键调用

火星财经消息 7月21日,国家超算互联网近日上线Kimi K3模型API调用服务,企业与开发者无需繁琐环境配置,即可快速调用这一2.8万亿参数开源大模型能力。目前,该API兼容OpenAI与Anthropic接口规范,支持快速、低成本搭建多元化AI应用。当前,超算互联网模型API服务已汇聚MiniMax、DeepSeek、Qwen、GLM、Kimi等开源大模型,涵盖文本生成、图片生成、视频生成、语音合成、多模态等全维度AI能力。(广角观察)

07-21 10:28重要

华尔街机构:Kimi K3并非「DeepSeek时刻」再现,反而强化算力需求

火星财经消息,7 月 21 日,Kimi K3 发布后,美股半导体板块因市场担忧出现「DeepSeek 时刻 2.0」而下跌,但瑞银、野村、美银证券和花旗均认为,这款模型并未削弱算力需求,反而可能推动 AI 基础设施需求进一步扩张。 Kimi K3 拥有 2.8 万亿参数、100 万 token 上下文窗口,并支持常开推理、原生多模态及 MoE 架构。机构认为,其规模和长上下文将增加 KV 缓存占用,并推高 HBM、服务器 DDR5、企业级固态硬盘、云基础设施及高速互联需求。花旗将这一趋势称为「又一次杰文斯悖论」,即模型效率和价格改善可能带来更多应用与 token 消耗。 瑞银指出,开源模型通常因上下文窗口更长而更加依赖内存和存储;花旗认为,K3 大规模部署或需要由 64 块以上 GPU 组成的超节点。野村则认为,全球大模型竞争将促使前沿实验室和超大规模云平台继续投入,利好台积电、英伟达、存储厂商、光模块供应商及数据中心运营商等 AI 基础设施环节。 不过,美银证券提示,若模型效率提升速度持续超过工作负载增长,而实际使用量未能同步扩张,AI 基础设施建设仍可能出现一定回落。

08-13 19:29

DeepSeek发布API调价公告

火星财经消息,DeepSeek发布API调价公告,将对 DeepSeek API 价格进行更新调整,采用峰谷定价,空闲时段价格为高峰时段价格的一半。高峰时段为北京时间 9:00-12:00、14:00- 18:00(其余为空闲时段)。新价格将于北京时间 2026年8月17日 00:00开始生效。deepseek-v4-pro高峰时段百万tokens输出,最高价格达27元。 (科创板日报记者 黄心怡)

08-10 22:29重要

智谱API用户近700万,新启用超5万块国产AI芯片缓解算力压力

BlockBeats 消息,8 月 10 日,据《晚点 LatePost》报道,智谱 MaaS 开放平台注册用户规模已接近 700 万,较 7 月初增长约 200 万,其中企业客户数量达到 2.3 万家。其开发者产品 ZCode 上线一个月用户突破 100 万。 报道称,智谱今年以来 ARR(年度经常性收入)增长约 15 倍。市场人士透露,智谱当前 ARR 可能达到 20 亿美元,但该数据尚未获官方确认。 随着模型调用需求快速增长,智谱正在扩大国产算力基础设施。据了解,智谱已启用超过 5 万块国产 AI 算力芯片,以缓解日益增长的推理需求。此前市场传闻智谱已建设规模达 1GW 的国产 AI 算力基础设施。 智谱增长主要受编程场景需求爆发推动。GLM-5 模型发布后,公司 ARR 快速增长,目前 API 业务成为核心收入来源。智谱同时持续优化推理效率,通过 KV 缓存拆分、推理网络架构等技术提升算力利用率。 此外,智谱 7 月推出高速版 API,每秒生成 Token 数量达到 400,相比常规 API 速度提升约 8 倍;7 月 31 日,公司重新开放 Coding Plan 购买,并大幅调整价格,Lite 版本月费升至 118 元。 行业人士认为,随着 AI 编程需求持续增长,推理效率优化将成为大模型公司的核心竞争力。谁能在相同算力下生成更多 Token,谁将在成本和商业化方面占据优势。 目前,智谱、Kimi、DeepSeek 等中国大模型企业均面临算力瓶颈与模型竞争压力,市场预计多家公司将在 8 月推出新一代模型,AI 大模型竞争将进一步加剧。

08-10 12:17

DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用

据动察 Beating 监测,过去两年,大模型推理优化一直在拿 KV Cache 开刀。它是模型读完上下文后留下的中间计算结果,内容越长,越吃显存和带宽。DeepSeek-V2 借助 MLA,相比 DeepSeek 67B 将 KV Cache 减少 93.3%;Kimi Linear 相比全 MLA 又最多减少 75%。大家都在让长上下文更便宜。 但这些方案都有一道墙:缓存通常只能在同一个模型内部复用。Agent 从小模型切到大模型后,目标模型还得把前面几万甚至几十万 Token 重新计算一遍。模型路由越频繁,这笔重复计算越难忽略。 英伟达最新论文开始拆这堵墙。团队发现,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显的线性关系。用 500 段、每段 1024 Token 的文本校准一次,就能拟合出一套映射,把一个模型算好的 KV Cache 转给另一个模型继续用。 Qwen3-14B 切到 32B 时,32K 上下文重新计算约需 7 秒,转换缓存只要约 0.28 秒,快约 25 倍。换句话说,以后甚至可以先让小模型负责「读」:把长上下文算成 KV Cache;真正需要更强能力时,再把缓存转给大模型,让大模型直接开始「想」和生成。 这会让模型路由省下更多算力。现在让简单任务跑小模型,主要省的是生成成本;一旦切到大模型,长上下文往往还得由大模型重新算一遍。跨模型 KV Cache 如果做成熟,连这部分 prefill 都能交给小模型完成。Agent 可以长期用便宜模型维护上下文,碰到难题才叫醒大模型,而且不用每次都从头「读档」。