智谱天猫首店:搜索暴涨50倍,带动token产品成交大涨160%
相关推荐
天猫上线Token充值中心,首批接入阿里云、智谱、Kimi、MiniMax
火星财经消息,9月3日,天猫正式上线AI 空间站( Token充值中心)。页面显示,该充值中心集合了阿里云、智谱、Kimi、MiniMax等国内大模型厂商的订阅服务,在售商品包括按周期订阅的Token Plan、Coding Plan以及按用量付费的充值方案,支持卡密或直充两种交付方式。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。
Kimi、MiniMax即将在天猫开店
火星财经消息,智谱电商平台首店落地天猫后,Kimi、MiniMax、阶跃星辰等多家大模型厂商也都在与天猫接洽中,未来将入驻天猫开设官方旗舰店,开售Token订阅套餐产品。 (上证报)
Gonka 上线 DeepSeek v4 Flash,全网等效算力接近2000张 H100
PANews 8月17日消息,去中心化 AI 算力网络 Gonka 正式上线 DeepSeek v4 Flash 0731,目前支持该模型、Kimi-K2.6 和 MiniMax M2.7。Gonka 通过聚合全球GPU资源,提供 OpenAI 和 Anthropic 兼容的模型调用服务,现全网等效算力接近2000张 H100。过去24小时处理196亿个 AI Token,其中 DeepSeek 超过120亿,占比逾六成。用户可通过社区 Broker 接入,目前 https://gonkarouter.io/ 提供20美金免费 Credits,近乎零成本使用主流AI模型。
DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用
据动察 Beating 监测,过去两年,大模型推理优化一直在拿 KV Cache 开刀。它是模型读完上下文后留下的中间计算结果,内容越长,越吃显存和带宽。DeepSeek-V2 借助 MLA,相比 DeepSeek 67B 将 KV Cache 减少 93.3%;Kimi Linear 相比全 MLA 又最多减少 75%。大家都在让长上下文更便宜。 但这些方案都有一道墙:缓存通常只能在同一个模型内部复用。Agent 从小模型切到大模型后,目标模型还得把前面几万甚至几十万 Token 重新计算一遍。模型路由越频繁,这笔重复计算越难忽略。 英伟达最新论文开始拆这堵墙。团队发现,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显的线性关系。用 500 段、每段 1024 Token 的文本校准一次,就能拟合出一套映射,把一个模型算好的 KV Cache 转给另一个模型继续用。 Qwen3-14B 切到 32B 时,32K 上下文重新计算约需 7 秒,转换缓存只要约 0.28 秒,快约 25 倍。换句话说,以后甚至可以先让小模型负责「读」:把长上下文算成 KV Cache;真正需要更强能力时,再把缓存转给大模型,让大模型直接开始「想」和生成。 这会让模型路由省下更多算力。现在让简单任务跑小模型,主要省的是生成成本;一旦切到大模型,长上下文往往还得由大模型重新算一遍。跨模型 KV Cache 如果做成熟,连这部分 prefill 都能交给小模型完成。Agent 可以长期用便宜模型维护上下文,碰到难题才叫醒大模型,而且不用每次都从头「读档」。
美国三机构指控 DeepSeek 等 6 家中国 AI 公司非法蒸馏
ChainCatcher 消息,美国国家安全局、FBI 和 CISA 发布联合报告,点名 DeepSeek、月之暗面、阿里、MiniMax、阶跃星辰和智谱。美方指控上述公司自至少 2024 年底起,批量调用 Claude、GPT、Gemini 和 Grok 的输出训练自家模型,累计涉及数百万次请求、数十亿 Token。报告列出具体模型,DeepSeek 被指用多款 Claude、GPT、Gemini 和 Grok 为 R1、V3 生成训练数据;月之暗面被指用 Claude Fable 5 数据训练 Kimi K3,用 GPT-4o 数据训练 Kimi K2。美方称这些公司还通过大量账号、第三方 API 聚合商和灰色中转站绕过地区限制,并用提示词尝试套出模型隐藏的推理过程,将此类行为称为恶意蒸馏。