YC等美国AI初创联名反对封杀Kimi、Qwen:封禁只会养肥Anthropic
相关推荐
Kimi K3发布后,Anthropic预期估值蒸发1264亿美元
据动察 Beating 监测,Kimi K3 发布后,市场开始下调 Anthropic 的上市估值预期。 Stock Analysis 基于未上市股权交易平台 Hiive 的数据估算,Anthropic 当前隐含估值约为 8386 亿美元。这比公司 5 月融资时的 9650 亿美元低 13.1%,相差约 1264 亿美元。 其他交易平台也出现了类似变化。《卫报》称,Kimi K3 发布后的几个交易日内,IG 平台对 Anthropic 上市估值的押注减少 2320 亿美元。
SemiAnalysis:Kimi K3跻身全球第三,或揭示OpenAI与Anthropic隐藏利润空间
火星财经消息,7 月 20 日,SemiAnalysis 分析师 Jordan Nanos 和 Max Kan 近日围绕月之暗面旗下模型 Kimi K3 展开分析,认为该模型在综合基准测试中超越 Google Gemini,不仅反映中美 AI 模型差距缩小,也为推测 Anthropic 和 OpenAI 等闭源 AI 公司的商业模式提供了新视角。 根据 SemiAnalysis 综合评价,Kimi K3 目前排名全球第三,仅次于 Fable 5 和 GPT-5.6,并超过 Google Gemini。分析师表示,虽然这一结果并不意味着 Google AI 业务出现重大问题,但 Kimi K3 公开披露的参数规模、性能和定价,为外界估算闭源模型经济价值提供了参考。 Kimi K3 拥有 2.8 万亿参数,远超多数公开模型。Jordan Nanos 表示,如此规模的模型无法部署在单个英伟达 B200 GPU 上,需要 GB300、B300 级别系统或 AMD MI355X 等更高规格硬件支持。他据此推测,Anthropic 和 OpenAI 的旗舰闭源模型可能也处于类似参数规模,而非拥有数量级领先优势。 在商业模式方面,Kimi K3 上线价格接近 Anthropic Sonnet 系列模型,输入价格约为每百万 token 3 美元,输出价格约为每百万 token 15 美元,较上一代 Kimi 模型价格上涨约 3 倍。 Max Kan 认为,如果月之暗面并非长期亏损运营,那么 Anthropic 和 OpenAI 针对类似规模模型收取更高价格,意味着其 API 业务可能具备较高利润率。「出售 API token 可能比 SaaS 更赚钱。」他说。 不过,两位分析师强调,上述判断并非基于 AI 公司的公开财务数据,而是通过 Kimi K3 的参数、价格和性能表现进行反向推演。
Meta要终结中国开源模型?Muse核心成员唱衰Kimi,结果被评论区围攻
据动察 Beating 监测,Meta 超级智能实验室成员、Muse Spark 核心贡献者 Zengyi Qin 公开唱衰中国开源模型。他称,Meta 有多一个数量级的算力和更好的数据,Muse Spark 最终会超过 Kimi 等中国模型。 他还把判断推到了商业层面:JPMorgan 等美国大客户会因为合规改用美国开放模型,中国实验室也会失去这部分推理收入。Meta 自己有 Facebook、Instagram 挣钱,中国模型公司却更依赖模型收入。 评论区很快开始反问:Meta 过去两年一直不缺算力和数据,怎么没压住中国模型?还有人追问,JPMorgan 到底给 Kimi 贡献了多少收入。 有人甚至讽刺,如果这就是「Muse Spark 核心成员」的推理水平,反而开始担心 Muse 的模型表现。 Muse Spark 1.2 即将开放权重,Meta 确实会给 Kimi、DeepSeek、Qwen 多添一个重量级美国对手。但从「多了一个强敌」直接推到「中国模型会被算力碾压、美国收入也会流失」,中间还差了一大截。
DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用
据动察 Beating 监测,过去两年,大模型推理优化一直在拿 KV Cache 开刀。它是模型读完上下文后留下的中间计算结果,内容越长,越吃显存和带宽。DeepSeek-V2 借助 MLA,相比 DeepSeek 67B 将 KV Cache 减少 93.3%;Kimi Linear 相比全 MLA 又最多减少 75%。大家都在让长上下文更便宜。 但这些方案都有一道墙:缓存通常只能在同一个模型内部复用。Agent 从小模型切到大模型后,目标模型还得把前面几万甚至几十万 Token 重新计算一遍。模型路由越频繁,这笔重复计算越难忽略。 英伟达最新论文开始拆这堵墙。团队发现,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显的线性关系。用 500 段、每段 1024 Token 的文本校准一次,就能拟合出一套映射,把一个模型算好的 KV Cache 转给另一个模型继续用。 Qwen3-14B 切到 32B 时,32K 上下文重新计算约需 7 秒,转换缓存只要约 0.28 秒,快约 25 倍。换句话说,以后甚至可以先让小模型负责「读」:把长上下文算成 KV Cache;真正需要更强能力时,再把缓存转给大模型,让大模型直接开始「想」和生成。 这会让模型路由省下更多算力。现在让简单任务跑小模型,主要省的是生成成本;一旦切到大模型,长上下文往往还得由大模型重新算一遍。跨模型 KV Cache 如果做成熟,连这部分 prefill 都能交给小模型完成。Agent 可以长期用便宜模型维护上下文,碰到难题才叫醒大模型,而且不用每次都从头「读档」。
字节10万亿参数模型已开训,规模逼近Anthropic Mythos5
据动察 Beating 监测,英国《金融时报》援引三名知情人士称,字节跳动已经开始预训练一款最高 10 万亿参数的大模型。项目仍处于早期阶段,最终规模尚未确定。如果按上限训练,它将达到 Kimi K3 的三倍以上,成为目前已知中国团队中参数规模最大的模型。 字节这次直接把模型尺寸推到了 Anthropic 旗舰附近。Anthropic 从未公布 Mythos 5 的参数量,但《金融时报》援引行业估算称,Mythos 5 约为 8 万亿参数,Fable 5 约为 5 万亿。字节新模型若做到 10 万亿,至少在参数规模上已经进入美国最前沿闭源模型的同一量级。 这款模型目前还在预训练(用海量数据训练模型的基础能力)。《金融时报》称,这一阶段通常需要 3 至 6 个月,之后还要继续后训练,顺利才会发布。参数更多也不等于能力一定更强,最终表现还取决于架构、训练数据和训练方法。 张一鸣近期在 Seed 内部明确反对蒸馏竞争对手模型,要求团队接受短期落后,靠自研冲击世界第一梯队。这款最高 10 万亿参数的新模型,是字节目前最激进的一次规模下注。
Kimi K3也「越狱」了?一查又是沙箱没断网
据动察 Beating 监测,继 OpenAI、Anthropic 之后,Kimi K3 也喜提「AI 逃出沙箱」。WIRED 直接把标题写成「中国最强 AI 模型之一也突破了隔离」,听起来像 Kimi 自己把沙箱攻破了。 结果一看,又是门没关严。安全公司 Frontier Security 测试 Kimi K3 时,沙箱存在出站网络漏洞,本应隔离公网,却还能访问 GitHub。Kimi 自己探测网络发现这条路能走,索性直接克隆官方 benchmark 仓库,从里面找答案。 整起事件没有攻破一个正常配置的沙箱,也没有黑进任何公司。 说白了,就是监考老师忘了断网,考生发现 GitHub 还能上,于是直接翻答案。到了新闻标题里,就成了「AI 突破隔离」。现在「越狱」的门槛,已经低到门没锁也算越狱了。