Jina魔改DeepSeek-OCR,自测14款里页面吞吐第一
相关推荐
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
动察 Beating AI 快讯,伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。 FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。 论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。 FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
传百度文心连补两员大将:北美Frontier Lab+DeepSeek OCR核心作者
动察 Beating AI 快讯,百度基础模型研发部(BMU)正在补强核心模型团队。知情人士称,负责人孙天祥从北美某 Frontier Lab 引入了一名花名「武钦」的研究员,和团队一起加强文心预训练。对方过去两年参与过数代前沿大模型研发,但真实姓名和原单位都没有披露。另一边,原 DeepSeek 研究员魏浩然及其团队也从百度内部转入 BMU,由他担任文心多模态算法负责人。 魏浩然这条线其实早有伏笔。6 月百度开源 Unlimited OCR 时,三名核心贡献者中的技术总监只署名「YY」,社区当时就猜测是魏浩然。魏浩然是 DeepSeek-OCR 和 DeepSeek-OCR 2 第一作者;DeepSeek-V4 技术报告也把他标记为已经离职。 Unlimited OCR 发布时在 OmniDocBench v1.6 拿到 93.92%,一度刷新端到端 OCR 纪录。它沿用了 DeepSeek-OCR 的 DeepEncoder,并重新设计解码端的注意力机制,可以一次连续解析几十页文档。 孙天祥 7 月刚接手 BMU,同时进入百度模型委员会,月底又进入百度技术战略委员会。两个月后,文心的预训练和多模态两条核心线都开始补人。
DeepSeek便宜到离谱:OpenCode两个月狂跑90万亿Token,账单仅92万美元
据 动察 Beating 监测,AI 编程工具 OpenCode 数据显示,6 月 10 日至 8 月 4 日,DeepSeek V4 Flash 在 OpenCode Go 上累计处理 90 万亿个 Token,总支出约 91.7 万美元。平均每 1 亿 Token 只需约 1.02 美元。 低成本主要来自缓存。该模型 96% 的输入 Token 命中缓存,平均每次会话处理 870 万个 Token,成本仅约 0.09 美元。
DeepSeek V4Flash在OpenCode爆量:单日跑掉8万亿Token
据动察 Beating 监测,AI 编程工具 OpenCode 披露,接入 DeepSeek V4 Flash 当天,OpenCode 用户跑了 8 万亿个 Token,其中 5 万亿来自免费计划,3 万亿来自付费订阅 OpenCode Go。 过去一周,它已占 OpenCode 全部 Token 用量的 55%,排名第一。
腾讯混元Hy4重做底层:DeepSeek稀疏注意力+智谱IndexCache一起上
动察 Beating AI 快讯,腾讯混元 Hy4 preview 这次除了把模型做大,底层架构也大改了一轮。上一代 Hy3 使用传统全注意力,Hy4 改成了 Gated DSA,也就是 DeepSeek Sparse Attention 的门控版本。模型面对超长文本时,不再把前面所有内容都重新算一遍,而是先挑出最相关的部分重点处理。 Hy4 还给 DSA 加上了 IndexCache。模型每一层原本都要重新判断「哪些内容最重要」,现在部分层可以直接复用前面已经挑好的结果,少做很多重复计算。 腾讯明确表示,这套设计受到 DeepSeek 和 GLM 启发。 另一处变化是残差结构。传统 Transformer 可以粗略理解成只有一条信息主干,Hy4 用 iHC 把它扩成了 4 条,让模型在很深的网络里能同时保留更多信息。MoE 专家数量也从 Hy3 的 192 个增加到 256 个路由专家 + 1 个共享专家,每个 Token 选择 8 个路由专家,同时始终经过共享专家。
DeepSeek Flash 涨价后流量腰斩,留下近 10 万亿 Token 日缺口
火星财经消息,OpenCode CEO Jay V 表示,DeepSeek V4 Flash 自 8 月 1 日上线后,在 OpenCode 上的日 Token 消耗量从约 3 万亿飙升至 18 万亿,两周内增长 6 倍,接近 OpenRouter 全平台日处理量。其定价约为 Fable 的 1/350、GPT-5.6 Sol 的 1/175、Claude Sonnet 的 1/70,被用户视为“便宜到无需计量的 AI”。8 月 16 日 DeepSeek 将高峰时段价格上调 5 倍(非高峰时段 2.5 倍)后,模型日 Token 消耗量从峰值回落超过 50%。Jay V 认为涨价系应对 GPU 成本上升的被动之举。目前 OpenCode 正寻找能以原价承接流量的供应商,约需 1000 块 B300 才能支撑当前需求。DeepSeek Flash 暴露了 AI 模型市场的“不可能三角”——便宜、强大、大规模稳定供应难以兼得。涨价后,OpenCode Go 已将配额从 60 美元降至 15 美元后又恢复至 30 美元,并引入峰谷费率机制。