「牛来」模型 ?OpenRouter又放匿名模型,Ox Alpha疑似小米MiMo新模型
相关推荐
小米MiMo-V2.5登OpenRouter全球周榜、月榜双第一
火星财经消息,7月27日,OpenRouter最新数据显示,小米MiMo-V2.5登上全球大模型调用量周榜、月榜双第一,成为当周全球调用量唯一突破10T的模型。5月以来,MiMo-V2.5全球调用量持续攀升,单周token量从1.46T逐步升至10.46T,两个月增长约 616%。
Claude Code官方省Token指南:11个技巧让额度用得更久
据动察 Beating 监测,Anthropic 发布 Claude Code 省 Token 指南。核心就一句:上下文越长,后面每一轮越贵。聊天、文件和命令输出都会继续占用 Token,也会因此更快消耗额度。 整理下来,有 11 个最实用的技巧: 1. 换任务就 /clear。一个任务做完就清掉上下文。还在做同一个任务,只是前面的内容没用了,再用 /compact 压缩。长会话越往后越贵,因为每一轮都会重新带上之前的内容。 2. 模型和 effort 开局就选好。中途执行 /model 或 /effort 会打掉 prompt cache(提示词缓存),下一轮需要重新处理整段上下文。Fast mode 也是一样,最好一开始就开。 3. 离开前先 /compact。订阅用户的缓存约 1 小时过期,API Key 默认约 5 分钟。缓存过期后再回来,下一轮通常要重新处理整个上下文。趁缓存还在时压缩更便宜。 4. 最近几轮跑偏就 /rewind。它只删掉后面几轮,前面的缓存还能继续用。/compact 会重写整个对话,成本更高。 5. 文件直接用 @ 文件名。Claude 会在第一轮直接拿到文件,可以省掉一次 Read 或搜索。一个文件通常只需要 @ 一次,重复 @ 反而可能把同一文件再塞一份进上下文。 6. Prompt 尽量说具体。与其说「测试挂了」,不如直接告诉 Claude 哪个测试、哪个文件。否则它可能先 grep、搜索、读一堆文件,这些结果之后每一轮都会继续占上下文。 7. 测试和日志尽量少输出。Build、测试、git log 的输出都会留在上下文。可以加 quiet 参数、只输出错误,或者用 tail 截断。Claude Code 对超过 3 万字符的命令输出反而会自动写入文件,只把摘要和路径留在会话里。 8. 用 /context 查启动负担。新会话一开始就可以看 CLAUDE.md、MCP 和工具定义占了多少上下文。CLAUDE.md 只放通用规则,专项流程放进按需加载的 Skill,不用的 MCP 用 /mcp 关掉。 9. 简单任务用更小的模型、更低的 effort。大模型输入和输出都更贵,thinking 也属于输出 Token。纯执行类任务没必要一直用最高档模型和最高推理强度。 10. 大日志交给 subagent,小任务别滥用。Subagent 有独立上下文,只把最终结果带回主会话,适合读大量日志、搜索文档。但它也要重新读文件、自己跑多轮,小任务反而可能更贵。搜索、读日志这类任务还可以指定 Haiku 或 Sonnet。 11. /loop 最好单独开会话。每次循环都是完整的一轮,会重复携带当前会话的全部上下文。如果间隔超过缓存时间,还可能叠加一次缓存失效。官方建议另开终端,用一个干净会话专门跑循环。 Anthropic 的建议归根结底就是:少塞无用内容,任务结束及时清,会话别拖得太长。
DeepSeek把谷歌挤下榜首,拿下OpenRouter本周调用量第一
据动察 Beating 监测,模型聚合平台 OpenRouter 数据显示,DeepSeek 文本请求量本周已达到 2.99 亿次,占平台总量的 27.1%,超过此前长期领先的谷歌。谷歌同期为 2.77 亿次、25.0%,OpenAI 以 1.85 亿次、16.8% 排名第三。 这个榜单按模型厂商合并统计文本 API 请求次数。DeepSeek V4 Flash、V4 Pro 等模型产生的调用,都会记入 DeepSeek 名下。 DeepSeek 的增长主要由 V4 系列推动。OpenRouter 此前披露,V4 发布后,DeepSeek 的 Token 份额半年内大致翻倍,增长主要来自 Agent 任务。V4 Flash 上线一个月后,已占 DeepSeek Agent Token 用量的 70%。Agent 完成一次任务往往会连续调用模型多次,也更容易推高请求量。
模型太多不会选?OpenRouter推出Ori Eval替AI应用挑模型
据动察 Beating 监测,OpenRouter 推出 Ori Eval,帮开发者判断自己的 AI 应用该用哪个模型。它会扫描代码库,找到调用模型的位置,再用项目里的真实任务跑遍多个候选模型。 开发者可以指定更看重效果、速度还是成本。评测期间,Ori Eval 会锁定测试框架、模型配置和推理强度,最后直接给出排名,避免不同模型因为测试条件不同而无法比较。 它除了判断回答好不好,还会检查 Agent 是否调用了正确工具、避开不该执行的操作。开发者用自然语言描述一个 Bug,它就能生成一条复现问题的测试。修复后接入 GitHub Actions,后续换模型、改 prompt 或改代码,都能自动检查问题是否再次出现。 公开榜单只能比较模型的通用能力,无法直接回答客服、搜索或编程产品该选哪一款。Ori Eval 把逐个手动试模型,变成一套基于真实业务的自动选型流程。
谷歌拆散诺奖AlphaFold团队,主力转向Gemini和科学Agent
据动察 Beating 监测,谷歌 DeepMind 已拆散 AlphaFold 原班团队。过去一年,多数论文作者被调往 Gemini、酶设计、核聚变和基因组学等项目。接近四分之一的全职作者已经离开公司。 AlphaFold 可以预测蛋白质的三维结构,帮助 Demis Hassabis 和 John Jumper 获得 2024 年诺贝尔化学奖。它也是 DeepMind 过去集中一个团队攻克一个科学难题的代表项目。 这种单点攻关不再是唯一主线。DeepMind 现在更想用 Gemini 打造通用科学助手,帮助研究人员完成更多工作,并逐步自动化部分科研流程。 今年 6 月,Jumper 已宣布加入 Anthropic。AlphaFold 核心成员 Jonas Adler 和 Alexander Pritzel 也将同行。AlphaFold 的成果仍由 Alphabet 旗下 Isomorphic Labs 用于药物研发。
ZCode免费送1亿GLM-5.3 Token,太火导致上线一小时就暂停
据动察 Beating 监测,智谱旗下编程 Agent 工具 ZCode,给 GLM-5.3 推出了一场周末免费活动。新用户首次登录 ZCode,即可获得 1 亿 GLM-5.3 Token,用于 AI 编程、代码修改和 Agent 任务。 活动原定北京时间 8 月 16 日 0 点开始,持续到 17 日上午 9 点。结果上线一小时,ZCode 就宣布暂停新增 1 亿 Token 发放。官方称活动需求「超出预期」,正在调整服务容量。 已经领取的额度不受影响,普通新用户的 300 万 GLM-5.3 Token 福利仍然开放。ZCode 表示,等容量恢复后会重新开启 1 亿 Token 活动。