Cognition发布每秒1000 Token的编程大模型SWE-1.7
相关推荐
Kimi K3接入Claude Code,平均任务成本是Kimi Code的9倍
据动察 Beating 监测,AI Agent 基础设施公司 Composio 将同一款 Kimi K3 接入 Kimi Code、Hermes 和 Claude Code,完成 28 项相同任务。三套运行框架的成功数只差 2 项,Token 用量和成本却相差很大。 Kimi Code 完成 22 项,Hermes 完成 21 项,Claude Code 完成 20 项。单项任务 Token 中位数分别为 6.1 万、6.7 万和 34 万。Composio 估算,平均每项任务成本约为 0.22 美元、0.28 美元和 2 美元。个别任务的 Token 用量最多相差 30 倍。 Hermes 速度最快,单项任务中位耗时为 179 秒。Kimi Code 为 297 秒,Claude Code 为 348 秒。 Writer 的另一项研究也得到相近结果。研究人员在 22 项企业任务和 6 款模型上只替换运行框架,Token 用量下降 38%,单项成本下降 41%,耗时下降 44%,完成质量基本持平。
从GPT-2到Kimi K3:大模型七年架构演进,本质是一场记忆争夺战
据 动察 Beating 监测,Baseten 工程师 Ali 发布长文,从 GPT-2 一路拆解到 Kimi K3。按参数量计算,一个 K3 相当于约 22580 个 GPT-2。但他认为,过去七年的真正变化并非单纯扩大模型,而是不断改造模型保存、更新和找回信息的方式。 GPT-2 使用全注意力。每个 Token 都留下自己的 Key 和 Value,后续可以随时回看。信息保存最完整,但上下文越长,KV Cache 和计算成本越高。 线性注意力把整段历史压进固定大小的状态。成本不再随上下文持续膨胀,代价是不同信息会挤在同一块空间里。内容越来越多后,旧记忆开始互相干扰。 此后的多项架构创新,都在给这块有限记忆增加管理规则。DeltaNet 允许模型先读取旧内容,再用新旧差异进行覆盖。Gated DeltaNet 加入整体遗忘,让旧信息能够随场景变化衰减。 KDA 进一步把遗忘控制细化到每个通道。不同信息可以拥有不同保存时间:长期事实保留更久,临时指令和局部变量更快衰减。Ali 认为,这才是 Kimi Linear 最关键的进步。 但固定状态不可能保留所有细节。K3 因此没有只用 KDA,而是把 23 组四层结构排列成「三层 KDA 加一层 MLA」,最后再补一层 MLA。KDA 负责低成本维护长期记忆,MLA 定期回看完整上下文,找回数字、代码和早期指令等精确信息。 K3 还引入 Attention Residuals。普通模型会把每一层结果不断相加,早期提取出的信息容易在 93 层计算中被后续结果稀释。K3 把网络按 12 层分块,让后面的层按需调用较早阶段形成的中间表示,不必每次都从原文重新推导。 因此,K3 的关键并不是某一项突然出现的黑科技。它真正特别的地方,是把循环记忆、全局检索、层间回看和专家路由组合成一套分层信息系统。 过去七年的模型架构演进,本质上是在教模型如何选择什么值得留下,什么应该覆盖,什么时候必须翻回原文。
Claude Code官方省Token指南:11个技巧让额度用得更久
据动察 Beating 监测,Anthropic 发布 Claude Code 省 Token 指南。核心就一句:上下文越长,后面每一轮越贵。聊天、文件和命令输出都会继续占用 Token,也会因此更快消耗额度。 整理下来,有 11 个最实用的技巧: 1. 换任务就 /clear。一个任务做完就清掉上下文。还在做同一个任务,只是前面的内容没用了,再用 /compact 压缩。长会话越往后越贵,因为每一轮都会重新带上之前的内容。 2. 模型和 effort 开局就选好。中途执行 /model 或 /effort 会打掉 prompt cache(提示词缓存),下一轮需要重新处理整段上下文。Fast mode 也是一样,最好一开始就开。 3. 离开前先 /compact。订阅用户的缓存约 1 小时过期,API Key 默认约 5 分钟。缓存过期后再回来,下一轮通常要重新处理整个上下文。趁缓存还在时压缩更便宜。 4. 最近几轮跑偏就 /rewind。它只删掉后面几轮,前面的缓存还能继续用。/compact 会重写整个对话,成本更高。 5. 文件直接用 @ 文件名。Claude 会在第一轮直接拿到文件,可以省掉一次 Read 或搜索。一个文件通常只需要 @ 一次,重复 @ 反而可能把同一文件再塞一份进上下文。 6. Prompt 尽量说具体。与其说「测试挂了」,不如直接告诉 Claude 哪个测试、哪个文件。否则它可能先 grep、搜索、读一堆文件,这些结果之后每一轮都会继续占上下文。 7. 测试和日志尽量少输出。Build、测试、git log 的输出都会留在上下文。可以加 quiet 参数、只输出错误,或者用 tail 截断。Claude Code 对超过 3 万字符的命令输出反而会自动写入文件,只把摘要和路径留在会话里。 8. 用 /context 查启动负担。新会话一开始就可以看 CLAUDE.md、MCP 和工具定义占了多少上下文。CLAUDE.md 只放通用规则,专项流程放进按需加载的 Skill,不用的 MCP 用 /mcp 关掉。 9. 简单任务用更小的模型、更低的 effort。大模型输入和输出都更贵,thinking 也属于输出 Token。纯执行类任务没必要一直用最高档模型和最高推理强度。 10. 大日志交给 subagent,小任务别滥用。Subagent 有独立上下文,只把最终结果带回主会话,适合读大量日志、搜索文档。但它也要重新读文件、自己跑多轮,小任务反而可能更贵。搜索、读日志这类任务还可以指定 Haiku 或 Sonnet。 11. /loop 最好单独开会话。每次循环都是完整的一轮,会重复携带当前会话的全部上下文。如果间隔超过缓存时间,还可能叠加一次缓存失效。官方建议另开终端,用一个干净会话专门跑循环。 Anthropic 的建议归根结底就是:少塞无用内容,任务结束及时清,会话别拖得太长。
OpenAI把GPT-5.6 Sol提速14倍:750 token/s先上API
据动察 Beating 监测,OpenAI 开始预览 GPT-5.6 Sol 的 Ultrafast 模式。它由 Cerebras 提供算力,最高输出速度达到 750 token/s,最高是 Standard 模式的 14 倍。目前只向少量 API 客户开放。 OpenAI 已在故障排查、研究、客服、金融分析和开发 Agent 等场景中测试 Ultrafast。对于需要连续多次调用模型的 Agent,单次响应提速也能直接缩短整个任务的执行时间。 这比 OpenAI 7 月底推出的 Fast 模式又快了一档。Fast 模式最高是 Standard 的 2.5 倍,Ultrafast 则把上限推到 14 倍。OpenAI 暂未公布 Ultrafast 的价格,也没有宣布何时进入 ChatGPT。
OpenAI教用户给Claude Code换上GPT模型,误封后两边员工现场互损
据动察 Beating 监测,OpenAI 产品负责人 Tibo 此前公开教用户给 Claude Code「换脑」:保留 Claude Code 的 harness,把底层模型换成 GPT。 开发者 Alex Getman 照着配置后,Claude 账号很快被封。他公开求助 Tibo 和 Anthropic,询问这套用法到底是否违规。 Tibo 随即开始阴阳:「我很想帮你,可惜我不在 Anthropic 工作。」他还补了一句,因为把 Claude Code harness 配其他模型就封号,「确实挺奇怪」,并问还有没有其他人中招。 Claude Code 负责人 Boris Cherny 很快下场。他明确表示,Anthropic 不会因为 harness 搭配其他模型就封号,这次几乎肯定是其他风控误触发。账号随后恢复。 Boris 还顺手回敬 Tibo:「如果你想来 Anthropic,我们正在招人。」Tibo 则表示自己很喜欢现在的团队,而且接下来几周还有不少新产品要发,暂时哪也不去。 事情解决后,Tibo 又发帖庆祝,称 GPT-5.6 Sol 几乎哪里都能用,包括 Claude Code harness。为了庆祝这件事和自己「不跳槽」,他还直接重置了 ChatGPT Work 和 Codex 所有付费用户的使用额度。
DeepSeek便宜到离谱:OpenCode两个月狂跑90万亿Token,账单仅92万美元
据 动察 Beating 监测,AI 编程工具 OpenCode 数据显示,6 月 10 日至 8 月 4 日,DeepSeek V4 Flash 在 OpenCode Go 上累计处理 90 万亿个 Token,总支出约 91.7 万美元。平均每 1 亿 Token 只需约 1.02 美元。 低成本主要来自缓存。该模型 96% 的输入 Token 命中缓存,平均每次会话处理 870 万个 Token,成本仅约 0.09 美元。