Kimi K2.8 Preview全量上线:性能逼近K3,支持1M上下文
相关推荐
传豆包2.2延期:字节补课Coding,招聘直接点名Claude Code、Codex
动察 Beating AI 快讯,字节原计划 8 月发布的豆包 2.2 推迟了。字节准备多花一些时间训练,重点补 Coding、工具调用和 Agent。 字节今年给 Seed 定的目标之一,就是把 Coding 做到第一梯队。内部希望年底前能做出类似 GLM-5.2、Kimi-K3 那种效果,让开发者真正开始认可字节的 Coding 模型。 8 月,Seed 刚做完一次大调整。原本按文本、语音、代码、视觉划分的团队被重新拆开,变成 Pretrain Data、Horizon RL、Product Posttrain-Work 和 Product Posttrain-Chat 四个部门。Horizon RL 会负责 Coding 后训练,Work 团队则重点做工具调用、GUI 操作和长任务执行。 字节最近也在密集招这方面的人。官网正在招 Code Agent、通用 Agent 和强化学习算法工程师。一份 Multi-Agent Harness 岗位甚至直接写明,要研究 Claude Code、Codex 等 Coding Agent,还要搭建能连续跑很久的多 Agent 和强化学习环境。 Seed 2.1 在 6 月发布时就已经重点强调 Coding,但字节显然觉得还不够。豆包 2.2 这次宁愿晚一点,也想先把 Coding 补得更像样。
Kimi CLI前作者:模型越强,Harness反而会越厚
据动察 Beating 监测,Raft 创始人、Kimi CLI 前作者 Richard Qian 提出一个反常识判断:模型越强,Agent harness 不一定越薄,反而可能越来越厚。 System Prompt、专用 Tool、Subagent 这些东西都可能慢慢消失。模型越来越聪明后,很多固定流程可以直接交给模型,最后甚至只留一个 Bash 工具。 但 Agent 一旦开始长期工作、互相协作,新的问题马上冒头:谁负责什么、任务做到哪了、上下文怎么同步、多个 Agent 怎么避免重复工作和互相冲突。这些都得由模型外面的系统解决。 Richard 离开月之暗面后做的 Raft,实际上就在补这一层。它把 Claude Code、Codex、Kimi CLI 等 Agent 拉进同一个工作区,让它们在频道里聊天、认领任务、读历史消息,再互相交接工作。 模型正在吃掉旧 harness,但 Agent 能做的事越多,外面的协作系统也会越来越复杂。
Cognition拿Kimi K3炼出SWE-2:逼近Astra,成本仅1/4
动察 Beating AI 快讯,Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。它直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测又提高约 5 到 6 个百分点。 在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。它距离 Fable 5.1 的 50.9% 只差 0.9 个百分点,但成本低 64%。GPT-6 Astra 得分 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为四分之一。 SWE-2 也比上一代少走很多弯路。中等推理强度下,它完成任务的交互轮数减少 58%,平均成本下降 81%。不过在更难的 Terminal-Bench 4 上,SWE-2 只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,还谈不上全面追平前沿模型。 SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。
Lody开源:手机上也能同时指挥Claude Code、Codex
动察 Beating AI 快讯,Lody 宣布开源 CLI 和本地桌面端,采用 Apache 2.0 许可。它不是新的 Coding Agent,而是给现有 Agent 套一层共享工作区。Claude Code、Codex、Kimi、OpenCode 等都能接进来。团队可以共享会话、看运行状态和代码改动,也能从手机或网页把任务派到电脑、服务器上。 多 Agent 同时干活时,不同会话可以放进独立 Git worktree,避免几路 Agent 同时改代码互相冲突。Agent 之间还能创建、读取和继续其他会话。一个主 Agent 可以把排查、实现、测试拆给多个子会话并行跑。 不过这次不是整套 Lody 全开源。公开仓库明确排除了托管后端、部署配置、计费系统,以及 Web 和手机 App 源码。跨设备协作目前仍依赖 Lody 的托管同步服务,也还不支持端到端加密。官方下一步想继续往 local-first 走,让会话、文档、任务和历史决策逐渐变成团队自己掌控的项目上下文。
MiniMax Code从桌面走进终端,CLI版本即将上线
据动察 Beating 监测,MiniMax Code 研发负责人何涛预告,MiniMax Code 即将推出终端版。从晒出的测试界面看,它已经是完整的 Coding Agent 形态,可以在终端里理解任务、思考并执行操作。 MiniMax Code 本身并不是新产品。MiniMax 此前已经有 Web 和桌面版,今年 5 月底正式把桌面 App 改名为 MiniMax Code;6 月发布 M3 时,又把它定位为专门配合自家模型使用的 Agent 产品。官方称其底层 harness 基于 OpenCode 和 Pi。
Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍
据动察 Beating 监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。 Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。 按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。 Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。