Jevgrep让Coding Agent少自己找代码:SWE-bench主模型成本降29%
相关推荐
Jev团队公开Coding Agent设计草案:每轮重新决定模型该看什么
动察 Beating AI 快讯,TypeSafe 创始人 Diogo Almeida 公开了一份 Coding Agent 设计草案,希望社区直接拿去实验。他直说团队大概率没时间自己把这些想法都做出来。 这份草案最核心的改动是上下文。现在的 Coding Agent 通常会一直带着之前的聊天、工具结果和代码状态,太长了再压缩或重启。TypeSafe 想让 Agent 每轮重新判断:继续沿用现有缓存,还是重新挑一份更合适的上下文;哪些保留全文,哪些只留摘要,哪些直接丢掉。 Almeida 认为,现有 Agent 不少设计都被 KV Cache 反过来绑住了。比如任务先切给便宜模型,再切回强模型,强模型可能还得重新读一遍长上下文,最后反而更贵;工具定义长期塞在系统提示词里,也会一直占空间。 上下文如果能动态重组,模型路由、Sub-agent、MCP 和 AGENTS.md 也能跟着按需加载。简单任务交给便宜模型,需要哪个工具再加载哪个,子 Agent 只拿和自己任务相关的状态。Almeida 暂时把这套思路叫「Meta-attention」。
斯坦福与英伟达开源Jev同类模型CLM-8B,最高快9倍
动察 Beating AI 快讯,斯坦福大学与 NVIDIA Research 研究人员开源 Jev 同类 System One 模型 CLM-8B,专门帮 Agent 快速做判断和选择。 CLM 和 Jev 做的是同一类事,都让 Agent 跳过长文本生成,直接从几个候选动作里做选择。CLM 的主要区别在底层架构:它把「当前状态」和「候选动作」分开计算,固定动作可以提前算好反复使用,因此在需要连续做决定的场景里更快。官方测试中,CLM-8B 表现整体接近 Jev,最高将延迟压低约 9 倍。 团队还把 CLM 用来给 Coding Agent 挑答案。Opus 5 和 Fable 5 先生成多份候选方案,再由微调后的 CLM 选出最好的一份。在 38 个 DeepSWE 留出任务上,成功率达到 81.6%;在 30 个 Terminal-Bench 2.1 留出任务上达到 87.6%。 CLM-8B 基于冻结的 Qwen3-8B,只额外训练状态和动作投影头。训练数据包括约 6000 万组问答、3000 万个困难负样本和约 100 万条 Agent 轨迹。代码和模型权重均已开放,采用 Apache 2.0 许可。
Cloudflare给Coding Agent自动开「临时测试服」
动察 Beating AI 快讯,Cloudflare 上线 Worker Previews。 Worker 可以简单理解成跑在 Cloudflare 上的后端程序,比如处理 API、登录、数据库和网页请求。现在开发者或 Coding Agent 每新建一个 Git 分支,都能给这套程序临时开一个独立测试环境,改完代码直接部署进去试,不用碰正式网站。 这套测试环境有自己的网址、日志和运行状态,Durable Objects、Containers 等资源也能单独创建。Agent 因此可以自己完成改代码、部署、打开网页测试、看报错,再继续修改。 Cloudflare 以前也有 Preview URLs,但主要只是给某个 Worker 版本生成一个临时网址,背后的资源仍可能连着正式环境。现在每个分支都能单独跑一套,Agent 测试新代码时,就不用担心把线上服务一起搞坏。
「不会聊天」的AI可以怎么玩?开发者用Jev接管Agent快速决策
动察 Beating AI 快讯,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 昨天刚发布新模型 Jev。它不生成文本,只返回选项、分数和概率。社区很快出现一批开源项目,开始把 Jev 塞进 Agent 和软件流程里。 Browser Use 做的 jev-ultrafast 最直观。浏览器每走一步,Jev 都会从当前页面里判断「下一步做什么、操作哪个元素」,只有需要填写文字时才调用一个小型语言模型。团队用它在 Google Flights 搜索苏黎世到伦敦的航班,一次完整运行只用了 7.1 秒。 Jev Codex Router 让 Jev 先判断每轮编程任务的难度,再决定交给不同档位的模型;jev-mcp 则把它做成 Agent 的事实核验、Prompt Injection 检测和语义排序工具。 这些项目有个很明显的共同点:没人拿 Jev 当聊天机器人,而是把它塞进软件和 Agent 的执行链里,专门负责那些高频、有限选项的判断。
Amp取消平台门票:自带ChatGPT和电脑就能免费跑Coding Agent
动察 Beating AI 快讯,Amp 推出免费 Hobby 档。Amp 是从 Sourcegraph 拆出来的 Coding Agent 公司,产品和 Claude Code、Codex 属于一类,可以让 AI 自己读代码、改代码、跑命令和测试。现在只要用自己的电脑,再接自己的 ChatGPT 订阅或模型 API Key,就能免费使用 Amp,不再额外交月费和 BYOK Token 费。 今年 7 月 Amp 推出订阅制后,想把自己的 ChatGPT 订阅接进 Amp,至少要开每月 20 美元的 Megawatt。BYOK 即便用的是自己的模型 Key,Amp 也会收额外 Token 费用并设限制。现在这两层都取消了。ChatGPT 订阅费或 API 本身的模型费用,还是用户自己承担。 Amp 还有一个叫 Orb 的远程云电脑产品,可以给每个任务开一套独立环境。代码和开发工具都放在里面,关掉自己的电脑后 Agent 还能继续干活,也方便同时跑多个任务。Orb 依然按使用量收费;不想付这笔钱,也可以让 Amp 直接跑在自己的电脑上。 另外,Amp 还在扩大 BYOK 范围。付费用户已经可以接 OpenRouter、Amazon Bedrock、Azure Foundry、Ollama Cloud 和自定义模型接口等,之后会开放给所有用户。
Cognition拿Kimi K3炼出SWE-2:逼近Astra,成本仅1/4
动察 Beating AI 快讯,Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。它直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测又提高约 5 到 6 个百分点。 在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。它距离 Fable 5.1 的 50.9% 只差 0.9 个百分点,但成本低 64%。GPT-6 Astra 得分 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为四分之一。 SWE-2 也比上一代少走很多弯路。中等推理强度下,它完成任务的交互轮数减少 58%,平均成本下降 81%。不过在更难的 Terminal-Bench 4 上,SWE-2 只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,还谈不上全面追平前沿模型。 SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。