加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源Blockbeats

Pi开始给Prompt缓存自动续命,长任务少烧重复Token

动察 Beating AI 快讯,Pi Agent Harness 发布 0.86.0,新增 Prompt Cache Warming。Agent 跑长时间工具任务时,Pi 会在缓存快过期前重发上一次请求,只生成 1 个 Token,把已经缓存的长上下文继续保留下来。 很多模型服务会在一段时间没有请求后清掉 Prompt Cache。之后继续任务,同一大段上下文就可能重新按完整输入计费。Pi 现在会主动避免这种 Cache Miss,但不会无脑保活。 它会先算账。只有预计避免的 Cache Miss 成本减去刷新成本后,还能至少省 0.05 美元,才会发起刷新。每次刷新本身仍要支付整段缓存读取和 1 个输出 Token 的费用。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-11 06:28

阿里云:Token Plan个人版升级,新增12类Agent Harness工具

火星财经消息 9月11日,阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。(广角观察)

09-11 11:01

英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%

动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。

09-10 06:43

DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化

动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。

09-01 09:51

Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol

动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。

08-31 08:33

CREAO再融千万美元:让Agent从每次失败里自己改Harness

动察 Beating AI 快讯,企业 Agent 平台 CREAO 完成新一轮千万级美元战略融资,累计融资超过 3000 万美元。CREAO 现在重点做的是 Harness 自我迭代,也就是让 Agent 根据真实任务里的错误和反馈,持续调整自己的执行系统。 Harness 是模型外面控制 Agent 怎么干活的一层,包括任务规划、工具调用、记忆、模型选择和出错后的处理方式。CREAO 已经跑通其中一部分自动纠错:Agent 完成任务后,系统会自动检查结果;发现问题后生成工单,AI 再调查原因、写修复、验证结果。新版本先用少量真实流量测试,效果变差就自动回滚。CREAO 官方此前已经公开过这套系统。 下一步,CREAO 准备把这种改进扩大到更多 Harness 环节。例如,同一类 Agent 反复在某个工具或任务流程上出错,平台可以根据大量真实任务的数据调整整套执行方式,新创建的同类 Agent 也能直接用上这些改进。 再往后,CREAO 还准备把一部分经验训进模型。它计划基于开源模型做垂直场景的后训练,让常见任务更多由成本较低的专用模型完成,复杂任务再调用前沿模型。

08-15 06:05

Claude Code官方省Token指南:11个技巧让额度用得更久

据动察 Beating 监测,Anthropic 发布 Claude Code 省 Token 指南。核心就一句:上下文越长,后面每一轮越贵。聊天、文件和命令输出都会继续占用 Token,也会因此更快消耗额度。 整理下来,有 11 个最实用的技巧: 1. 换任务就 /clear。一个任务做完就清掉上下文。还在做同一个任务,只是前面的内容没用了,再用 /compact 压缩。长会话越往后越贵,因为每一轮都会重新带上之前的内容。 2. 模型和 effort 开局就选好。中途执行 /model 或 /effort 会打掉 prompt cache(提示词缓存),下一轮需要重新处理整段上下文。Fast mode 也是一样,最好一开始就开。 3. 离开前先 /compact。订阅用户的缓存约 1 小时过期,API Key 默认约 5 分钟。缓存过期后再回来,下一轮通常要重新处理整个上下文。趁缓存还在时压缩更便宜。 4. 最近几轮跑偏就 /rewind。它只删掉后面几轮,前面的缓存还能继续用。/compact 会重写整个对话,成本更高。 5. 文件直接用 @ 文件名。Claude 会在第一轮直接拿到文件,可以省掉一次 Read 或搜索。一个文件通常只需要 @ 一次,重复 @ 反而可能把同一文件再塞一份进上下文。 6. Prompt 尽量说具体。与其说「测试挂了」,不如直接告诉 Claude 哪个测试、哪个文件。否则它可能先 grep、搜索、读一堆文件,这些结果之后每一轮都会继续占上下文。 7. 测试和日志尽量少输出。Build、测试、git log 的输出都会留在上下文。可以加 quiet 参数、只输出错误,或者用 tail 截断。Claude Code 对超过 3 万字符的命令输出反而会自动写入文件,只把摘要和路径留在会话里。 8. 用 /context 查启动负担。新会话一开始就可以看 CLAUDE.md、MCP 和工具定义占了多少上下文。CLAUDE.md 只放通用规则,专项流程放进按需加载的 Skill,不用的 MCP 用 /mcp 关掉。 9. 简单任务用更小的模型、更低的 effort。大模型输入和输出都更贵,thinking 也属于输出 Token。纯执行类任务没必要一直用最高档模型和最高推理强度。 10. 大日志交给 subagent,小任务别滥用。Subagent 有独立上下文,只把最终结果带回主会话,适合读大量日志、搜索文档。但它也要重新读文件、自己跑多轮,小任务反而可能更贵。搜索、读日志这类任务还可以指定 Haiku 或 Sonnet。 11. /loop 最好单独开会话。每次循环都是完整的一轮,会重复携带当前会话的全部上下文。如果间隔超过缓存时间,还可能叠加一次缓存失效。官方建议另开终端,用一个干净会话专门跑循环。 Anthropic 的建议归根结底就是:少塞无用内容,任务结束及时清,会话别拖得太长。