返回 7*24 快讯
来源MarsBit

阿里Qwen3.7-Max上线自动隐式缓存,最高减免80%输入成本

据动察 Beating 监测,阿里 Qwen 团队宣布在阿里云百炼平台为旗下旗舰模型 Qwen3.7-Max 默认开启自动隐式缓存。开发者无需修改代码或额外指定参数,即可直接享用缓存降本。 在全新的计费机制下,系统会自动识别并提取请求中的重复上下文前缀。一旦发生缓存命中,命中部分的输入 token 费用仅按原单价的 20% 收取,直接免去八成输入成本。 隐式缓存直接针对长文本与 Agent 智能体场景下的巨额开销。拥有 100 万 tokens 长上下文窗口的 Qwen3.7-Max 在运行自主编码等高阶任务时,需要高频、重复读取庞大的代码库或知识文档。一名开发者测试 Qwen3.7 后反馈,仅花不到一小时构建坦克大战网页 demo,就消耗了接近 100 万 tokens。如果放手让智能体在后台自主执行代码审查与循环迭代,单日用量能轻松冲上数亿 tokens。 同行在缓存定价上的内卷,是促成阿里降价的另一个直接诱因。此前,DeepSeek V4-Pro 凭借极低的缓存命中价格吸引了大量开发者。在五月底宣布转为永久降价后,DeepSeek V4-Pro 的缓存命中计费被压到了每百万 tokens 仅 0.003625 美元(约合人民币 0.025 元),相当于在标准输入价格基础上直接免去 99.17% 的成本。大量开发者配合 Reasonix 等专属工具,将单次会话的缓存命中率最高推至 99% 这一极限,使得长会话智能体的运行账单几近为零。 面对竞争压力,Qwen3.7-Max 不仅上线了无需任何配置的隐式缓存,还保留了需要手动声明 cache_control 标识的显式缓存模式。相比于自动缓存,显式缓存的命中确定性更高,命中费用低至标准输入单价的 10%(一折),但首次创建缓存时需支付 125% 的溢价,且缓存块仅有 5 分钟的生命周期(每次发生命中可重新计时)。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

07-19 19:39

阿里云推个人版 Token Plan,开放 Qwen3.8-Max 预览体验

PANews 7月19日消息,阿里云正式发布 Token Plan 个人版,开放 Qwen3.8-Max-Preview 体验。Qwen3.8-Max 参数量达 2.4T,主攻代码工程和专业办公场景,正式版将于近期发布并开源。个人版订阅限时优惠为:Lite 39元/月、Standard 139元/月、Pro 499元/月;团队版标准、高级、尊享席位价格分别为 150元、550元、1398元/席位/月。活动期间,Qwen3.8-Max-Preview 白天 Credits 消耗 1 折,个人版 Token Plan 夜间在此基础上再享 2 折。

08-13 20:52

DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装

据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。

08-10 12:17

DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用

据动察 Beating 监测,过去两年,大模型推理优化一直在拿 KV Cache 开刀。它是模型读完上下文后留下的中间计算结果,内容越长,越吃显存和带宽。DeepSeek-V2 借助 MLA,相比 DeepSeek 67B 将 KV Cache 减少 93.3%;Kimi Linear 相比全 MLA 又最多减少 75%。大家都在让长上下文更便宜。 但这些方案都有一道墙:缓存通常只能在同一个模型内部复用。Agent 从小模型切到大模型后,目标模型还得把前面几万甚至几十万 Token 重新计算一遍。模型路由越频繁,这笔重复计算越难忽略。 英伟达最新论文开始拆这堵墙。团队发现,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显的线性关系。用 500 段、每段 1024 Token 的文本校准一次,就能拟合出一套映射,把一个模型算好的 KV Cache 转给另一个模型继续用。 Qwen3-14B 切到 32B 时,32K 上下文重新计算约需 7 秒,转换缓存只要约 0.28 秒,快约 25 倍。换句话说,以后甚至可以先让小模型负责「读」:把长上下文算成 KV Cache;真正需要更强能力时,再把缓存转给大模型,让大模型直接开始「想」和生成。 这会让模型路由省下更多算力。现在让简单任务跑小模型,主要省的是生成成本;一旦切到大模型,长上下文往往还得由大模型重新算一遍。跨模型 KV Cache 如果做成熟,连这部分 prefill 都能交给小模型完成。Agent 可以长期用便宜模型维护上下文,碰到难题才叫醒大模型,而且不用每次都从头「读档」。

08-07 14:55重要

B.AI 本周福利持续更新,1 折调用通道上线,Qwen3.8-Max 免费开放

ChainCatcher 消息,B.AI 本周迎来多项重磅更新。 福利方面,新用户凭 Bitget Wallet、Binance Wallet 或 imToken 钱包一键登录,立领 100 万 免费 Credits;通过邀请码登录再得 30 万,叠加专属钱包登录礼累计最高 130 万,邀请人同步享有好友充值及订阅永久返利。充值优惠同步释放,BNB Chain 渠道专享 1:1 等额配额赠送,其他多种支付方式享 1:0.5 返赠,单用户最高可获 $100 等值积分。 模型侧再迎新突破,「自选服务商」阵容本周重磅扩容,新增 Nebula 渠道,推出低至 1 折的历史性调用折扣;同时,阿里通义千问旗舰模型 Qwen3.8-Max 正式登陆平台,现已开放限时免费体验。目前,自选模式已全面覆盖 Claude、GPT、Gemini 等全球主流大模型系列,叠加充值赠送与多档折扣,持续为全球开发者与企业用户释放极致算力性价比。

08-07 10:28

千问大版本功能上新:推出思考研究、定时任务与办公助理,支持旗舰模型Qwen3.8-MAX

据 动察 Beating 监测,千问今日宣布重大功能升级,推出思考研究、定时任务、办公助理、语音通话及智能体广场等多项新功能,同步支持最新旗舰模型 Qwen3.8-MAX。思考研究模式在原深度思考基础上升级,强化复杂推理、工具调用与结构化输出能力,可基于用户提供的背景资料直接生成结构清晰的完整文档。定时任务功能允许用户预设执行时间,由千问自动完成行业简报梳理、邮件分类汇总等周期性工作,每日定时推送核心信息。 办公助理功能可连接用户的备忘录、日历及邮件等应用,操作电脑和浏览器完成查资料、下载附件等多步骤任务,最终直接输出 Office 文档、应用和网站等成品,支持手机与 PC 跨端协同。语音通话能力实现 7×24 小时在线,覆盖互动陪玩、睡前故事、带娃讲题、语音打车等场景。智能体广场首批上线智能寄件、网盘整理、超清扫描等服务,覆盖物流、房产、本地生活、理财、汽车等十余个领域。此次升级标志着千问从对话式 AI 助手向可执行多步骤复杂任务的生产力平台全面进化。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。

08-04 16:19

DeepSeek便宜到离谱:OpenCode两个月狂跑90万亿Token,账单仅92万美元

据 动察 Beating 监测,AI 编程工具 OpenCode 数据显示,6 月 10 日至 8 月 4 日,DeepSeek V4 Flash 在 OpenCode Go 上累计处理 90 万亿个 Token,总支出约 91.7 万美元。平均每 1 亿 Token 只需约 1.02 美元。 低成本主要来自缓存。该模型 96% 的输入 Token 命中缓存,平均每次会话处理 870 万个 Token,成本仅约 0.09 美元。