阿里Qwen3.7-Max上线自动隐式缓存,最高减免80%输入成本
相关推荐
阿里云推个人版 Token Plan,开放 Qwen3.8-Max 预览体验
PANews 7月19日消息,阿里云正式发布 Token Plan 个人版,开放 Qwen3.8-Max-Preview 体验。Qwen3.8-Max 参数量达 2.4T,主攻代码工程和专业办公场景,正式版将于近期发布并开源。个人版订阅限时优惠为:Lite 39元/月、Standard 139元/月、Pro 499元/月;团队版标准、高级、尊享席位价格分别为 150元、550元、1398元/席位/月。活动期间,Qwen3.8-Max-Preview 白天 Credits 消耗 1 折,个人版 Token Plan 夜间在此基础上再享 2 折。
DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装
据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。
DeepSeek、Kimi都在拼命砍缓存,英伟达开始让缓存跨模型复用
据动察 Beating 监测,过去两年,大模型推理优化一直在拿 KV Cache 开刀。它是模型读完上下文后留下的中间计算结果,内容越长,越吃显存和带宽。DeepSeek-V2 借助 MLA,相比 DeepSeek 67B 将 KV Cache 减少 93.3%;Kimi Linear 相比全 MLA 又最多减少 75%。大家都在让长上下文更便宜。 但这些方案都有一道墙:缓存通常只能在同一个模型内部复用。Agent 从小模型切到大模型后,目标模型还得把前面几万甚至几十万 Token 重新计算一遍。模型路由越频繁,这笔重复计算越难忽略。 英伟达最新论文开始拆这堵墙。团队发现,在同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显的线性关系。用 500 段、每段 1024 Token 的文本校准一次,就能拟合出一套映射,把一个模型算好的 KV Cache 转给另一个模型继续用。 Qwen3-14B 切到 32B 时,32K 上下文重新计算约需 7 秒,转换缓存只要约 0.28 秒,快约 25 倍。换句话说,以后甚至可以先让小模型负责「读」:把长上下文算成 KV Cache;真正需要更强能力时,再把缓存转给大模型,让大模型直接开始「想」和生成。 这会让模型路由省下更多算力。现在让简单任务跑小模型,主要省的是生成成本;一旦切到大模型,长上下文往往还得由大模型重新算一遍。跨模型 KV Cache 如果做成熟,连这部分 prefill 都能交给小模型完成。Agent 可以长期用便宜模型维护上下文,碰到难题才叫醒大模型,而且不用每次都从头「读档」。
B.AI 本周福利持续更新,1 折调用通道上线,Qwen3.8-Max 免费开放
ChainCatcher 消息,B.AI 本周迎来多项重磅更新。 福利方面,新用户凭 Bitget Wallet、Binance Wallet 或 imToken 钱包一键登录,立领 100 万 免费 Credits;通过邀请码登录再得 30 万,叠加专属钱包登录礼累计最高 130 万,邀请人同步享有好友充值及订阅永久返利。充值优惠同步释放,BNB Chain 渠道专享 1:1 等额配额赠送,其他多种支付方式享 1:0.5 返赠,单用户最高可获 $100 等值积分。 模型侧再迎新突破,「自选服务商」阵容本周重磅扩容,新增 Nebula 渠道,推出低至 1 折的历史性调用折扣;同时,阿里通义千问旗舰模型 Qwen3.8-Max 正式登陆平台,现已开放限时免费体验。目前,自选模式已全面覆盖 Claude、GPT、Gemini 等全球主流大模型系列,叠加充值赠送与多档折扣,持续为全球开发者与企业用户释放极致算力性价比。
千问大版本功能上新:推出思考研究、定时任务与办公助理,支持旗舰模型Qwen3.8-MAX
据 动察 Beating 监测,千问今日宣布重大功能升级,推出思考研究、定时任务、办公助理、语音通话及智能体广场等多项新功能,同步支持最新旗舰模型 Qwen3.8-MAX。思考研究模式在原深度思考基础上升级,强化复杂推理、工具调用与结构化输出能力,可基于用户提供的背景资料直接生成结构清晰的完整文档。定时任务功能允许用户预设执行时间,由千问自动完成行业简报梳理、邮件分类汇总等周期性工作,每日定时推送核心信息。 办公助理功能可连接用户的备忘录、日历及邮件等应用,操作电脑和浏览器完成查资料、下载附件等多步骤任务,最终直接输出 Office 文档、应用和网站等成品,支持手机与 PC 跨端协同。语音通话能力实现 7×24 小时在线,覆盖互动陪玩、睡前故事、带娃讲题、语音打车等场景。智能体广场首批上线智能寄件、网盘整理、超清扫描等服务,覆盖物流、房产、本地生活、理财、汽车等十余个领域。此次升级标志着千问从对话式 AI 助手向可执行多步骤复杂任务的生产力平台全面进化。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
DeepSeek便宜到离谱:OpenCode两个月狂跑90万亿Token,账单仅92万美元
据 动察 Beating 监测,AI 编程工具 OpenCode 数据显示,6 月 10 日至 8 月 4 日,DeepSeek V4 Flash 在 OpenCode Go 上累计处理 90 万亿个 Token,总支出约 91.7 万美元。平均每 1 亿 Token 只需约 1.02 美元。 低成本主要来自缓存。该模型 96% 的输入 Token 命中缓存,平均每次会话处理 870 万个 Token,成本仅约 0.09 美元。