海光信息发布“Agent to Token开放计算架构”
相关推荐
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
阿里云:Token Plan个人版升级,新增12类Agent Harness工具
火星财经消息 9月11日,阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。(广角观察)
Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。
AI Agent消耗的Token量接近人类用户的5倍,自今年2月以来增长14倍
PANews 8月24日消息,据 a16z 统计,AI Agent 对 token 的消耗量自 2 月以来增长了 14 倍,已远超人类用户,几乎是人类的 5 倍。
机构:预计由Agent AI和AI服务器CPU增长所驱动的潜在需求将进一步推高传统DRAM价格
火星财经消息 8月4日,根据Counterpoint Research最新发布的全球存储追踪报告,三星在2026年第二季度以39%的市场份额重返全球DRAM市场第一,市场份额恢复至2024年水平。相比之下,尽管SK海力士的季度营收同比增长高达214%,但其市场份额由2025年第二季度的39%降至2026年第二季度的26%。作为全球三大存储厂商之一,美光同样取得了较好的季度业绩,以25%的市场份额几乎与SK海力士争夺第二的位置。该机构预计,由Agent AI和AI服务器CPU增长所驱动的潜在需求将进一步推高传统DRAM的价格。(广角观察)
Tibo:今天750 token/s的Ultra Fast,一两年后可能成为标配
动察 Beating AI 快讯,OpenAI 现在有一个付费高速档 Ultra Fast,只要氪金,模型就能回答得更快。开启后 GPT-5.6 Sol 最高能跑到每秒 750 个 Token,约为普通模式的 14 倍。Codex 负责人 Tibo Sottiaux 预计,再过 1 到 2 年,今天这种速度可能已经接近默认水平。 不过 14 倍只是模型本身的最高输出速度。真正拿来写代码,如果主要时间都在生成代码,整体能快约 10 倍;如果 Agent 还要搜索网页、跑工具、等网络返回,整个任务通常只快 3 到 4 倍。模型吐字越来越快后,瓶颈会从模型转到网络、CPU 和工具调用。 Ultra Fast 在 OpenAI 内部也得省着用。重大故障、关键原型等任务可以优先使用,但大部分算力还是留给外部客户,否则 OpenAI 自己的员工就能把容量吃光。