SGLang给普通大模型加上Jev式决策模式,不微调也能直接做选择
相关推荐
TypeSafe AI 决策模型 Jev 正式登陆 B.AI API,输入低至 $0.042/百万 Token
ChainCatcher 消息,B.AI 平台宣布 TypeSafe AI 推出的首款 System One 模型 Jev 正式上线 API。 Jev 专为软件内的高速结构化决策打造,不生成任何文本:开发者输入应用状态与类型化问题后,模型直接返回带概率与置信度的决策结果,无需 JSON Prompt,也无需解析输出。模型支持 Choice / Score / Noul 三类原语并行评估,端到端延迟约 70–500ms,输入仅 $0.042/百万 Token,输出免费,适用于工单路由、内容审核、风险评分及 Agent 分支判断等场景。 目前 Jev 已在 B.AI API 的“官方”→“全量接入”列表中开放,可通过 Jev-1.13.0 或 Jev-Latest 调用。
Jev爆火两周,OpenAI也做了个「只负责判断」的API
动察 Beating AI 快讯,OpenAI 在 DevDay 推出了 Decisions API。它不负责写长篇回答,专门解决程序里那些需要快速做选择的任务。 开发者先给它几个明确的选项,再丢进去文字或图片。底层的 GPT-6 Luna 会在几百毫秒内做出判断。比如判断一条消息该交给销售还是客服,或者让 Agent 决定下一步该调用哪个工具。 这类任务以前也能交给普通大模型,但往往要先生成一段文字,再让程序解析结果。Decisions API 直接把 Luna 限制在几个候选答案里,目标就是把这些高频的小判断做得更快。 它很容易让人想到最近爆火的 Jev。TypeSafe 也是把 AI 从「生成文字」改成「直接做选择」。不过两者并不完全一样,Jev 是专门训练的决策模型;OpenAI 目前是在 Luna 上做受限决策,而且额外支持图片输入。 Decisions API 目前还在限量预览,OpenAI 计划未来几天扩大开放。
TypeSafe AI与 OpenRouter 推出 Jev 智能路由器提升 LLM 调用效率
PANews 9月26日消息,TypeSafe AI在X上最新发帖称,OpenRouter 已集成 Jev 路由能力至全部 LLM 调用,通过 typesafe/jev-router 在每次请求时动态选择最优模型与推理强度,实现“cache-aware”的模型路由,以平衡质量、速度与成本。该路由器可根据上下文命中缓存,避免重复计算,减少无效 token 消耗,优化复杂 agent 工作流性能。部分开发者称,其在大规模真实样本评分任务中实现了近乎100%准确率,但也反映随着使用激增,响应时延有所上升。
观点:LLM Token价格腰斩并不意味着AI需求转弱,GPU算力租赁市场仍显示需求强劲
BlockBeats 消息,9 月 24 日,专业数据机构 Silicon Data 发文称,市场近期频繁引用其 LLM Token Index 作为看空 AI 交易的依据,但该指标下跌并不意味着 AI 需求或模型层利润正在走弱。 Silicon Data 表示,其 LLM Token Index 衡量的是样本中 API 用户每百万 Token 实际支付的价格,即「使用量加权价格」,并非 Token 使用量或总支出。该指数从 5 月 28 日的 2.07 美元降至 9 月 21 日的 1 美元,下降 52%,但今年 1 月至 5 月高点期间曾上涨 67%,因此价格变化本身不能直接作为 AI 行业景气度指标。 该机构指出,指数近期下跌主要反映更多任务被分配给廉价、快速的模型,同时 AI 实验室持续推出更多中端模型。由于 Token 并不能完全代表 AI 能力,该指标也无法单独区分模型替代与更高效的 Agent 路由。 相比之下,GPU 算力租赁市场仍显示需求强劲。Silicon Data 数据显示,非超大规模云厂商 H200 租赁价格从 6 月平均 2.87 美元升至目前 3.29 美元,9 月 19 日一度达到 3.32 美元;B200 目前为 5.76 美元,较同期上涨 7%,年初至今上涨 31%;B300 自 4 月底推出以来上涨 44%。 Silicon Data 认为,随着 Agent 大规模应用,未来绝大多数 Token 可能来自廉价、快速模型,因此 Token 价格可以持续下降,同时总 Token 使用量仍大幅增长。该机构表示,真正高价值的任务仍可能集中在前沿模型上,而 AI 全面普及意味着对算力的需求可能「更多,而不是更少」。
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。