AWS、Cloudflare、Databricks都跟进Jev,决策模型快成标配了
相关推荐
SGLang给普通大模型加上Jev式决策模式,不微调也能直接做选择
动察 Beating AI 快讯,大模型推理/部署框架 SGLang 新增原生决策 API,让 Qwen3.8-27B 这类现成 LLM 和多模态模型不用改权重、也不用重新微调,就能直接做选择、判断和打分。开发者给出当前情况和几个候选答案,模型直接返回每个选项的概率,不再先生成一段文字再解析。 它利用的是大模型本来就会计算的「下一个 token 概率」。比如候选答案是 A、B、C,普通聊天模型会继续生成文字;SGLang 则直接读取模型对 A、B、C 的概率,看看它更倾向哪个答案。模型本身没变,只是换了一种读取结果的方式。 SGLang 用 Qwen3.8-27B 做了一个《宝可梦 FireRed》演示。模型根据实时游戏状态判断攻击、换精灵还是治疗,单次决策低于 100ms,并一次打通四天王和冠军。Qwen3.8-27B 本身支持图像输入,所以这套方法也能处理多模态决策。 SGLang 还新增 /v1/systemone 接口,兼容 Jev 使用的 TypeSafe SDK。已经使用这套 SDK 的应用,可以把服务地址改成自己的 SGLang 实例继续调用。新功能已经进入 nightly 版本,计划随 v0.5.21 正式发布。
斯坦福与英伟达开源Jev同类模型CLM-8B,最高快9倍
动察 Beating AI 快讯,斯坦福大学与 NVIDIA Research 研究人员开源 Jev 同类 System One 模型 CLM-8B,专门帮 Agent 快速做判断和选择。 CLM 和 Jev 做的是同一类事,都让 Agent 跳过长文本生成,直接从几个候选动作里做选择。CLM 的主要区别在底层架构:它把「当前状态」和「候选动作」分开计算,固定动作可以提前算好反复使用,因此在需要连续做决定的场景里更快。官方测试中,CLM-8B 表现整体接近 Jev,最高将延迟压低约 9 倍。 团队还把 CLM 用来给 Coding Agent 挑答案。Opus 5 和 Fable 5 先生成多份候选方案,再由微调后的 CLM 选出最好的一份。在 38 个 DeepSWE 留出任务上,成功率达到 81.6%;在 30 个 Terminal-Bench 2.1 留出任务上达到 87.6%。 CLM-8B 基于冻结的 Qwen3-8B,只额外训练状态和动作投影头。训练数据包括约 6000 万组问答、3000 万个困难负样本和约 100 万条 Agent 轨迹。代码和模型权重均已开放,采用 Apache 2.0 许可。
Cua一口气开源两款S1模型,还拉Jev来同场考试
动察 Beating AI 快讯,开源 computer-use 基础设施项目 Cua 开源了两款专门做 Computer Use 决策的 S1 模型,同时发布 Cua-Bench-S1,把 Jev 这类模型单独拉出来评测。 这套评测不让模型自己规划。每道题直接给当前界面和一组选好的操作,比如「填邮箱」「勾选同意」「点击提交」「跳过」,模型只选一次。不能反复看屏幕,也没有失败重试。这样测的就是最纯粹的一个问题:下一步该做什么。 一起开源的两款模型走了两条路。Nano 只有约 85.5 万可训练参数,从零训练,专门做候选操作打分;4B 版则直接拿 Qwen3.5-4B 做底座,再微调成同样的「选择题模型」。前者追求极小和极快,后者用大模型原本的理解能力换更强的泛化。 评测除了填表、登录、搜索这些常见操作,还加入安全判断、国际象棋、Doom 和 JevBench。后面几项故意不给模型训练,用来看它离开熟悉任务后还能不能做对决定。
Jev到底有没有门槛?OpenJEV已经分成4派:不吐字容易,概率靠谱很难
动察 Beating AI 快讯,Jev 发布还不到一周,开源社区已经开始复刻这种「不写答案、直接给概率」的模型。 它们都想做同一件事:省掉逐 token 生成,直接给出选项和概率。但具体怎么做,已经分成了几条完全不同的路线。 1. SemIf 最简单,连模型都不用重新训练。它直接拿现成的 Qwen,在模型准备回答 A、B、C 时截住,不让它继续往下写,直接读取每个选项的分数,再换成概率。 2. Simple Jev 也用现成大模型,但进一步省掉重复计算。同一段材料只读一次,后面的多个问题共用这部分结果,再分别判断答案。作者也明确说,它复刻的是 Jev 的使用方式,准确率、速度和概率校准都没有做到等价。 3. Laya 干脆不用会生成文字的大模型,换成更像传统分类器的编码模型。好处是小而快,短板也很明显。一次从 77 个选项里做选择时,Laya 准确率只有 42.5%,Jev 是 87.0%。 4. Von 走的也是专用决策模型路线。它只有约 4 亿参数,不生成文字,一次前向直接完成 Choice、Noul 和 Score,更像一个能读自然语言的新一代分类器。 5. Verdict 更小,只有约 1.5 亿参数。作者重点处理了两个问题:答错了还报很高的置信度,以及把选项顺序换一下,结果就跟着变。它更在意如何让概率和判断都稳定下来。 6. Kev 选择保留大模型。它拿 Qwen 做底座,再加专门的决策结构,让同一份输入只读一次,多个问题各自算概率。第三方此前逆向 Jev 时,也推测它可能用了类似设计。 Kev 自测中,拿训练时没见过的新题测试,8B 版准确率约 78%,Jev 约 86%。更明显的差距在置信度,Kev 还有一些答错的题会给出 90% 以上把握。 7. Nimble 重点放在训练上。它用 Qwen3.5-9B,再准备一批「只改一个事实,正确答案就翻转」的数据做后训练。在 324 个没参与训练的测试样本里,Nimble 有 90.1% 选中了参考答案,Jev 是 93.2%。不过作者也提醒,目前还不能保证模型「报 90% 就真的有 90% 正确」。 8. OpenJev 走得最远,直接换成 DiffusionGemma。它先把几个答案位置留空,再像扩散模型补图一样一次填出来。在 RTX PRO 6000 上,单请求中位延迟约 94ms。 几天下来,OpenJEV 已经分成四路:直接读取现成模型的答案分
干掉AWS?InstaCloud融资800万美元,让AI Agent自己管云
动察 Beating AI 快讯,YC 创业公司 InsForge 推出 InstaCloud,并宣布完成 800 万美元种子轮融资。 它是一套面向 AI Coding Agent 的 Serverless 云平台,让 Claude Code、Cursor 等工具直接部署和运行应用,把不少原本需要人工处理的 DevOps 工作交给 Agent。 InstaCloud 的计算服务可以随流量自动扩缩容,闲置时缩到零,不需要提前选择机器规格。Agent 通过 CLI 或 MCP 就能创建服务、部署代码、查看日志,还能操作数据库和存储。 它最有意思的是「环境分支」。Agent 可以把 Postgres、对象存储和应用容器整套复制成隔离环境,在里面改代码、迁移数据库和测试。出问题直接删掉这个分支,不会动生产环境。关键操作还可以设置人工审批。 联合创始人兼 CEO Hang Huang 直接喊话,要用 InstaCloud「干掉 AWS、GCP 和 Azure」。目前它更像是把 Railway、Render 这类云应用平台重新做成 Agent 能直接操作的版本,而不是已经能够取代三大云厂商。
Jev首次被反超,Liquid AI发布决策模型d1
动察 Beating AI 快讯,前沿端侧 AI 研发公司 Liquid AI 发布首个自研决策模型 d1。它和 Jev 做的是同一类事,不生成长文本,而是直接做选择、判断和打分,可以给 Agent 选工具、做路由和审核。 Liquid 按 Hugging Face 的决策模型综合评测 Decision Index 0.2.1 重新跑了一遍评测。d1 综合得分 58.9,超过 Jev 1.13 的 57.9。5 个大类中,d1 在艺术判断、语言理解和检索分类上领先,工具调用略低于 Jev,知识推理则落后 8 分。Liquid 称,d1 是首个在这套评测中超过 Jev 的模型。 d1 兼容 Jev 的三种决策方式:Choice 从多个选项里挑一个,Noul 判断是非,Score 按标准打分。一次请求还能同时完成多项判断,直接返回概率和结构化结果,不需要先生成文字再解析。 目前 d1 已通过 Liquid API 开放,免费版本为 `d1:free`。模型权重和参数规模暂未公布,Liquid 还计划把它接入 OpenRouter。