StartLux推出开源决策模型StartLux-Decision,38项基准中31项高于Jev
相关推荐
Jev首次被反超,Liquid AI发布决策模型d1
动察 Beating AI 快讯,前沿端侧 AI 研发公司 Liquid AI 发布首个自研决策模型 d1。它和 Jev 做的是同一类事,不生成长文本,而是直接做选择、判断和打分,可以给 Agent 选工具、做路由和审核。 Liquid 按 Hugging Face 的决策模型综合评测 Decision Index 0.2.1 重新跑了一遍评测。d1 综合得分 58.9,超过 Jev 1.13 的 57.9。5 个大类中,d1 在艺术判断、语言理解和检索分类上领先,工具调用略低于 Jev,知识推理则落后 8 分。Liquid 称,d1 是首个在这套评测中超过 Jev 的模型。 d1 兼容 Jev 的三种决策方式:Choice 从多个选项里挑一个,Noul 判断是非,Score 按标准打分。一次请求还能同时完成多项判断,直接返回概率和结构化结果,不需要先生成文字再解析。 目前 d1 已通过 Liquid API 开放,免费版本为 `d1:free`。模型权重和参数规模暂未公布,Liquid 还计划把它接入 OpenRouter。
Jev爆火两周,OpenAI也做了个「只负责判断」的API
动察 Beating AI 快讯,OpenAI 在 DevDay 推出了 Decisions API。它不负责写长篇回答,专门解决程序里那些需要快速做选择的任务。 开发者先给它几个明确的选项,再丢进去文字或图片。底层的 GPT-6 Luna 会在几百毫秒内做出判断。比如判断一条消息该交给销售还是客服,或者让 Agent 决定下一步该调用哪个工具。 这类任务以前也能交给普通大模型,但往往要先生成一段文字,再让程序解析结果。Decisions API 直接把 Luna 限制在几个候选答案里,目标就是把这些高频的小判断做得更快。 它很容易让人想到最近爆火的 Jev。TypeSafe 也是把 AI 从「生成文字」改成「直接做选择」。不过两者并不完全一样,Jev 是专门训练的决策模型;OpenAI 目前是在 Luna 上做受限决策,而且额外支持图片输入。 Decisions API 目前还在限量预览,OpenAI 计划未来几天扩大开放。
斯坦福与英伟达开源Jev同类模型CLM-8B,最高快9倍
动察 Beating AI 快讯,斯坦福大学与 NVIDIA Research 研究人员开源 Jev 同类 System One 模型 CLM-8B,专门帮 Agent 快速做判断和选择。 CLM 和 Jev 做的是同一类事,都让 Agent 跳过长文本生成,直接从几个候选动作里做选择。CLM 的主要区别在底层架构:它把「当前状态」和「候选动作」分开计算,固定动作可以提前算好反复使用,因此在需要连续做决定的场景里更快。官方测试中,CLM-8B 表现整体接近 Jev,最高将延迟压低约 9 倍。 团队还把 CLM 用来给 Coding Agent 挑答案。Opus 5 和 Fable 5 先生成多份候选方案,再由微调后的 CLM 选出最好的一份。在 38 个 DeepSWE 留出任务上,成功率达到 81.6%;在 30 个 Terminal-Bench 2.1 留出任务上达到 87.6%。 CLM-8B 基于冻结的 Qwen3-8B,只额外训练状态和动作投影头。训练数据包括约 6000 万组问答、3000 万个困难负样本和约 100 万条 Agent 轨迹。代码和模型权重均已开放,采用 Apache 2.0 许可。
Shoal Research:机器人约占 HTML 请求 60%
火星财经消息,研究机构 Shoal Research 发布报告称,Cloudflare 网络上机器人约占 HTML 内容 HTTP 请求的 60%,人类为 38.2%。Cloudflare CEO Matthew Prince 曾预测机器人流量将在 2027 年超过人类,随后宣布智能体流量增长已使机器人超过人类流量。报告称,AI 应用将用户留在聊天界面并总结内容,而非导流回原站。AI 爬虫抓取与回访比例远高于 Googlebot,ClaudeBot 过去一年平均每回访一次抓取约 4200 页。Pew 研究显示,AI 摘要使点击率从 15% 降至 8%。robots.txt 与内容换流量模式难以维持。诉讼与私人授权为权宜之计。按请求付费分为带密钥的封闭市场,以及使用 HTTP 402 和稳定币的开放协议如 x402 和 MPP。多数网站仍免费提供或屏蔽。
微软收拢Agent研发:AI Frontiers从Research并入MAI
动察 Beating AI 快讯,微软把 AI Frontiers 从 Microsoft Research 调入 Mustafa Suleyman 领导的 Microsoft AI(MAI)。这支实验室 2023 年 10 月成立,主要研究小模型和 Agent。 AutoGen、FARA、Magentic-One、Magentic-UI、Phi 等项目都曾由这支团队参与开发。多 Agent 开源框架 AutoGen 后来与 AI 应用开发 SDK Semantic Kernel 一同汇入微软统一 Agent 开发框架 Microsoft Agent Framework。 AI Frontiers 接下来会继续做前沿 Agent 和模型研究。MAI 自己也在训练一系列模型,并组建了 Superintelligence 团队,目标是开发所谓「Humanist Superintelligence」。微软给它的定义是面向具体问题、保持在人类控制之下,并服务于人的高能力 AI。 AI Frontiers 原负责人 Ece Kamar 最近刚离开微软,结束 16 年任职。她把建立 AI Frontiers 称为自己微软生涯的亮点之一,目前还没有公布下一站。
Magic Eden安全事件后Revoke.cash发布提示:Ultimate订阅用户需检查Auto-Revoking设置
Odaily星球日报讯 Revoke.cash 发文提醒,受上周 Magic Eden 安全事件影响,Revoke.cash 建议用户前往其账户页面的 Auto-Revoking 模块,检查各网络是否出现黄色警告图标;如有,则需先在其他钱包应用中将该地址恢复为普通账户,再通过 MetaMask 升级为智能账户。此外,用户还应确认已开启所有使用中的网络,并确保订阅中的每个钱包均单独授予相关权限。 Revoke.cash 补充称,Ultimate 订阅用户需确认钱包满足两项条件,Auto-Revoking 功能才能正常保护资产:一是在 MetaMask 中为该钱包授予 Auto-Revoking 权限;二是该钱包已升级为对应网络上的 MetaMask 智能账户。通常第二步会在授权过程中自动完成,但如果此前已通过其他钱包应用将该地址升级为智能账户,升级可能失败。