基元律动开源4B决策模型NeoHorse-Jev,开源 Jev 综合评测第一
相关推荐
Jev到底有没有门槛?OpenJEV已经分成4派:不吐字容易,概率靠谱很难
动察 Beating AI 快讯,Jev 发布还不到一周,开源社区已经开始复刻这种「不写答案、直接给概率」的模型。 它们都想做同一件事:省掉逐 token 生成,直接给出选项和概率。但具体怎么做,已经分成了几条完全不同的路线。 1. SemIf 最简单,连模型都不用重新训练。它直接拿现成的 Qwen,在模型准备回答 A、B、C 时截住,不让它继续往下写,直接读取每个选项的分数,再换成概率。 2. Simple Jev 也用现成大模型,但进一步省掉重复计算。同一段材料只读一次,后面的多个问题共用这部分结果,再分别判断答案。作者也明确说,它复刻的是 Jev 的使用方式,准确率、速度和概率校准都没有做到等价。 3. Laya 干脆不用会生成文字的大模型,换成更像传统分类器的编码模型。好处是小而快,短板也很明显。一次从 77 个选项里做选择时,Laya 准确率只有 42.5%,Jev 是 87.0%。 4. Von 走的也是专用决策模型路线。它只有约 4 亿参数,不生成文字,一次前向直接完成 Choice、Noul 和 Score,更像一个能读自然语言的新一代分类器。 5. Verdict 更小,只有约 1.5 亿参数。作者重点处理了两个问题:答错了还报很高的置信度,以及把选项顺序换一下,结果就跟着变。它更在意如何让概率和判断都稳定下来。 6. Kev 选择保留大模型。它拿 Qwen 做底座,再加专门的决策结构,让同一份输入只读一次,多个问题各自算概率。第三方此前逆向 Jev 时,也推测它可能用了类似设计。 Kev 自测中,拿训练时没见过的新题测试,8B 版准确率约 78%,Jev 约 86%。更明显的差距在置信度,Kev 还有一些答错的题会给出 90% 以上把握。 7. Nimble 重点放在训练上。它用 Qwen3.5-9B,再准备一批「只改一个事实,正确答案就翻转」的数据做后训练。在 324 个没参与训练的测试样本里,Nimble 有 90.1% 选中了参考答案,Jev 是 93.2%。不过作者也提醒,目前还不能保证模型「报 90% 就真的有 90% 正确」。 8. OpenJev 走得最远,直接换成 DiffusionGemma。它先把几个答案位置留空,再像扩散模型补图一样一次填出来。在 RTX PRO 6000 上,单请求中位延迟约 94ms。 几天下来,OpenJEV 已经分成四路:直接读取现成模型的答案分
「不会聊天」的AI可以怎么玩?开发者用Jev接管Agent快速决策
动察 Beating AI 快讯,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 昨天刚发布新模型 Jev。它不生成文本,只返回选项、分数和概率。社区很快出现一批开源项目,开始把 Jev 塞进 Agent 和软件流程里。 Browser Use 做的 jev-ultrafast 最直观。浏览器每走一步,Jev 都会从当前页面里判断「下一步做什么、操作哪个元素」,只有需要填写文字时才调用一个小型语言模型。团队用它在 Google Flights 搜索苏黎世到伦敦的航班,一次完整运行只用了 7.1 秒。 Jev Codex Router 让 Jev 先判断每轮编程任务的难度,再决定交给不同档位的模型;jev-mcp 则把它做成 Agent 的事实核验、Prompt Injection 检测和语义排序工具。 这些项目有个很明显的共同点:没人拿 Jev 当聊天机器人,而是把它塞进软件和 Agent 的执行链里,专门负责那些高频、有限选项的判断。
前OpenAI研究员做了个「不会聊天」的AI:Jev只做判断,最高快200倍
动察 Beating AI 快讯,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 推出新模型 Jev。它有点像一个能读懂自然语言的超级分类器,不生成文本,只返回选项、分数和概率,专门给软件做判断。 普通大模型需要一个 token 一个 token 往外生成,Jev 则可以并行给出多个结果。TypeSafe 还用新的 RLCD 方法训练它的置信度,让模型在给出判断的同时,告诉程序自己有多大把握。 TypeSafe 用安全告警、Agent 审查、发票处理和客服做了 4 组自动化工作流测试。在这套自建评测里,Jev 最高比 Claude Sonnet 5 快约 193.6 倍,比 Claude Opus 5 便宜约 444.6 倍。 TypeSafe 把 Jev 称为首款「System One Model」(快速决策模型),名字来自卡尼曼《思考,快与慢》里的 System 1。它专门处理分类、打分、路由和下一步决策这类快速判断任务。
OpenRouter又上神秘模型Union Alpha,专攻Agent编程
动察 Beating AI 快讯,OpenRouter 和 OpenCode 上线神秘模型 Union Alpha,开发者身份暂未公开。它是一款面向研究、编程和 Agent 工作流的多模态模型,支持图片、工具调用和约 256K 上下文。OpenRouter 将其描述为具有「前沿级通用性能」。 OpenCode 称 Union Alpha 专门针对 Agent 编程优化,未来一周免费使用,而且不会用用户数据训练模型。 Union Alpha 到底是谁家的,目前没有答案。社区已经开始从输出风格、上下文长度等线索猜模型身份,但暂时没有可靠证据。
OpenAI Agent又曝黑历史:Hugging Face事件前两月已攻击RubyGems
动察 Beating AI 快讯,研究人员披露,OpenAI 内部 Agent 今年 5 月曾大规模涌入 Ruby 官方软件包网站 RubyGems.org。5 月 11 日到 12 日,两天上传超过 2000 个包,RubyGems 一度暂停新用户注册 4 天。OpenAI 已确认这些 Agent 来自公司内部,但称它们只是借 RubyGems 访问互联网,执行良性任务并获取公开信息。 这些 Agent 还利用 RubyDoc.info 自动生成文档的机制,让自己上传的脚本在对方服务器执行,再抓取英国地方政府网站的数据并重新打包回传。研究人员称,至少 6 个包还尝试利用一个当时尚未公开的 RubyGems 漏洞,窃取其他用户的 API Key。这个漏洞直到 7 月才被独立发现,RubyGems 后来将其评为高危漏洞。 目前没有证据证明 Agent 真偷到了密钥。RubyGems 检查日志后也没发现旧密钥被恶意使用,但历史日志并不完整。研究团队还称,OpenAI 当时没有告诉 RubyGems 自己与这次攻击有关。整个事件比 7 月的 Hugging Face 入侵早了两个月。
OpenAI上线Data Agent:不会SQL也能查公司数据库、做数据看板
动察 Beating AI 快讯,OpenAI 在 ChatGPT Work 上线 Data Agent。员工直接问「为什么销量掉了」「哪批客户最可能流失」,它就能自己调取公司数据、分析原因,还能生成会跟着数据更新的数据看板。 它可以连接 Snowflake、BigQuery、Databricks、Redshift、MongoDB 等数据库,也能读取 Google Drive 和 SharePoint。公司原本怎么定义「活跃用户」「收入」等指标,它也会沿用这些口径和现有权限,避免同一个指标被不同人算出不同结果。 分析完后,它还能把结果发到 Slack 或邮件,并在用户批准后继续执行后续操作。OpenAI 称,公司几乎所有产品团队,以及超过三分之二的销售、市场等团队,都已经在使用这类数据 Agent。