Jev开始管Attention,MiniMax H3生成时间砍掉41.7%
相关推荐
Jev到底有没有门槛?OpenJEV已经分成4派:不吐字容易,概率靠谱很难
动察 Beating AI 快讯,Jev 发布还不到一周,开源社区已经开始复刻这种「不写答案、直接给概率」的模型。 它们都想做同一件事:省掉逐 token 生成,直接给出选项和概率。但具体怎么做,已经分成了几条完全不同的路线。 1. SemIf 最简单,连模型都不用重新训练。它直接拿现成的 Qwen,在模型准备回答 A、B、C 时截住,不让它继续往下写,直接读取每个选项的分数,再换成概率。 2. Simple Jev 也用现成大模型,但进一步省掉重复计算。同一段材料只读一次,后面的多个问题共用这部分结果,再分别判断答案。作者也明确说,它复刻的是 Jev 的使用方式,准确率、速度和概率校准都没有做到等价。 3. Laya 干脆不用会生成文字的大模型,换成更像传统分类器的编码模型。好处是小而快,短板也很明显。一次从 77 个选项里做选择时,Laya 准确率只有 42.5%,Jev 是 87.0%。 4. Von 走的也是专用决策模型路线。它只有约 4 亿参数,不生成文字,一次前向直接完成 Choice、Noul 和 Score,更像一个能读自然语言的新一代分类器。 5. Verdict 更小,只有约 1.5 亿参数。作者重点处理了两个问题:答错了还报很高的置信度,以及把选项顺序换一下,结果就跟着变。它更在意如何让概率和判断都稳定下来。 6. Kev 选择保留大模型。它拿 Qwen 做底座,再加专门的决策结构,让同一份输入只读一次,多个问题各自算概率。第三方此前逆向 Jev 时,也推测它可能用了类似设计。 Kev 自测中,拿训练时没见过的新题测试,8B 版准确率约 78%,Jev 约 86%。更明显的差距在置信度,Kev 还有一些答错的题会给出 90% 以上把握。 7. Nimble 重点放在训练上。它用 Qwen3.5-9B,再准备一批「只改一个事实,正确答案就翻转」的数据做后训练。在 324 个没参与训练的测试样本里,Nimble 有 90.1% 选中了参考答案,Jev 是 93.2%。不过作者也提醒,目前还不能保证模型「报 90% 就真的有 90% 正确」。 8. OpenJev 走得最远,直接换成 DiffusionGemma。它先把几个答案位置留空,再像扩散模型补图一样一次填出来。在 RTX PRO 6000 上,单请求中位延迟约 94ms。 几天下来,OpenJEV 已经分成四路:直接读取现成模型的答案分
Jev团队公开Coding Agent设计草案:每轮重新决定模型该看什么
动察 Beating AI 快讯,TypeSafe 创始人 Diogo Almeida 公开了一份 Coding Agent 设计草案,希望社区直接拿去实验。他直说团队大概率没时间自己把这些想法都做出来。 这份草案最核心的改动是上下文。现在的 Coding Agent 通常会一直带着之前的聊天、工具结果和代码状态,太长了再压缩或重启。TypeSafe 想让 Agent 每轮重新判断:继续沿用现有缓存,还是重新挑一份更合适的上下文;哪些保留全文,哪些只留摘要,哪些直接丢掉。 Almeida 认为,现有 Agent 不少设计都被 KV Cache 反过来绑住了。比如任务先切给便宜模型,再切回强模型,强模型可能还得重新读一遍长上下文,最后反而更贵;工具定义长期塞在系统提示词里,也会一直占空间。 上下文如果能动态重组,模型路由、Sub-agent、MCP 和 AGENTS.md 也能跟着按需加载。简单任务交给便宜模型,需要哪个工具再加载哪个,子 Agent 只拿和自己任务相关的状态。Almeida 暂时把这套思路叫「Meta-attention」。
Jev彻底开放:候补名单取消,所有人现在都能直接用
动察 Beating AI 快讯,TypeSafe AI 宣布 Jev 正式向所有人开放,取消候补名单。用户现在可以直接进入官方 Console 注册并使用,不需要再申请 Early Access。 Jev 不负责聊天或写代码,只做分类、打分和判断。开发者提前给出候选项,它直接返回选择、概率和置信度,让程序拿结果继续执行。目前官方价格仍是每百万输入 Token 0.042 美元,输出免费。 开放前,Jev 已经在第三方平台快速扩散。Vercel 称,它接入 AI Gateway 后 24 小时内被近 13% 的付费团队使用,成为 AI Gateway 历史采用速度最快的新模型,采用率超过同期 GPT-5.6 系列的 2 倍。
阶跃Step 5正式发布,10月15日开源
动察 Beating AI 快讯,阶跃星辰正式发布旗舰模型 Step 5 Preview。它采用稀疏 MoE 架构,总参数 600B,每次仅激活 27B,支持 100 万 Token 上下文和图文输入。API 和 Studio 已经全量开放,完整模型权重将在 10 月 15 日放出。 此前 Artificial Analysis 已经提前跑完评测。Step 5 Preview 在 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。AA 当前测得其输出约 100 Token/s,每项任务成本 0.71 美元;Kimi K3 Max 为 2 美元。 官方重点展示了它跑长任务的能力。阶跃让 Step 5 Preview 连续最多 24 小时自主优化一套 H100 GPU 内核。模型会自己改代码、跑测试、比较结果,再继续迭代。约 22 小时后达到 508 TFLOPS,同一实验中的 Claude Opus 5 为 493 TFLOPS。 另一项 24 小时实验里,Step 5 Preview 自己设计后训练数据,把 Qwen3-30B-A3B 在 AIME24 上的准确率从 53.3% 提到 60%,与 Claude Opus 5 持平,同时消耗更少的标注 Token。
阶跃Step 5偷跑:AA跑分追平Kimi K3,输出价不到1/5
动察 Beating AI 快讯,阶跃星辰还没正式官宣 Step 5,预览版已经提前出现在 Artificial Analysis。Step 5 Preview 是一款多模态推理模型,AA 标注其总参数约 600B、每次推理激活 27B,支持图片输入和 100 万 Token 上下文。 它在最新 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。Terminal-Bench 4.0 上,Step 5 Preview 得到 33%,Kimi K3 为 13%;SciCode 两者都是 59%。 Step 5 Preview 每百万输入 Token 1 美元,输出 2.7 美元;Kimi K3 分别为 3 美元和 15 美元。Step 5 的输出价格不到 K3 的五分之一,AA 跑完整套 Intelligence Index 的成本也只有 K3 的约四分之一。 阶跃星辰还没官宣 Step 5,但 AA 已经通过 StepFun API 跑完评测。参数和价格目前都还不是官方最终口径。
下一代App可能没有固定界面,Jev让App界面实时重组
动察 Beating AI 快讯,Vercel Labs 工程师 Chris Tate 给 json-render 接入 Jev,开始试验让 AI 在运行时直接组合 UI。 json-render 会提前准备好按钮、卡片、输入框、数据和动作。Jev 不需要像大模型一样逐 Token 写完整 JSON,只负责决定用哪些组件、怎么排序、放在哪里,再交给正常的 UI 渲染器。新界面默认一次判断选出主要组件,需要时再用第二次判断安排布局。 在同一个火车票界面生成演示中,默认 JSONL 模式从请求到完成用了 3.21 秒,Jev 只用了 0.88 秒。 未来 App 的界面可能根本不用完全写死。UI 可以变成运行时决策,同一个 App 面对不同用户、任务和状态,临时拼出不同的页面。Jev 这次演示已经把完整生成时间压到 1 秒以内,至少让这种交互开始有了实时感。 Runway 上月底发布的 Solaris 也在赌类似方向,只是路线更激进。Solaris 用世界模型逐帧生成整个界面,直接绕过传统代码和组件;Jev 仍然使用开发者提前写好的组件和动作,只动态决定怎么组合。一个想让软件变成实时生成的视频世界,一个更像让软件拥有一张随时重组的脸。