加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源Blockbeats

Jev到底有没有门槛?OpenJEV已经分成4派:不吐字容易,概率靠谱很难

动察 Beating AI 快讯,Jev 发布还不到一周,开源社区已经开始复刻这种「不写答案、直接给概率」的模型。 它们都想做同一件事:省掉逐 token 生成,直接给出选项和概率。但具体怎么做,已经分成了几条完全不同的路线。 1. SemIf 最简单,连模型都不用重新训练。它直接拿现成的 Qwen,在模型准备回答 A、B、C 时截住,不让它继续往下写,直接读取每个选项的分数,再换成概率。 2. Simple Jev 也用现成大模型,但进一步省掉重复计算。同一段材料只读一次,后面的多个问题共用这部分结果,再分别判断答案。作者也明确说,它复刻的是 Jev 的使用方式,准确率、速度和概率校准都没有做到等价。 3. Laya 干脆不用会生成文字的大模型,换成更像传统分类器的编码模型。好处是小而快,短板也很明显。一次从 77 个选项里做选择时,Laya 准确率只有 42.5%,Jev 是 87.0%。 4. Von 走的也是专用决策模型路线。它只有约 4 亿参数,不生成文字,一次前向直接完成 Choice、Noul 和 Score,更像一个能读自然语言的新一代分类器。 5. Verdict 更小,只有约 1.5 亿参数。作者重点处理了两个问题:答错了还报很高的置信度,以及把选项顺序换一下,结果就跟着变。它更在意如何让概率和判断都稳定下来。 6. Kev 选择保留大模型。它拿 Qwen 做底座,再加专门的决策结构,让同一份输入只读一次,多个问题各自算概率。第三方此前逆向 Jev 时,也推测它可能用了类似设计。 Kev 自测中,拿训练时没见过的新题测试,8B 版准确率约 78%,Jev 约 86%。更明显的差距在置信度,Kev 还有一些答错的题会给出 90% 以上把握。 7. Nimble 重点放在训练上。它用 Qwen3.5-9B,再准备一批「只改一个事实,正确答案就翻转」的数据做后训练。在 324 个没参与训练的测试样本里,Nimble 有 90.1% 选中了参考答案,Jev 是 93.2%。不过作者也提醒,目前还不能保证模型「报 90% 就真的有 90% 正确」。 8. OpenJev 走得最远,直接换成 DiffusionGemma。它先把几个答案位置留空,再像扩散模型补图一样一次填出来。在 RTX PRO 6000 上,单请求中位延迟约 94ms。 几天下来,OpenJEV 已经分成四路:直接读取现成模型的答案分
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-01 09:51

Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol

动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。

07-19 11:39

阿里云推个人版 Token Plan,开放 Qwen3.8-Max 预览体验

PANews 7月19日消息,阿里云正式发布 Token Plan 个人版,开放 Qwen3.8-Max-Preview 体验。Qwen3.8-Max 参数量达 2.4T,主攻代码工程和专业办公场景,正式版将于近期发布并开源。个人版订阅限时优惠为:Lite 39元/月、Standard 139元/月、Pro 499元/月;团队版标准、高级、尊享席位价格分别为 150元、550元、1398元/席位/月。活动期间,Qwen3.8-Max-Preview 白天 Credits 消耗 1 折,个人版 Token Plan 夜间在此基础上再享 2 折。

09-19 08:22

DFlash团队进军Mac,27B模型跑到144Token/s

动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。

09-19 05:15

下一代App可能没有固定界面,Jev让App界面实时重组

动察 Beating AI 快讯,Vercel Labs 工程师 Chris Tate 给 json-render 接入 Jev,开始试验让 AI 在运行时直接组合 UI。 json-render 会提前准备好按钮、卡片、输入框、数据和动作。Jev 不需要像大模型一样逐 Token 写完整 JSON,只负责决定用哪些组件、怎么排序、放在哪里,再交给正常的 UI 渲染器。新界面默认一次判断选出主要组件,需要时再用第二次判断安排布局。 在同一个火车票界面生成演示中,默认 JSONL 模式从请求到完成用了 3.21 秒,Jev 只用了 0.88 秒。 未来 App 的界面可能根本不用完全写死。UI 可以变成运行时决策,同一个 App 面对不同用户、任务和状态,临时拼出不同的页面。Jev 这次演示已经把完整生成时间压到 1 秒以内,至少让这种交互开始有了实时感。 Runway 上月底发布的 Solaris 也在赌类似方向,只是路线更激进。Solaris 用世界模型逐帧生成整个界面,直接绕过传统代码和组件;Jev 仍然使用开发者提前写好的组件和动作,只动态决定怎么组合。一个想让软件变成实时生成的视频世界,一个更像让软件拥有一张随时重组的脸。

09-18 13:55

PrismML把Qwen3.8 27B压到5.9GB,自测保留98.2%性能

动察 Beating AI 快讯,加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 发布 Ternary Bonsai 2 27B,把 Qwen3.8 27B 的 270 亿参数模型压到 5.9GB。它把权重压成 -1、0、+1 三种值,体积只有 FP16 原版约九分之一。模型支持 26.2 万 Token 上下文、图文输入和 Agent 工具调用,并以 Apache 2.0 许可开放权重。 相比两个月前的第一代 Bonsai 27B,新版体积基本没变,但底模从 Qwen3.6 换成了 Qwen3.8。PrismML 自测称,综合基准成绩相对完整版的保留率从约 95% 提到 98.2%,其中数学和代码成绩已经非常接近原版。官方还演示了它在 RTX 5090 上直接跑 Cline 编程 Agent 和 Computer Use。

09-18 04:03

Qwen3.8-Omni-Flash上线:自己看视频、调工具、交成片

动察 Beating AI 快讯,阿里千问上线原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图片、音频、视频和 1M 上下文。 这代明显加强了音视频 Agent 能力。模型可以自己从视频里找信息、规划任务,再调用外部工具完成剪辑、配音和渲染。官方展示了长会议处理、短剧翻译、电影解说、MV 制作和视频转图文笔记等场景。 面对几小时的长视频,它也不用从头到尾全部处理。模型会先判断答案可能在哪,再逐步定位关键片段。OmniVideoBench 上,准确率从 63.4 提到 67.8,Token 消耗从 145,736 降到 79,117,少了 45.7%。 千问称,Qwen3.8-Omni-Flash 在 30 项评测上的平均成绩比 Qwen3.5-Omni-Plus 提升超过 26%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过后者。音频输入成本下降超过 98%,音视频输入下降超过 93%。 目前 Qwen3.8-Omni-Flash 模型权重尚未公开,只开放了 API。千问同时开源了 Qwen-MM-Plugins,可以装进 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,给它们补上图片、音频、长视频处理和视频剪辑能力。 另一套 Qwen-Live Harness 更像实时调度层。用户可以直接和实时全模态模型说话,再把复杂任务交给 Gemini CLI、Claude Code、Codex 等后台 Agent 持续执行。它会跟踪任务进度,做完后再主动回来告诉你结果。