Jev 两天内引出 6 个复刻版本:判别式决策模型为何突然走红
Jev 热度迅速升温
Jev 发布后在两天内获得了大量关注。其发布视频据称达到 3600 万次观看。作为对比,同期被提及的 OpenAI Navier-Stokes 结果约为 7400 万次观看,Anthropic Fable 5 约为 5700 万次观看。
Vercel 也表示,Jev 在 AI Gateway 历史上是被采用最快的模型之一:首日触达约 13% 的团队,约为 GPT-5.6 系列的 2 倍、Fable 5.1 的 6 倍。
Jev 本身并未开源,这直接引发了大量架构猜测、复刻尝试和示例演示。讨论的核心集中在:它是否更接近 ModernBERT 一类编码器模型,还是基于扩散模型;以及它作为非生成式“决策模型”能否成为 LLM 工作流中的新基础组件。
6 个类 Jev 实现
目前社区已经出现多个复刻或类 Jev 项目,主要方向包括编码器判别模型、扩散模型、Qwen 微调和轻量注意力模型。
1. Laya
Laya 约 4.21 亿参数,采用 ModernBERT-large 编码器,并额外加入两个 Transformer 层,用于对用户提供的选项进行打分。
其方法包括:
- 在序列嵌入上使用 PPO;
- 输出逐轮转换轨迹;
- 给出 0.0 到 1.0 的概率分数。
相关讨论中也有一些争议:
- 有人认为项目作者没有获得足够认可;
- 有人声称其使用 RLCD,但尚未给出充分论证;
- 其置信度被认为更偏向基于熵的估计,而不是经过校准的概率。
2. DiffusionGemmaJev
DiffusionGemmaJev 从扩散模型角度尝试复现 Jev 的能力。有讨论称,它在部分基准上表现接近 Jev。
3. Bespoke Nimble
Bespoke Nimble 是基于 Qwen3.5-9B 的 LoRA 微调方案,使用对比式数据筛选方法。
在其自建评测中:
- Qwen 基座从 66% 提升到 90%;
- Jev 的对应成绩为 93%;
- 推理延迟报告为 H100 上约 100ms;
- 可用于本地运行场景。
不过,该结果来自项目方或社区自建评测,尚缺乏统一标准基准验证。
4. SemIf / OpenJev
SemIf(原 OpenJev)使用 4B 和 35B 规模的因果 Qwen3.5 骨干模型,并在最后一个 token 上接入一个小型三分类 NLI 分类器。
它与 Laya 的差异主要在于:
- Laya 更偏编码器和选项打分架构;
- SemIf 更接近因果语言模型骨干加分类头的方案。
5. Jevlike
Jevlike 是一个轻量级选项注意力模型,使用 40K 字节嵌入。
其基本思路是:
- 每个候选项被表示为 query;
- query 从共享上下文表示中读取信息;
- 最后为每个候选项输出分数。
6. Kev-0.5B
Kev-0.5B 基于 Qwen2.5-0.5B,在其上加入 LoRA adapter 和一个小型 readout head。
它的定位是一个更小、更轻量的类 Jev 模型,目标之一是在 MacBook Pro 等本地设备上运行。
为什么 Jev 引发关注?
Jev 被讨论最多的不是聊天能力,而是它作为非生成式决策模型在系统中的位置。
一些开发者将其称为“System 1”式组件:不是负责长文本生成或复杂推理,而是负责快速判断、路由、筛选和分类。
被反复提及的应用包括:
- 请求路由;
- 引用选择;
- 是否升级给人工处理;
- 法务或运营流程中的决策;
- 工具调用选择;
- 浏览器自动化中的下一步动作判断;
- 通知、界面适配和设备端传感器决策。
这种模型的潜在价值在于:如果它能以更低成本、更低延迟给出可靠判断,就可以承担过去由小型生成式模型完成的一部分控制流任务。
早期集成场景:浏览器与工作流控制
目前较有说服力的应用集中在浏览器和计算机使用工作流中。例如:
- 将事故报告分类到不同升级路径;
- 在浏览器任务中辅助结构化决策;
- 与 LangChain、Cline 等工具结合,用于浏览器操作或插件工作流。
从这些案例看,Jev 更像是工作流控制平面的一部分,而不是传统意义上的聊天机器人。
关键问题:数据与基准仍不清晰
围绕 Jev 和复刻模型,仍有几个重要问题没有解决。
首先是数据。已有讨论指出,相关数据被承认为 100% 合成数据。合成数据能快速构造训练集,但其覆盖范围、偏差和泛化能力仍需要更严格验证。
其次是基准。许多演示强调速度和延迟,但对于“决策质量”的评估还缺乏统一标准。不同项目使用不同自建评测,很难直接横向比较。
第三是概率校准。Jev 类模型常被用于路由和升级决策,如果输出概率没有经过可靠校准,就可能在实际系统中带来误判风险。
小结
Jev 的走红说明,AI 系统并不只需要更强的生成模型,也需要更便宜、更快、可嵌入工作流的判断层。
两天内出现多个复刻版本,表明社区正在快速探索这类“判别式决策模型”的边界。但目前关于架构、数据、评测和真实生产效果仍缺乏统一答案。对开发者来说,Jev 值得关注,但更适合作为系统组件实验,而不是已经定型的新范式。
