Jev 火了两周,开源生态已经长出 28 个项目

0 阅读16分钟

两周内,TypeSafe AI 的决策模型 Jev 带出了一整个开源生态。本文把两篇源文章里的 28 个项目去重整合:先讲清 Jev 是什么、这波项目分几类,再逐个介绍每个项目(附仓库地址),最后给出选型建议。收藏这一篇就够了。

Jev是什么?

Jev 是什么。 2026 年 9 月 15 日,TypeSafe AI 发布了第一款公开的 System One 模型 Jev,训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions),目标是让报出来的概率尽量接近真实正确率。它和聊天模型相反,不写句子:你给它一段 state(工单、日志、邮件、JSON、文档片段)和一组事先定义好的问题,它只回三类结构化答案——choice 从给定选项里选、score 按有序量表打分、noul 给是/否的概率。所有问题对着同一份材料并行评估,一次往返给出程序能直接分支的值。每个问题约 70–500 毫秒,输出免费,延迟几乎不随问题数线性爆炸。

这波项目在做什么。 社区在抄的不是「又一个聊天机器人」,而是一种新接口:软件把判断权交给模型,模型只负责在封闭选项里给概率,程序自己决定怎么分支。两篇源文章合计 28 个项目(已去重),分两大阵营——8 个「Open Jev」从不同路线复刻决策模型本身,20 个应用项目把 Jev 塞进浏览器操作、Agent 基建、实时控制、数据流水线和判断类小工具里。下面逐个介绍。

28 个「Open Jev」

1. SemIf:最省事的一派

仓库: github.com/TheoLeeCJ/S…

不训练,直接读现成大模型的选项 logits。作者把 Qwen 冻住,拼好 state、问题和 A/B/C 描述,做一次前向,不解码任何答案 token,只把固定选项位置上的分数拿出来做 softmax。主模型 Qwen3.5-4B,RTX 3090 上 21 个二元判断约 1.023 秒(同模型生成同等 JSON 要 5.332 秒),在 102 行可对齐子集上一致率约 84.5%(Jev 公布 88.3%)。门槛低:一张 3090、Apple Silicon 甚至浏览器 WebGPU 都能跑;概率没有按 RLCD 校准,生产上必须自己分桶验证。MIT 许可。它证明「接口形态」可以当天复刻,不证明「决策质量」已经齐平。

2. Simple Jev:同一段材料只读一次

仓库: github.com/featherless… 演示: simple-jev.featherless.ai

同属「读现成模型分数」一派,工程上更像可落地的分类器服务。把公共说明 + state 做成共享前缀,先算一遍 KV cache,后面每个问题只跑自己的后缀,再读允许标签的 next-token logits,由服务器拼 JSON。作者写得很克制:复刻的是接口和用法,不代表准确率、速度和概率校准已到 Jev 水平。提供本地 Hugging Face / PyTorch 服务和 Featherless 演示 API,适合想先把工单路由、情绪分级跑起来的团队。

3. Laya:放弃「会写字的大模型」

仓库: github.com/NandhaKisho… 权重: Hugging Face convaiinnovations/laya

来自 Convai Innovations,几亿参数,结构更像传统分类器:ModernBERT / mmBERT 编码 state 和选项,再接决策头。速度是名片:T4 上单问题 p50 约 32.8ms,10 个问题打包约 72.3ms,比 Jev 公布的 236–276ms 快 7–8 倍。短板也真实:Banking77(77 个意图)只有 42.5%(Jev 87.0%),选项一多就被挤爆;76.6% 那个好看数字来自针对性微调后的 laya-typed-decisions。Apache 2.0,可完全本地部署。适合选项不太多、要极低延迟、要离线的场景。

4. Von:从头做的专用决策模型

仓库: github.com/wfzyx/von

约 395M(约 1.5GB),基于双向 ModernBERT 类编码器加 Option-Marker 并行选项注意力,一次前向同时处理 Choice、Noul、Score。本地 GPU / Apple MPS 单次十几到二十毫秒。定位是 Jev 的本地替代:工单分流、邮件优先级、内容审核、安全事件分诊,以及亚 20ms 闭环的控制任务。作者自测 49 任务套件宏准确率约 71.5%,对比表里 Jev 仍明显更高。快、小、可本地;复杂语义和超多选项上和闭源 Jev 有可见落差。

5. Verdict:专打「虚高置信度」和「换序变卦」

仓库: github.com/Heman10x-NG…

约 150M,底座 ModernBERT-base,双头设计:一个输出选项分布,一个单独输出置信度;训练时加 Symmetric Permutation-KL,同一题打乱选项顺序再算一遍,惩罚两次分布不一致。在 2000 条留出决策上准确率 77.10%、Brier 0.0636、置信度头 ECE 0.0144,选项顺序翻转率报 4.76%。笔记本级 GTX 1660 Ti 上训练约 8.8 小时。它把「校准」和「顺序稳健」从口号变成了训练目标,是复刻派里最对题的一个。

6. Kev:给 Qwen 加决策结构

仓库: github.com/jaredpalmer… 作者: Jared Palmer

改造现有大模型而不是扔掉它:共享前缀只读一次,问题之间用块因果掩码或分行隔离,API 刻意对齐 TypeSafe System One,官方 Python SDK 的 base URL 可以直接指到本地。当前一代基于 Qwen3.5,公开 0.8B / 4B / 9B。Kev-9B 在新来源测试集约 83.7%(Jev 约 85.7%),Brier 仍落后(0.243 vs 0.211),差距在收窄。Apache-2.0。对愿意微调、又想留住 Qwen 世界知识的人,这是最接近「开源版 Jev 配方」的项目之一。

7. Nimble:靠训练把 Qwen 练成 Jev

仓库: github.com/bespokelabs… 权重: Hugging Face bespokelabs/Bespoke-Nimble-9B

Bespoke Labs 出品,更像一篇可复现的训练论文:底座 Qwen3.5-9B,LoRA 只训答案 token;数据方法是构造几乎一样的两段材料、只改一个事实让正确答案翻转,逼模型学「哪一句在决定答案」。324 条留出样本上匹配率 90.12%,超过未微调的 27B(84.88%),离 Jev 的 93.21% 只差约 3 个点。注意:概率尚未完全校准,324 条样本偏窄。想做垂直领域「小 Jev」,这套对比翻转的数据配方比堆分类样本更值得抄。

8. OpenJev:用扩散模型一次把答案填上

仓库: github.com/razorback16… 模型: NVIDIA 量化的 DiffusionGemma 26B-A4B

最不一样的一条:不按 token 往后写,而是对一整块「画布」做去噪,一次填多个答案槽位,没有逐 token 生成也没有 JSON 解析,格式上不可能写出 schema 以外的东西。RTX PRO 6000 上每请求 3 个问题,并发 1 的 p50/p95 约 94ms。接口按 Jev 的 /v1/systemone 来,官方 SDK 改 base URL 就能打。限制:choice 最多 128 个选项(Jev 是 255),显存门槛约 24GB。如果说读 logits 一派是「截住自回归模型的笔」,OpenJev 就是「换一种生成物理」。

9. jev-ultrafast:7 秒搜完 Google Flights

仓库: github.com/browser-use… 作者: Browser Use

把网页变成编号后的控件表,Jev 每步只答两件事:下一步做什么、点哪个元素;只有选中「打字」才把字符串交给小生成模型。苏黎世飞伦敦的 Google Flights 完整搜索约 7.1 秒,中位 Jev 延迟约 178ms,浏览器协议调用从一千多次降到一百次左右。不靠截图视觉循环,靠 DOM 快照和索引动作空间,快也便宜。适合想做网页 Agent、又不想每步都让大模型写一长段「我现在要点搜索按钮」的人。

10. fast-jev-compaction:压缩上下文,但不改写原文

仓库: github.com/tamaratran/…

Claude Code 自带 compaction 会「总结」旧对话,文件路径、报错原文容易丢。这个插件把整段会话交给 Jev,对每条工具调用问「还需要吗」「输出要不要原文保留」,没用的删或截断,留下的原样保留。实测 Desktop 会话从约 18.8 万 token 压到 3.3 万,约 1.4 秒、压缩率 82%。失败时回退官方摘要。适合会话里堆满 Read / Grep / Bash 输出、一压缩就丢关键证据的人。

11. json-render:Jev 不写 JSON,只选组件

仓库: github.com/vercel-labs… 作者: Vercel Labs

生成式 UI 框架:先规定组件目录,模型只能在目录里组界面。v0.21.0 加了实验性 Jev 组合器:Jev 不逐 token 生成 JSON,只在候选组件、属性和布局里做 Choice,代码把选择拼成合法 spec 再渲染。Playground 可切「Jev」模式,经 Vercel AI Gateway 调用 typesafe-ai/jev。把「生成 UI」从开放写作改成白名单里连连看。适合受不了模型写出非法 JSON 的产品团队。

12. typesafe-mcp:刚拿到 Key 的人,先装这个

仓库: github.com/itsmostafa/…

Go 单二进制 MCP。装好后 Claude Code、Claude Desktop、Codex、Pi 都能直接调 evaluate 工具:把 state + Choice / Score / Noul 丢给 Jev,拿回带概率的结构化答案。没有提示词要维护,也没有 JSON 解析层,一条命令完成注册。最适合刚拿到 API 的人:先验证「Agent 会不会主动去问 Jev」,再考虑更复杂的审查 / 路由插件。

13. jev-mcp:现成的判断工具箱

仓库: github.com/jkudish/jev…

把常见判断收成十个 MCP 工具:jev_verify 主张 vs 证据、jev_screen 进上下文前筛不可信内容、jev_find / jev_rerank 语义找和重排、jev_classify / jev_decide 分类和有界决策、jev_review / jev_gate 看 diff、核对「做完了」的声明等。一次调用约 150–500ms。Agent 仍负责改文件、跑命令,Jev 只给类型化判决。适合已在用 MCP、想给 Agent 加一层廉价机械检查的人。

14. SemDecide:Shell 里的语义 grep

仓库: github.com/sharziki/se…

作者叫它「意义版 grep、判断版 jq」。标准输入灌文本或 JSONL,输出谓词、路由、分数、过滤后的流和稳定的进程退出码。不写 prompt、不解析散文,不确定时按你设的阈值走。典型接法:爬虫结果先过相关性过滤;CI 里对 changelog / 告警文本分类;数据管道按语义丢垃圾行。适合运维、数据、爬虫脚本党,不想为一次分类拉起完整 Agent。

15. jev-codex-router:先判难度,再选模型档位

仓库: github.com/0xNatoshi/j…

Codex 每一轮(含工具续写)先让 Jev 看任务难度,再选模型档位、思考深度、速度模式:简单改注释走便宜快档,碰架构 / 安全走强档。本地跑分类服务,接到 Codex Router 的 jev/auto 提供者上。只路由「下一轮该用谁」,不代替代码审查。适合订阅里有多档模型、心疼每轮都开满推理的人。

16. Winnow:上下文垃圾回收

仓库: github.com/GhalebDweik…

发生在工具结果刚出来、还没进上下文的那一刻。大段 Read / Bash / Grep 切成约 25 行一块,Jev 对每块问「当前任务还需要吗」:高相关或不确定就原文保留,确定不相关换成三行占位,看起来像报错的一律不藏。全文本地缓存,Agent 需要时用 key 取回。原则:不确定就不能丢。适合动不动读整个大文件、上下文被日志淹没的 Claude Code 用户。

17. jev-review:审查前先挑出高风险改动

仓库: github.com/devagrawal0…

带本地看板的分阶段审查:风险矩阵(Noul)→ 文件画像(Choice + Score)→ 抽证据 → 机制分类 → 严重度打分 → 再决定要不要交给更贵模型或人。结果在本机 127.0.0.1:4317 看板展开。另有走 MCP 的变体给 Claude Code / Codex / Cursor / OpenCode 连续打质量分。两者都强调:Jev 打分,Agent 或人改代码。适合 PR 太多、想先筛「周五能不能合」的团队。

18. Blink:把仓库当成要走的迷宫

仓库: github.com/ellipsis-de…

不问「这段代码什么意思」,只问「下一层该进哪个目录 / 文件」。多个 walker 从根目录出发,Jev 给文件夹和文件名打分,高分路径分到更多 walker,直到落到文件,输出每个文件收走百分之多少的 walker。读的是路径和名字不是全文件内容,所以快,也因此找不到「名字不像但内容相关」的文件。适合大仓库冷启动、先缩小范围再让大模型精读。

19. agent-desktop:读无障碍树,点下一个按钮

仓库: github.com/lahfir/agen…

桌面自动化运行时,v0.9.2 起带 jev-desktop 技能:系统无障碍树(按钮、菜单、输入框)编成候选,Jev 判断下一步点谁、输入什么,飞标可跟着元素走便于录屏看决策。和 jev-ultrafast 同思路:屏幕是选项表,不是要看懂的照片。同类还有 macOS + OCR 的变体。共同限制:无障碍树残缺、自定义绘制控件、验证码都会让判断层失明。适合想把「电脑使用」从截图 VLM 换成结构化控件选择的人。

20. typesafe-mario:不看画面,读内存打马里奥

仓库: github.com/fhshaik/typ…

模拟器 RAM 翻译成结构化 JSON:马里奥运动、跳跃轨迹、前方敌人、地形、近期操作效果。Jev 在封闭动作集里选一个(原地、右走、右跳、右跑等),默认每 8 帧决策一次。仓库不含 ROM,需自行合法准备游戏文件。教学意义很强:感知在代码里完成,模型只做选择,去掉视觉才能单独衡量决策质量。适合想直观感受 System One 闭环控制长什么样的人。

21. jev-drone:飞控保命,Jev 只做战术

仓库: github.com/RomanSlack/… 演示: jev-drone.vercel.app

MuJoCo 里的四旋翼只用机载相机飞五站障碍。几何控制器跑在控制频率上负责稳定和安全,Jev 约 2.5Hz 看结构化态势,决定爬升、刹车、穿缝这类上层动作。问题、选项和阈值集中写在战术层文件顶部,改策略改数字不改提示词长文。这是仿真不是真机适航认证,但把「判断」和「控制」拆开的做法,对机器人、自动驾驶很有参考价值。

22. OneVOneJev:浏览器里和 Jev 1v1

仓库: github.com/emrickgarre…

Three.js 第三人称 / FPS 竞技场,先到 5 杀。服务端 60Hz 模拟,Jev 每个决策 tick 在走位、视角、瞄准、开火、跳跃里做选择,故意做成 MW2 式 quickscope,没 Key 时有启发式兜底。把「决策模型能不能进游戏循环」做成可玩的东西:延迟必须压在几百毫秒,输出必须是枚举,不能是一段作战分析。适合演示、录视频或研究实时对抗策略。

23. jev-trader:每个 Monad 区块做一次买卖

仓库: github.com/jarrodwatts… 演示: jev-trader.vercel.app

Kuru 上的 MON-USDC 订单簿,Monad 约每 300 毫秒出一块。Jev 看盘口回答买还是卖,程序挂 post-only 限价单吃价差,模型延迟约 81ms。没私钥默认空转,MODEL=jev 才走真模型。架构上代码算中间价和库存,Jev 只做方向判断,硬风控一票否决。口号很冲但这是实验盘,不是理财建议。适合想看决策模型能不能进链上节奏的人。

24. Prism:判断市场状态,但不下单

与 jev-trader 对照着看最清楚:jev-trader 让 Jev 直接选买/卖,Prism 只让 Jev 判断 toxic flow、市场压力、均值回归这类状态标签,执行仍走你已经信任的原有策略,故意不让模型碰下单键。亏钱的那一步保持确定性,模型只负责难写规则的「读盘感觉」。适合已有交易系统、只想加一层状态机,而不是把整盘交给模型的人。

25. neo4jev:在图上一次走一条边

仓库: github.com/jexp/neo4je… 作者: Neo4j 社区老兵 Michael Hunge

默认连 Neo4j 公开的 Companies 知识图谱。走到一个节点,就把出边(关系类型、属性、目标节点)列成 Choice,Jev 给出下一步该走哪条边的概率分布,路径和邻域用 neo4j-viz 画出来,schema 现场发现。这是 GraphRAG 的另一种走法:不是一次检索一堆邻居再让 LLM 写作,而是语义走迷宫。适合已把业务放进图数据库、需要可解释探索路径的人。

26. jev-curate:筛训练数据

仓库: github.com/AkashPriyad…

Rust CLI + Python(Polars / PyArrow)。JSONL / Parquet 流式读入,用预设量表做质量、相关性、风险判断,通过的进训练集,丢掉的另存。宣称可到每秒 1500+ 行(取决于并发和行长度),并强调输出 token 免费的成本优势。它不做开放改写,只做「这条要不要留下」。对合成数据和预训练语料这种海量、重复、质量参差的东西,决策模型比聊天模型更对口。适合微调团队、数据平台。

27. Canny:不许 Agent 嘴硬说做完了

仓库: github.com/qkal/Canny

挂在 Claude Code / Codex 的 hook 上,记一本只追加、不改写的账本:改了哪些文件、跑过什么命令、退出码多少、测试过没有。Agent 宣称「完成」时先看账本有没有证据。原则写在 README 第一行:事实归代码,判断归 Jev,只有事实能否决。没跑测试、没构建、刚改完就报完成,直接拦住。零运行时依赖。适合被「我已经修完了(测试是红的)」折磨过的人。

28. killmyidea:创业点子的死刑判决书

仓库: github.com/monteduro/k…

输入一段点子,一次请求并行问 10 个问题:8 个独立开发者视角的 0–4 分项(真问题、赚钱、切入、竞争……),外加品类和「这句话人能不能看懂」。加权平均后低于 50 判 KILL、50–64 判 FIX、65 及以上判 SHIP,目标可切「赚钱 / 开源 / 好玩」。没有生成模型写商业计划书,只有分数和判决。恶趣味,但把 Jev 的本职展示得很干净:多维度打分,最后落成三个动作。适合点子太多、需要一个不讲情面的过滤器,不当作尽职调查。

总结

28 个项目看下来,三条选型主线值得记住。复刻实现里:想当天跑通选 SemIf,想可落地上服务选 Simple Jev,要极低延迟离线选 Laya / Von,最在意校准选 Verdict,想自己微调选 Kev / Nimble,愿意折腾扩散的选 OpenJev——但要清楚,各仓库自测数字来自不同题集,复刻的是接口形态,概率校准都还没到 Jev 水平,生产前必须用业务数据自己验。应用项目的共同规律是:写和想归大模型,判和选归 Jev,执行权留在确定性代码里(Prism 不碰下单键、Canny 只有事实能否决、jev-review 强调 Jev 打分人改代码)。起步路径建议:先装 typesafe-mcp 验证 Agent 会不会主动来问,再按场景挑 Winnow(上下文治理)、jev-ultrafast(网页操作)、jev-curate(数据筛选)这类单点工具。模型会迭代,但「封闭选项 + 概率输出」这个接口形态,值得先在自己的系统里试一个最小场景。

关注

如果这篇文章对你有帮助,可以点个关注,我会持续更新 AI 开源工具的深度解读系列,Jev 生态有新项目会继续跟进。