Skip to content

研究

Jev 权重闭源、无论文。社区几天内就逆向出了推理形态 —— 但 RLCD 校准训练仍是真正的壁垒。下面是复现项目,以及检验官方说法的独立评测。

开源复现(训练管线)

项目为什么值得看
TheoLeeCJ/SemIf2.1kRTX 3090 零训练复现 "semantic if":读 Qwen3.5-4B 选项 logits。共享前缀复用后 20 决策/秒;公开子集一致率 0.845(Jev 为 0.883)
vinnylarouge/jevlike1k最早出圈的复现;选项作为 query 做 attention 池化。作者明确声明不是 RLCD 复现
TianyuCodings/NanoJev1.2k中文作者;0.6B 端到端训练流水线 + paired proper-reward learning —— 目前最接近 RLCD 的公开实现,权重和数据集在 HF
jaredpalmer/kev692与官方 /v1/systemone API 完全兼容。关键数据:同分布仅差 1.8pp,但 OOD 差 19.1pp —— 证明校准训练才是壁垒
arnabgho/rlcd-lite1GRPO + Brier 奖励重实现;核心消融:proper scoring rule 奖励产生校准,二元奖励摧毁校准
DECRUX9812/openjev-lm1最低成本入门:纯 CPU LoRA 训练 89 分钟、$0,与 API 答案一致率 92.9%

更多:LightJev · jev-visual · razorback16/openjev · typed-decisions · openJev-verdict-2.0

推理层复现(零训练)

项目做什么
ekzhang/openjev-sglang206Qwen3.6-35B-A3B + SGLang,prefill-only + radix cache,完整实现官方 HTTP API
AlexWortega/openjev最早开放权重;Qwen3.5-4B 改 3 类 NLI 交叉编码器,零样本玩 Doom
bnsd55/jevmlx40Apple Silicon MLX
r-ms/mini-jev26冻结 Qwen3-4B 读选项字母 logits
Trecto34/openjev-fighting-ring0Diffusion/RLCD/Block-Causal/NLI 各方案同场竞技

大规模 / 预注册评测

评测结论
willkelly/jev-evaluation9 组对抗实验、123,805 次请求、$12.69:域内校准 ECE 0.075,但 OOD 完全失效(随机 3-SAT);礼貌的权威注入能改变 147/200 个答案;255 问题批处理真的免费
exs-brady/jev-eval-evidence55,347 条类型化判断,Jev 对阵 10 个 LLM + 关键词/正则基线,预注册 + 跨模型家族盲复现
ickma2311/jev-baselines-evalBanking77/CLINC150:Jev 0.832/0.870,但 9ms 的 bge-small + 逻辑回归基线达 0.933;实测延迟仅为 nano-LLM 的 2.2 倍 —— 经典基线在某些赛道仍然更强
Fox-Islam/jev-bias-bench反事实偏见基准,11,984 次调用:29 种人设属性 × 招聘/信贷/临床/保释等场景,含噪声底线与阴性对照
kokuren333/jev-jmle-benchmark9 年日本医师国家考试(3,556 题):88.58%;配套论文已投 medRxiv
scienthoon/jev-ood-calibrationOpenBookQA 94.2% / ECE 0.024;但在不可知的规则任务上准确率 44.7% 而自报 p 0.74 —— 校准偏差方向随题型翻转
EmilLindfors/jev-horingssvar-eval挪威听证会文件:准确率与 DeepSeek V4.1 Flash 持平,但 $0.22 vs $3.08 / 千份,中位 0.32s vs 26s

细分任务评测

评测结论
anisselbd/jev-phishing-bench直接问:62.6%(正则 91.8%);原子化拆解 + 逻辑回归:95.0%
bitnovus/jev-spam-eval18.5k 封邮件 98.3% ≈ TF-IDF;但分布漂移下 97.3% vs 72.5% —— 抗漂移是真优势
mahlernim/jev-korean-benchmark阅读几乎无损;输入重排会改变 13–14% 的答案
rorshopping/jev-on-a-laptop1.5B 写不出 28 字段 JSON,却能 0.4 秒做 28 个 schema 合法决策;7B 是甜点规模
jev-poker与求解器吻合仅 63% 且置信度倒挂 —— 必须喂"嚼碎"的中间结论

更多:jev-banking77-experiment · jev-vs-open-decision-models · mnist-text-input · jev-ja-eval · jev-decision-benchmarks · does-jev-confidence-mean-anything · decision-model-benchmark · jev-capability-atlas

深度报告与文章

文章为什么读
sgnt.ai — "You could have built Jev"最佳技术解析;重建了单 token logits 方案并交叉比对各复现结果
HackSing/jev-report52 页独立研究报告(中文)
mizzlelover/jev-hub聚合发布首周 714 条 X 帖子(226 个演示视频、114 篇长文)—— 视频洪流入口
掘金:发布 3 天登顶 HN,我把 Jev 的源码和黑料都扒了一遍扒 Vercel AI SDK 源码
lindfors.no — A first look at Jev基于真实文档的严谨成本/延迟测量
ic.work:TypeSafe 发布 Jev 模型质疑向分析

更多:ickas.dev · southbridge.ai · classmethod · mikulskibartosz.name

其他 Awesome 清单