工单自动分类、候选答案自动打分、用户意图实时路由——这类判断如果全交给大模型,每次调用等几秒、成本按分算,规模一大就扛不住。TypeSafe AI 推出的 Jev 把这类高频低延迟的「System One」任务单独拆出来:单次调用 114 毫秒,成本 $0.000081,输出类型安全的结果,附带校准好的置信度。官方数据:比同级 LLM 快 193.6 倍、便宜 444.6 倍。
实现方式不是把 LLM 做小做便宜,而是一种架构上完全不同的模型。本文从概念讲到架构,帮你判断什么场景该用 Jev、什么场景仍然该用 LLM。
Kahneman 框架:System 1 vs System 2
心理学家 Daniel Kahneman 描述了人类思维的两种模式:
- System 1:快、直觉、自动。你用它读路牌、识别讽刺、判断一封邮件像不像垃圾邮件。毫秒级响应,不经思考。
- System 2:慢、审慎、需要推理。你用它写文章、证明定理、排查竞态条件。需要持续专注和工作记忆。
传统 LLM——GPT、Claude、Gemini——本质上都是 System 2:逐 token 生成推理链,最后才给结论。这让它们在开放式创作上无与伦比,但如果你只需要一个是/否判断或一个 1–5 分评分,逐 token 生成推理链就是在浪费时间和钱。
Jev 就是为软件设计的 System 1:接收结构化输入,直接返回类型化决策,没有推理链。
Jev 与 LLM + 结构化输出的区别
目前的常见做法是给 LLM 一个 JSON schema,祈祷它照做:
response = llm.generate(
prompt="分类这张工单:'我的显卡着火了'",
schema={"category": str, "urgency": int, "confidence": float},
)
LLM 仍然逐 token 生成文本,你再去解析和校验。模型可能幻觉一个字段、把 JSON 包在一段散文里、或者输出一个根本不存在的枚举值——轻则代码报错,重则你的系统悄悄接受了一个错误的类型。
Jev 不一样。决策空间在推理之前就已经定义好了:
decision = jev.classify(
input=ticket_text,
choices=["billing", "hardware", "software", "other"],
)
# → {"choice": "hardware", "probability": 0.97, "confidence": 0.94}
模型对预定义选项做并行评估,直接返回类型化结果。它可能在「哪个选项才是对的」这件事上犯错,但永远不会返回一个不存在于你的 schema 里的字段。没有可以被幻觉的 schema——因为 schema 就是架构本身。
这就是 Jev 的「零幻觉」:零 schema 幻觉,不是零错误。这个区分很关键——Jev 可能分错一张工单,但它不可能返回 {"categori": "billng"}。
三类输出原语
Jev 提供三种原语问题类型,每种都返回决策加概率和置信度:
| 原语 | 用途 | 返回 | 示例 |
|---|---|---|---|
| Choice | 从有限选项中选一个 | 选中的选项 + 概率 + 置信度 | ”这条搜索查询格式对不对?” → valid,0.98,0.95 |
| Score | 按评分标准打分 | 分数 + 概率 + 置信度 | ”按事实准确度给这个答案打 1–5 分” → 4,0.82,0.88 |
| Noul | 判断一个二元命题成立的概率 | 0.0–1.0 的浮点数 | ”这个说法有没有源文档支撑?” → 0.93 |
这些原语可以组合使用。一个复杂的路由决策可以拆成三个并行的 Choice 调用加一个 Noul 护栏检查——一次往返全部返回。
底层架构:三大支柱
1. 新架构,不是更小的 LLM
TypeSafe AI 的原话是:Jev “既不小,也不是 LLM”。它从零开始为决策空间评估设计了一套新架构,而不是自回归文本生成。这不是在 GPT 上套一个受限解码器——是另一种模型。
2. 对决策空间进行并行采样
传统 LLM 逐 token 串行生成。要回答”这是不是垃圾邮件?“,它得先生成推理,再生成结论,再格式化成 JSON——每一步都依赖上一步。
Jev 在单次查询里对预定义决策空间的所有分支做并行评估。一个四选一分类,它不会先推理选项 A、再 B、再 C——而是同时评估全部四个,一次性返回所有选项的概率分布。
3. RLCD:强化学习校准决策
大多数现代模型用 RLHF(基于人类反馈的强化学习)调优,优化目标是人类偏好。RLHF 造出的模型听起来自信、乐于助人——但往往真的过度自信:模型说 90% 把握,实际准确率可能只有 70%。
Jev 用 **RLCD(Reinforcement Learning for Calibrated Decisions)**训练,优化目标是校准而非偏好。简单说:让模型不夸大自己的把握。Jev 说 80% 置信度时,在类似输入上它的正确率就应该是 80% 左右。对生产系统来说,这意味着你可以放心地拿置信度做分支控制。
性能:官方数据
TypeSafe AI 发布的 System One 任务工作流对比如下:
| 指标 | Jev | 同级 LLM | 倍数 |
|---|---|---|---|
| 单次调用成本 | $0.000081 | $0.013880 | 便宜 444.6× |
| 延迟 | 0.114 s | 8.566 s | 快 193.6× |
输入定价为 每十亿 token $42(约每百万 token $0.042),官方称比 Claude Fable 5.1 低 238 倍。Jev 的类型化结果不按输出 token 计费。
注意:Jev AI 落地页上写的是早期基准得出的保守区间(40–200× 速度、$0.042/M 输入 token)。193.6× / 444.6× 来自 TypeSafe AI 截至 2026 年 9 月发布的最新对比数据。
第三方验证:LangChain 实验
厂商自己跑的基准看看就好,第三方验证才是硬道理。LangChain 把 Jev 当作 agent 评估器在 LangSmith 中跑了一组实验,与三个 LLM 评估器做对比:
- 设置:五个 weather agent 运行记录,每个由四个评估器(Jev、GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6)按二元标准
does_pass重复评估 100 次,以人工标注为基准。 - Jev 结果:500 次评估全部与人工标注一致(一致率 100%)。
- 方差:Jev 的平均 per-case 方差是 0.0000149。GPT-5.6 Luna 是它的 433 倍,GPT-5.6 Terra 是 913 倍,Claude Sonnet 4.6 是 92 倍。
- LLM 一致率:Terra 99.8%,Luna 96.4%,Claude Sonnet 4.6 80.0%。
LangChain 自己也提醒:这是单一任务上的观察性实验,不能证明低方差一定来自 RLCD 训练。但结果本身够亮眼了——一个 System One 模型在这个任务上做到了完美稳定、完美准确的二元判断,成本和延迟只有任何 LLM 评估器的零头。
这就把 Jev 定位成了第三类评估器:
- 代码规则评估:快、确定、便宜——但只能查语法。
- LLM-as-judge:能理解语义——但慢、贵、方差高。
- System One 评估(Jev):既能理解语义,又快、稳定、校准。
什么时候用 Jev(什么时候不用)
Jev 适合的场景有一个共同特征:判断要快速、重复地做,而且答案空间是可枚举的。
- 智能分支:用语义理解替代死板的 if/else。
- 分类:工单、日志、文档、意图、风险等级。
- 评分:答案质量、相关性、安全性、事实准确度。
- 护栏:“这个回复有没有事实依据?” “这个输出是否违反内容政策?”
- 替代 LLM-as-judge:大规模场景下稳定、便宜的自动评估。
- 批量处理:在 map-reduce 管道里并行跑数百万个决策。
Jev 不适合的事:
- 长文写作或代码生成——它不会输出大段文字。
- 复杂数学推导——它做判断,不做证明。
- 开放式探索——你得先给它定义好决策空间。
- 需要多步推理的任务——交给 System 2 LLM。
实践中常见的问题是:用 Jev 处理 LLM 调用前后的快速决策(路由、校验、评估),把 LLM 留给真正需要生成内容的步骤。
生产集成模式
采用 Jev 的团队应遵循以下实践:
- 把决策空间定义清楚。 Jev 输出的质量取决于你定义的选项和评分标准——类别含糊,概率就含糊。
- 给结构化的输入。 传元数据、检索到的文档、对话摘要这类结构化上下文,不要直接丢一大段自由文本进去。
- 拿置信度做分支,别只看最高选项。 高置信 → 自动执行。中等 → 走保守路径或重试。低置信 → 人工审查或用 LLM 兜底。
- 盯校准曲线。 确认模型给出的置信度和实际正确率是不是一回事。数据分布变了,校准可能跟着变。
- 拆成原子问题。 复杂决策分解成并行的 Choice / Score / Noul 调用,每个都带独立置信度。
- 留好兜底方案。 高风险决策如果置信度不够,路由给人工或者一个更强大但更慢的 LLM。
背景:TypeSafe AI
Jev 由 TypeSafe AI 开发,创始人 Diogo Almeida——公开资料称其为 ChatGPT 联合发明人之一。公司于 2026 年 9 月 15 日发布 Jev 作为其首个公开 System One Model。
试用 Jev
你可以通过 Jev API 试用 Jev,DefAPI 提供半价通道: