工單自動分類、候選答案自動打分、使用者意圖即時路由——這類判斷如果全交給大模型,每次呼叫等幾秒、成本按分算,規模一大就撐不住。TypeSafe AI 推出的 Jev 把這類高頻低延遲的「System One」任務單獨拆出來:單次呼叫 114 毫秒,成本 $0.000081,輸出型別安全的結果,附帶校準好的信心度。官方數據:比同級 LLM 快 193.6 倍、便宜 444.6 倍。
實作方式不是把 LLM 做小做便宜,而是一種架構上完全不同的模型。本文從概念講到架構,幫你判斷什麼場景該用 Jev、什麼場景仍然該用 LLM。
Kahneman 框架:System 1 vs System 2
心理學家 Daniel Kahneman 描述了人類思維的兩種模式:
- System 1:快、直覺、自動。你用它看路標、辨識諷刺、判斷一封郵件像不像垃圾郵件。毫秒級回應,不經思考。
- System 2:慢、審慎、需要推理。你用它寫文章、證明定理、排查競態條件。需要持續專注和工作記憶。
傳統 LLM——GPT、Claude、Gemini——本質上都是 System 2:逐 token 生成推理鏈,最後才給結論。這讓它們在開放式創作上無與倫比,但如果你只需要一個是/否判斷或一個 1–5 分評分,逐 token 生成推理鏈就是在浪費時間和錢。
Jev 就是為軟體設計的 System 1:接收結構化輸入,直接回傳型別化決策,沒有推理鏈。
Jev 與 LLM + 結構化輸出的區別
目前的常見做法是給 LLM 一個 JSON schema,祈禱它照做:
response = llm.generate(
prompt="分類這張工單:'我的顯示卡著火了'",
schema={"category": str, "urgency": int, "confidence": float},
)
LLM 仍然逐 token 生成文字,你再去解析和驗證。模型可能幻覺一個欄位、把 JSON 包在一段散文裡、或者輸出一個根本不存在的列舉值——輕則程式碼報錯,重則你的系統悄悄接受了一個錯誤的型別。
Jev 不一樣。決策空間在推理之前就已經定義好了:
decision = jev.classify(
input=ticket_text,
choices=["billing", "hardware", "software", "other"],
)
# → {"choice": "hardware", "probability": 0.97, "confidence": 0.94}
模型對預定義選項做平行評估,直接回傳型別化結果。它可能在「哪個選項才是對的」這件事上犯錯,但永遠不會回傳一個不存在於你的 schema 裡的欄位。沒有可以被幻覺的 schema——因為 schema 就是架構本身。
這就是 Jev 的「零幻覺」:零 schema 幻覺,不是零錯誤。這個區分很關鍵——Jev 可能分錯一張工單,但它不可能回傳 {"categori": "billng"}。
三類輸出原語
Jev 提供三種原語問題類型,每種都回傳決策加機率和信心度:
| 原語 | 用途 | 回傳 | 範例 |
|---|---|---|---|
| Choice | 從有限選項中選一個 | 選中的選項 + 機率 + 信心度 | ”這條搜尋查詢格式對不對?” → valid,0.98,0.95 |
| Score | 按評分標準打分 | 分數 + 機率 + 信心度 | ”按事實準確度給這個答案打 1–5 分” → 4,0.82,0.88 |
| Noul | 判斷一個二元命題成立的機率 | 0.0–1.0 的浮點數 | ”這個說法有沒有原始文件支撐?” → 0.93 |
這些原語可以組合使用。一個複雜的路由決策可以拆成三個平行的 Choice 呼叫加一個 Noul 護欄檢查——一次往返全部回傳。
底層架構:三大支柱
1. 新架構,不是更小的 LLM
TypeSafe AI 的原話是:Jev “既不小,也不是 LLM”。它從零開始為決策空間評估設計了一套新架構,而不是自迴歸文字生成。這不是在 GPT 上套一個受限解碼器——是另一種模型。
2. 對決策空間進行平行取樣
傳統 LLM 逐 token 序列生成。要回答”這是不是垃圾郵件?“,它得先生成推理,再生成結論,再格式化成 JSON——每一步都依賴上一步。
Jev 在單次查詢裡對預定義決策空間的所有分支做平行評估。一個四選一分類,它不會先推理選項 A、再 B、再 C——而是同時評估全部四個,一次性回傳所有選項的機率分布。
3. RLCD:強化學習校準決策
大多數現代模型用 RLHF(基於人類回饋的強化學習)調優,最佳化目標是人類偏好。RLHF 造出的模型聽起來自信、樂於助人——但往往真的過度自信:模型說 90% 把握,實際準確率可能只有 70%。
Jev 用 **RLCD(Reinforcement Learning for Calibrated Decisions)**訓練,最佳化目標是校準而非偏好。簡單說:讓模型不誇大自己的把握。Jev 說 80% 信心度時,在類似輸入上它的正確率就應該是 80% 左右。對生產系統來說,這意味著你可以放心地拿信心度做分支控制。
效能:官方數據
TypeSafe AI 發布的 System One 任務工作流對比如下:
| 指標 | Jev | 同級 LLM | 倍數 |
|---|---|---|---|
| 單次呼叫成本 | $0.000081 | $0.013880 | 便宜 444.6× |
| 延遲 | 0.114 s | 8.566 s | 快 193.6× |
輸入定價為 每十億 token $42(約每百萬 token $0.042),官方稱比 Claude Fable 5.1 低 238 倍。Jev 的型別化結果不按輸出 token 計費。
注意:Jev AI 落地頁上寫的是早期基準得出的保守區間(40–200× 速度、$0.042/M 輸入 token)。193.6× / 444.6× 來自 TypeSafe AI 截至 2026 年 9 月發布的最新對比數據。
第三方驗證:LangChain 實驗
廠商自己跑的基準看看就好,第三方驗證才是硬道理。LangChain 把 Jev 當作 agent 評估器在 LangSmith 中跑了一組實驗,與三個 LLM 評估器做對比:
- 設定:五個 weather agent 執行記錄,每個由四個評估器(Jev、GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6)按二元標準
does_pass重複評估 100 次,以人工標註為基準。 - Jev 結果:500 次評估全部與人工標註一致(一致率 100%)。
- 變異數:Jev 的平均 per-case 變異數是 0.0000149。GPT-5.6 Luna 是它的 433 倍,GPT-5.6 Terra 是 913 倍,Claude Sonnet 4.6 是 92 倍。
- LLM 一致率:Terra 99.8%,Luna 96.4%,Claude Sonnet 4.6 80.0%。
LangChain 自己也提醒:這是單一任務上的觀察性實驗,不能證明低變異數一定來自 RLCD 訓練。但結果本身夠亮眼了——一個 System One 模型在這個任務上做到了完美穩定、完美準確的二元判斷,成本和延遲只有任何 LLM 評估器的零頭。
這就把 Jev 定位成了第三類評估器:
- 程式碼規則評估:快、確定、便宜——但只能查語法。
- LLM-as-judge:能理解語義——但慢、貴、變異數高。
- System One 評估(Jev):既能理解語義,又快、穩定、校準。
什麼時候用 Jev(什麼時候不用)
Jev 適合的場景有一個共同特徵:判斷要快速、重複地做,而且答案空間是可列舉的。
- 智慧分支:用語義理解替代死板的 if/else。
- 分類:工單、日誌、文件、意圖、風險等級。
- 評分:答案品質、相關性、安全性、事實準確度。
- 護欄:“這個回覆有沒有事實依據?” “這個輸出是否違反內容政策?”
- 替代 LLM-as-judge:大規模場景下穩定、便宜的自動評估。
- 批次處理:在 map-reduce 管道裡平行跑數百萬個決策。
Jev 不適合的事:
- 長文寫作或程式碼生成——它不會輸出大段文字。
- 複雜數學推導——它做判斷,不做證明。
- 開放式探索——你得先給它定義好決策空間。
- 需要多步推理的任務——交給 System 2 LLM。
實踐中常見的模式是:用 Jev 處理 LLM 呼叫前後的快速決策(路由、驗證、評估),把 LLM 留給真正需要生成內容的步驟。
生產整合模式
採用 Jev 的團隊應遵循以下實踐:
- 把決策空間定義清楚。 Jev 輸出的品質取決於你定義的選項和評分標準——類別含糊,機率就含糊。
- 給結構化的輸入。 傳詮釋資料、檢索到的文件、對話摘要這類結構化上下文,不要直接丟一大段自由文字進去。
- 拿信心度做分支,別只看最高選項。 高信心 → 自動執行。中等 → 走保守路徑或重試。低信心 → 人工審查或用 LLM 兜底。
- 盯校準曲線。 確認模型給出的信心度和實際正確率是不是一回事。資料分布變了,校準可能跟著變。
- 拆成原子問題。 複雜決策分解成平行的 Choice / Score / Noul 呼叫,每個都帶獨立信心度。
- 留好兜底方案。 高風險決策如果信心度不夠,路由給人工或者一個更強大但更慢的 LLM。
背景:TypeSafe AI
Jev 由 TypeSafe AI 開發,創辦人 Diogo Almeida——公開資料稱其為 ChatGPT 聯合發明人之一。公司於 2026 年 9 月 15 日發布 Jev 作為其首個公開 System One Model。
試用 Jev
你可以透過 Jev API 試用 Jev,DefAPI 提供半價通道: