跳到主要內容

Jev AI / 指南

Jev:用 System One 模型實現快速、校準的 AI 決策

工單自動分類、候選答案自動打分、使用者意圖即時路由——這類判斷如果全交給大模型,每次呼叫等幾秒、成本按分算,規模一大就撐不住。TypeSafe AI 推出的 Jev 把這類高頻低延遲的「System One」任務單獨拆出來:單次呼叫 114 毫秒,成本 $0.000081,輸出型別安全的結果,附帶校準好的信心度。官方數據:比同級 LLM 快 193.6 倍便宜 444.6 倍

實作方式不是把 LLM 做小做便宜,而是一種架構上完全不同的模型。本文從概念講到架構,幫你判斷什麼場景該用 Jev、什麼場景仍然該用 LLM。

Kahneman 框架:System 1 vs System 2

心理學家 Daniel Kahneman 描述了人類思維的兩種模式:

  • System 1:快、直覺、自動。你用它看路標、辨識諷刺、判斷一封郵件像不像垃圾郵件。毫秒級回應,不經思考。
  • System 2:慢、審慎、需要推理。你用它寫文章、證明定理、排查競態條件。需要持續專注和工作記憶。

傳統 LLM——GPT、Claude、Gemini——本質上都是 System 2:逐 token 生成推理鏈,最後才給結論。這讓它們在開放式創作上無與倫比,但如果你只需要一個是/否判斷或一個 1–5 分評分,逐 token 生成推理鏈就是在浪費時間和錢。

Jev 就是為軟體設計的 System 1:接收結構化輸入,直接回傳型別化決策,沒有推理鏈。

Jev 與 LLM + 結構化輸出的區別

目前的常見做法是給 LLM 一個 JSON schema,祈禱它照做:

response = llm.generate(
  prompt="分類這張工單:'我的顯示卡著火了'",
  schema={"category": str, "urgency": int, "confidence": float},
)

LLM 仍然逐 token 生成文字,你再去解析和驗證。模型可能幻覺一個欄位、把 JSON 包在一段散文裡、或者輸出一個根本不存在的列舉值——輕則程式碼報錯,重則你的系統悄悄接受了一個錯誤的型別。

Jev 不一樣。決策空間在推理之前就已經定義好了:

decision = jev.classify(
  input=ticket_text,
  choices=["billing", "hardware", "software", "other"],
)
# → {"choice": "hardware", "probability": 0.97, "confidence": 0.94}

模型對預定義選項做平行評估,直接回傳型別化結果。它可能在「哪個選項才是對的」這件事上犯錯,但永遠不會回傳一個不存在於你的 schema 裡的欄位。沒有可以被幻覺的 schema——因為 schema 就是架構本身。

這就是 Jev 的「零幻覺」:零 schema 幻覺,不是零錯誤。這個區分很關鍵——Jev 可能分錯一張工單,但它不可能回傳 {"categori": "billng"}

三類輸出原語

Jev 提供三種原語問題類型,每種都回傳決策加機率和信心度:

原語用途回傳範例
Choice從有限選項中選一個選中的選項 + 機率 + 信心度”這條搜尋查詢格式對不對?” → valid,0.98,0.95
Score按評分標準打分分數 + 機率 + 信心度”按事實準確度給這個答案打 1–5 分” → 4,0.82,0.88
Noul判斷一個二元命題成立的機率0.0–1.0 的浮點數”這個說法有沒有原始文件支撐?” → 0.93

這些原語可以組合使用。一個複雜的路由決策可以拆成三個平行的 Choice 呼叫加一個 Noul 護欄檢查——一次往返全部回傳。

底層架構:三大支柱

1. 新架構,不是更小的 LLM

TypeSafe AI 的原話是:Jev “既不小,也不是 LLM”。它從零開始為決策空間評估設計了一套新架構,而不是自迴歸文字生成。這不是在 GPT 上套一個受限解碼器——是另一種模型。

2. 對決策空間進行平行取樣

傳統 LLM 逐 token 序列生成。要回答”這是不是垃圾郵件?“,它得先生成推理,再生成結論,再格式化成 JSON——每一步都依賴上一步。

Jev 在單次查詢裡對預定義決策空間的所有分支做平行評估。一個四選一分類,它不會先推理選項 A、再 B、再 C——而是同時評估全部四個,一次性回傳所有選項的機率分布。

3. RLCD:強化學習校準決策

大多數現代模型用 RLHF(基於人類回饋的強化學習)調優,最佳化目標是人類偏好。RLHF 造出的模型聽起來自信、樂於助人——但往往真的過度自信:模型說 90% 把握,實際準確率可能只有 70%。

Jev 用 **RLCD(Reinforcement Learning for Calibrated Decisions)**訓練,最佳化目標是校準而非偏好。簡單說:讓模型不誇大自己的把握。Jev 說 80% 信心度時,在類似輸入上它的正確率就應該是 80% 左右。對生產系統來說,這意味著你可以放心地拿信心度做分支控制。

效能:官方數據

TypeSafe AI 發布的 System One 任務工作流對比如下:

指標Jev同級 LLM倍數
單次呼叫成本$0.000081$0.013880便宜 444.6×
延遲0.114 s8.566 s快 193.6×

輸入定價為 每十億 token $42(約每百萬 token $0.042),官方稱比 Claude Fable 5.1 低 238 倍。Jev 的型別化結果不按輸出 token 計費。

注意:Jev AI 落地頁上寫的是早期基準得出的保守區間(40–200× 速度、$0.042/M 輸入 token)。193.6× / 444.6× 來自 TypeSafe AI 截至 2026 年 9 月發布的最新對比數據。

第三方驗證:LangChain 實驗

廠商自己跑的基準看看就好,第三方驗證才是硬道理。LangChain 把 Jev 當作 agent 評估器在 LangSmith 中跑了一組實驗,與三個 LLM 評估器做對比:

  • 設定:五個 weather agent 執行記錄,每個由四個評估器(Jev、GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6)按二元標準 does_pass 重複評估 100 次,以人工標註為基準。
  • Jev 結果500 次評估全部與人工標註一致(一致率 100%)。
  • 變異數:Jev 的平均 per-case 變異數是 0.0000149。GPT-5.6 Luna 是它的 433 倍,GPT-5.6 Terra 是 913 倍,Claude Sonnet 4.6 是 92 倍。
  • LLM 一致率:Terra 99.8%,Luna 96.4%,Claude Sonnet 4.6 80.0%。

LangChain 自己也提醒:這是單一任務上的觀察性實驗,不能證明低變異數一定來自 RLCD 訓練。但結果本身夠亮眼了——一個 System One 模型在這個任務上做到了完美穩定、完美準確的二元判斷,成本和延遲只有任何 LLM 評估器的零頭。

這就把 Jev 定位成了第三類評估器:

  1. 程式碼規則評估:快、確定、便宜——但只能查語法。
  2. LLM-as-judge:能理解語義——但慢、貴、變異數高。
  3. System One 評估(Jev):既能理解語義,又快、穩定、校準。

什麼時候用 Jev(什麼時候不用)

Jev 適合的場景有一個共同特徵:判斷要快速、重複地做,而且答案空間是可列舉的。

  • 智慧分支:用語義理解替代死板的 if/else。
  • 分類:工單、日誌、文件、意圖、風險等級。
  • 評分:答案品質、相關性、安全性、事實準確度。
  • 護欄:“這個回覆有沒有事實依據?” “這個輸出是否違反內容政策?”
  • 替代 LLM-as-judge:大規模場景下穩定、便宜的自動評估。
  • 批次處理:在 map-reduce 管道裡平行跑數百萬個決策。

Jev 不適合的事:

  • 長文寫作或程式碼生成——它不會輸出大段文字。
  • 複雜數學推導——它做判斷,不做證明。
  • 開放式探索——你得先給它定義好決策空間。
  • 需要多步推理的任務——交給 System 2 LLM。

實踐中常見的模式是:用 Jev 處理 LLM 呼叫前後的快速決策(路由、驗證、評估),把 LLM 留給真正需要生成內容的步驟。

生產整合模式

採用 Jev 的團隊應遵循以下實踐:

  1. 把決策空間定義清楚。 Jev 輸出的品質取決於你定義的選項和評分標準——類別含糊,機率就含糊。
  2. 給結構化的輸入。 傳詮釋資料、檢索到的文件、對話摘要這類結構化上下文,不要直接丟一大段自由文字進去。
  3. 拿信心度做分支,別只看最高選項。 高信心 → 自動執行。中等 → 走保守路徑或重試。低信心 → 人工審查或用 LLM 兜底。
  4. 盯校準曲線。 確認模型給出的信心度和實際正確率是不是一回事。資料分布變了,校準可能跟著變。
  5. 拆成原子問題。 複雜決策分解成平行的 Choice / Score / Noul 呼叫,每個都帶獨立信心度。
  6. 留好兜底方案。 高風險決策如果信心度不夠,路由給人工或者一個更強大但更慢的 LLM。

背景:TypeSafe AI

Jev 由 TypeSafe AI 開發,創辦人 Diogo Almeida——公開資料稱其為 ChatGPT 聯合發明人之一。公司於 2026 年 9 月 15 日發布 Jev 作為其首個公開 System One Model。

試用 Jev

你可以透過 Jev API 試用 Jev,DefAPI 提供半價通道:

→ 在 DefAPI 上試用 Jev API