Skip to main content

Jev AI / ガイド

Jev:System One モデルによる高速・較正済み AI 判定

チケットの自動分類、回答候補の自動スコアリング、ユーザー意図のリアルタイムルーティング——こうした判断をすべて大規模言語モデルに任せると、1 回の呼び出しに数秒かかり、コストもバカになりません。TypeSafe AI が発表した Jev は、この種の高頻度・低レイテンシな「System One」タスクを独立して処理します:1 回 114 ミリ秒、コスト $0.000081、型安全な結果と較正済みの信頼度を返します。公式データでは、同級 LLM と比べて193.6 倍高速444.6 分の 1 のコストです。

その実現方法は、LLM を小型化・低価格化することではなく、アーキテクチャ自体がまったく異なるモデルを作ることです。この記事では、概念からアーキテクチャまでを解説し、どの場面で Jev を使い、どの場面で LLM を使い続けるべきかを判断できるようにします。

Kahneman の枠組み:System 1 と System 2

心理学者 Daniel Kahneman は、人間の思考に 2 つのモードがあることを示しました:

  • System 1:速く、直感的で、自動的。標識を読む、皮肉を察知する、メールがスパムかどうか判断する——そんな使い方をします。ミリ秒で反応し、意識的な努力を必要としません。
  • System 2:遅く、慎重で、推論を要する。文章を書く、定理を証明する、競合状態をデバッグする——こちらの担当です。持続的な集中と作業記憶が必要です。

従来の LLM——GPT、Claude、Gemini——は本質的に System 2 です:トークンごとに推論チェーンを生成し、最後に結論を出します。オープンエンドな創作では無類の強さを発揮しますが、YES/NO の判定や 1~5 点のスコアリングにトークン単位の推論チェーンを使うのは、時間もコストももったいない。

Jev はソフトウェアのために設計された System 1 です:構造化された入力を受け取り、推論チェーンなしで型付きの判定を直接返します。

Jev と LLM + 構造化出力の違い

現在の一般的なアプローチは、LLM に JSON スキーマを与えて従うことを祈ることです:

response = llm.generate(
  prompt="このチケットを分類して:'GPU が燃えています'",
  schema={"category": str, "urgency": int, "confidence": float},
)

LLM は依然としてトークンごとにテキストを生成し、その後パースとバリデーションをします。モデルがフィールドを幻覚したり、JSON を散文に包んだり、存在しない列挙値を出力したりする可能性があります——軽ければコードのエラーで済みますが、最悪の場合、システムが間違った型を静かに受け入れてしまいます。

Jev は違います。判定空間は推論の前にすでに定義されています:

decision = jev.classify(
  input=ticket_text,
  choices=["billing", "hardware", "software", "other"],
)
# → {"choice": "hardware", "probability": 0.97, "confidence": 0.94}

モデルは事前定義された選択肢を並列評価し、型付きの結果を直接返します。「どの選択肢が正しいか」を間違えることはあっても、あなたのスキーマに存在しないフィールドを返すことは決してありません。幻覚しうるスキーマがない——スキーマそのものがアーキテクチャだからです。

これが Jev の「ゼロ幻覚」の意味です:スキーマ幻覚ゼロであり、ミスゼロではありません。この区別は重要です——Jev はチケットを誤分類することはあっても、{"categori": "billng"} を返すことはあり得ません。

3 つの出力プリミティブ

Jev は 3 つのプリミティブな質問タイプを提供し、それぞれが判定・確率・信頼度を返します:

プリミティブ用途戻り値
Choice有限な選択肢から 1 つを選ぶ選ばれた選択肢 + 確率 + 信頼度”この検索クエリの形式は正しいか?” → valid,0.98,0.95
Score採点基準に沿ってスコアリングスコア + 確率 + 信頼度”事実の正確さでこの回答に 1~5 点” → 4,0.82,0.88
Noul二値命題が成立する確率を判定0.0~1.0 の浮動小数点数”この主張はソース文書に根拠があるか?” → 0.93

これらのプリミティブは組み合わせ可能です。複雑なルーティング判定を、3 つの並列 Choice 呼び出し + 1 つの Noul ガードレールチェックに分解して、1 回のラウンドトリップで全部返すこともできます。

アーキテクチャ:3 本柱

1. 新アーキテクチャ——小さな LLM ではない

TypeSafe AI の言葉を借りれば:Jev は「小さくもなければ、LLM でもない」。判断空間の評価のためにゼロから設計された新しいアーキテクチャであり、自己回帰的なテキスト生成ではありません。GPT に制約付きデコーダーを被せたものではない——まったく別のモデルです。

2. 判定空間への並列サンプリング

従来の LLM はトークンを逐次的に生成します。「これはスパムか?」に答えるには、推論を生成し、結論を出し、JSON にフォーマットする——各ステップが前のステップに依存します。

Jev は単一クエリで事前定義された判定空間の全ブランチを並列評価します。4 択の分類なら、選択肢 A、B、C と順番に推論するのではなく、4 つすべてを同時に評価し、全選択肢の確率分布を一括で返します。

3. RLCD:較正済み判定のための強化学習

ほとんどの現代モデルは RLHF(人間のフィードバックによる強化学習)でチューニングされ、最適化の対象は人間の好みです。RLHF が生み出すモデルは自信に満ち、助けになりそうに聞こえます——しかし往々にして文字通り過信しています:モデルが 90% の確信を言っても、実際の正解率は 70% しかないかもしれない。

Jev は **RLCD(Reinforcement Learning for Calibrated Decisions)**で訓練され、最適化の対象は好みではなく較正です。端的に言えば:モデルに自分の確信を誇張させない。Jev が 80% の信頼度と言ったら、類似の入力における正解率は約 80% であるべきです。本番システムにとって、これは信頼度を使った分岐制御を安心して行えることを意味します。

パフォーマンス:公式データ

TypeSafe AI が発表した System One タスクワークフローの比較:

指標Jev同級 LLM倍率
1 呼び出しコスト$0.000081$0.013880444.6 分の 1
レイテンシ0.114 秒8.566 秒193.6 倍高速

入力価格は 10 億トークンあたり $42(約 100 万トークンあたり $0.042)で、公式発表では Claude Fable 5.1 の 238 分の 1 です。Jev の型付き結果には出力トークン料金がかかりません。

注意:Jev AI のランディングページに書かれているのは、初期ベンチマークに基づく保守的な範囲(40~200× 速度、$0.042/M 入力トークン)です。193.6× / 444.6× は TypeSafe AI が 2026 年 9 月時点で発表した最新比較データです。

第三者検証:LangChain 実験

ベンダー自身のベンチマークは参考程度にして、第三者検証こそが本物です。LangChain は Jev を agent エバリュエーターとして LangSmith 上で一連の実験を行い、3 つの LLM エバリュエーターと比較しました:

  • 設定:5 つの weather agent 実行記録を、4 つのエバリュエーター(Jev、GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6)が二値基準 does_pass で 100 回ずつ繰り返し評価、人手アノテーションを基準に設定。
  • Jev の結果500 回の評価すべてが人手アノテーションと一致(一致率 100%)。
  • 分散:Jev の平均 per-case 分散は 0.0000149。GPT-5.6 Luna はその 433 倍、GPT-5.6 Terra は 913 倍、Claude Sonnet 4.6 は 92 倍。
  • LLM 一致率:Terra 99.8%、Luna 96.4%、Claude Sonnet 4.6 80.0%。

LangChain 自身も注意を促しています:これは単一タスクでの観察実験であり、低分散が必ずしも RLCD 訓練によるものだと証明するものではありません。しかし結果そのものは十分に印象的です——System One モデルがこのタスクで完璧に安定した、完璧に正確な二値判定を実現し、コストとレイテンシはどの LLM エバリュエーターの何分の一かでした。

これにより Jev は第 3 のエバリュエーターとして位置づけられます:

  1. コードルール評価:速く、決定論的で、安い——しかし構文チェックしかできない。
  2. LLM-as-judge:意味を理解できる——しかし遅く、高価で、分散が大きい。
  3. System One 評価(Jev):意味を理解しながら、速く、安定していて、較正されている。

Jev を使う場面(使わない場面)

Jev が適する場面には共通点があります:判定が高速かつ反復的に行われ、答えの空間が列挙可能であること。

  • インテリジェント分岐:硬直的な if/else を意味理解に置き換える。
  • 分類:チケット、ログ、ドキュメント、意図、リスクレベル。
  • スコアリング:回答品質、関連性、安全性、事実の正確さ。
  • ガードレール:「この返答に事実の根拠はあるか?」「この出力はコンテンツポリシーに違反していないか?」
  • LLM-as-judge の代替:大規模シナリオで安定・低コストな自動評価。
  • バッチ処理:map-reduce パイプラインで数百万の判定を並列実行。

Jev が適さないこと:

  • 長文の執筆やコード生成——長いテキストを出力しません。
  • 複雑な数学的導出——判定はするが、証明はしない。
  • オープンエンドな探索——判定空間を事前に定義する必要がある。
  • 多段階推論を要するタスク——System 2 LLM に任せる。

実務でよくあるパターンは、LLM 呼び出しの前後の高速な判定(ルーティング、バリデーション、評価)を Jev が担当し、LLM は本当に生成が必要なステップに残すというものです。

本番統合パターン

Jev を導入するチームは以下の実践に従うべきです:

  1. 判定空間を明確に定義する。 Jev の出力品質は、あなたが定義した選択肢と採点基準の質に依存します——カテゴリが曖昧なら、確率も曖昧になる。
  2. 構造化された入力を渡す。 メタデータ、検索済みドキュメント、会話サマリーなどの構造化コンテキストを渡し、自由記述の長文をそのまま投げ込まない。
  3. 最高選択肢だけでなく信頼度で分岐する。 高信頼 → 自動実行。中程度 → 保守パスまたはリトライ。低信頼 → 人間によるレビューまたは LLM フォールバック。
  4. 較正曲線を監視する。 モデルが示す信頼度と実際の正解率が一致しているか確認する。データ分布が変われば、較正も変わる可能性がある。
  5. 原子問題に分解する。 複雑な判定を並列の Choice / Score / Noul 呼び出しに分解し、それぞれに独立した信頼度を持たせる。
  6. フォールバックを用意する。 高リスクの判定で信頼度が不十分な場合、人間またはより強力だが遅い LLM にルーティングする。

背景:TypeSafe AI

Jev は TypeSafe AI が開発しました。創設者の Diogo Almeida は、公開情報によれば ChatGPT の共同発明者の一人です。同社は 2026 年 9 月 15 日に Jev を初の公開 System One Model として発表しました。

Jev を試す

Jev API で Jev を試用できます。DefAPI が半額チャンネルを提供しています:

→ DefAPI で Jev API を試す