Skip to main content

Jev AI / 가이드

Jev: System One 모델로 구현하는 빠르고 보정된 AI 판단

티켓 자동 분류, 답변 후보 자동 채점, 사용자 의도 실시간 라우팅——이런 판단을 전부 대형 언어 모델에 맡기면 호출 한 번에 몇 초씩 기다려야 하고 비용도 만만치 않습니다. TypeSafe AI가 발표한 Jev는 이런 고빈도·저지연 “System One” 작업을 따로 분리해 처리합니다: 호출당 114밀리초, 비용 $0.000081, 타입 안전한 결과와 보정된 신뢰도를 반환합니다. 공식 데이터 기준으로 동급 LLM 대비 193.6배 빠르고, 444.6분의 1 비용입니다.

구현 방식은 LLM을 작고 싸게 만드는 게 아니라, 아예 다른 아키텍처의 모델을 만드는 것입니다. 이 글에서는 개념부터 아키텍처까지 설명하며, 어떤 상황에서 Jev를 쓰고 어떤 상황에서 여전히 LLM을 써야 하는지 판단할 수 있게 도와줍니다.

카네만 프레임워크: System 1 vs System 2

심리학자 다니엘 카네만은 인간 사고의 두 가지 모드를 설명했습니다:

  • System 1: 빠르고, 직관적이며, 자동적입니다. 표지판을 읽고, 비꼬는 말투를 알아차리고, 이메일이 스팸인지 판단할 때 씁니다. 밀리초 단위로 반응하며 의식적인 노력이 필요 없습니다.
  • System 2: 느리고, 신중하며, 추론이 필요합니다. 글을 쓰고, 정리를 증명하고, 경쟁 상태 버그를 추적할 때 씁니다. 지속적인 집중과 작업 기억이 필요합니다.

기존 LLM——GPT, Claude, Gemini——은 본질적으로 System 2입니다: 토큰 단위로 추론 사슬을 생성하고 마지막에 결론을 냅니다. 개방형 창작에서는 타의 추종을 불허하지만, 예/아니오 판단이나 1~5점 채점 하나에 토큰 단위 추론 사슬을 돌리는 건 시간과 돈의 낭비입니다.

Jev는 소프트웨어를 위해 설계된 System 1입니다: 구조화된 입력을 받아 추론 사슬 없이 타입화된 판단을 바로 반환합니다.

Jev와 LLM + 구조화 출력의 차이

현재 흔한 방식은 LLM에 JSON 스키마를 주고 따라주기를 바라는 것입니다:

response = llm.generate(
  prompt="이 티켓을 분류해 줘: 'GPU에 불이 났어요'",
  schema={"category": str, "urgency": int, "confidence": float},
)

LLM은 여전히 토큰 단위로 텍스트를 생성하고, 당신이 그걸 파싱하고 검증합니다. 모델이 필드를 환각하거나, JSON을 산문에 싸서 내놓거나, 존재하지도 않는 열거값을 출력할 수 있습니다——좋으면 코드 에러, 최악으면 시스템이 조용히 잘못된 타입을 받아들입니다.

Jev는 다릅니다. 판단 공간은 추론 이전에 이미 정의되어 있습니다:

decision = jev.classify(
  input=ticket_text,
  choices=["billing", "hardware", "software", "other"],
)
# → {"choice": "hardware", "probability": 0.97, "confidence": 0.94}

모델은 사전 정의된 선택지를 병렬 평가하고 타입화된 결과를 바로 반환합니다. “어떤 선택지가 맞는가”를 틀릴 수는 있어도, 당신의 스키마에 없는 필드를 반환하는 일은 결코 없습니다. 환각할 스키마가 없기 때문입니다——스키마 자체가 곧 아키텍처니까요.

이것이 Jev의 “제로 환각”입니다: 스키마 환각 제로이지, 실수 제로가 아닙니다. 이 구분이 중요합니다——Jev는 티켓을 잘못 분류할 수 있지만, {"categori": "billng"}을 반환할 수는 없습니다.

3가지 출력 프리미티브

Jev는 세 가지 프리미티브 질문 유형을 제공하며, 각각 판단 + 확률 + 신뢰도를 반환합니다:

프리미티브용도반환예시
Choice유한한 선택지 중 하나를 고름선택된 옵션 + 확률 + 신뢰도”이 검색 쿼리 형식이 맞는가?” → valid,0.98,0.95
Score채점 기준에 따라 점수 매김점수 + 확률 + 신뢰도”사실 정확도로 이 답변에 1~5점” → 4,0.82,0.88
Noul이진 명제가 참일 확률 판정0.0~1.0 부동소수점”이 주장에 근거 문서가 있는가?” → 0.93

이 프리미티브들은 조합 가능합니다. 복잡한 라우팅 판단을 세 개의 병렬 Choice 호출 + 하나의 Noul 가드레일 체크로 분해해서, 한 번의 왕복으로 전부 반환할 수 있습니다.

내부 아키텍처: 3개 기둥

1. 새 아키텍처, 더 작은 LLM이 아님

TypeSafe AI의 말대로: Jev는 “작지도, LLM도 아닙니다.” 판단 공간 평가를 위해 제로부터 설계된 새 아키텍처이지, 자기회귀적 텍스트 생성이 아닙니다. GPT에 제한 디코더를 씌운 게 아니라——완전히 다른 모델입니다.

2. 판단 공간에 대한 병렬 샘플링

기존 LLM은 토큰을 순차적으로 생성합니다. “이거 스팸인가?”에 답하려면 추론을 생성하고, 결론을 내고, JSON으로 포맷해야 합니다——각 단계가 이전 단계에 의존합니다.

Jev는 단일 쿼리에서 사전 정의된 판단 공간의 모든 브랜치를 병렬 평가합니다. 4택 1 분류에서 A, B, C 순으로 추론하지 않고, 네 개를 동시에 평가해서 모든 선택지의 확률 분포를 한꺼번에 반환합니다.

3. RLCD: 보정된 판단을 위한 강화학습

대부분의 현대 모델은 RLHF(인간 피드백 기반 강화학습)로 튜닝되며, 최적화 대상은 인간 선호입니다. RLHF가 만든 모델은 자신감 넘치고 도움이 되어 보이지만——종종 문자 그대로 과신합니다: 모델이 90% 확신을 말해도 실제 정확도는 70%일 수 있습니다.

Jev는 **RLCD(Reinforcement Learning for Calibrated Decisions)**로 훈련되며, 최적화 대상은 선호가 아니라 보정입니다. 간단히 말해: 모델이 자신의 확신을 과장하지 않게 만드는 것. Jev가 80% 신뢰도라고 말하면 유사한 입력에서 실제 정확도도 약 80%여야 합니다. 프로덕션 시스템에서 이것은 신뢰도 기반 분기 제어를 안심하고 할 수 있다는 뜻입니다.

성능: 공식 수치

TypeSafe AI가 발표한 System One 작업 워크플로 비교:

지표Jev동급 LLM배율
호출당 비용$0.000081$0.013880444.6분의 1
지연 시간0.114초8.566초193.6배 빠름

입력 가격은 10억 토큰당 $42(약 백만 토큰당 $0.042)이며, 공식 발표 기준 Claude Fable 5.1보다 238배 저렴합니다. Jev의 타입화 결과에는 출력 토큰 요금이 부과되지 않습니다.

참고: Jev AI 랜딩 페이지에는 초기 벤치마크 기반 보수적 범위(40~200배 속도, $0.042/M 입력 토큰)가 적혀 있습니다. 193.6× / 444.6×는 TypeSafe AI가 2026년 9월 기준 발표한 최신 비교 수치입니다.

제3자 검증: LangChain 실험

벤더 자체 벤치마크는 참고만 하고, 제3자 검증이 진짜입니다. LangChain은 Jev를 agent 평가자로 LangSmith에서 일련의 실험을 돌려 세 개의 LLM 평가자와 비교했습니다:

  • 설정: 5개 weather agent 실행 기록을 4개 평가자(Jev, GPT-5.6 Luna, GPT-5.6 Terra, Claude Sonnet 4.6)가 이진 기준 does_pass로 100회씩 반복 평가, 사람 라벨을 기준으로 설정.
  • Jev 결과: 500회 평가 전부 사람 라벨과 일치(일치율 100%).
  • 분산: Jev의 평균 per-case 분산은 0.0000149. GPT-5.6 Luna는 그 433배, GPT-5.6 Terra는 913배, Claude Sonnet 4.6은 92배.
  • LLM 일치율: Terra 99.8%, Luna 96.4%, Claude Sonnet 4.6 80.0%.

LangChain 스스로도 강조합니다: 이건 단일 작업에서의 관찰 실험이며, 낮은 분산이 반드시 RLCD 훈련 때문이라고 증명하지 않습니다. 그래도 결과 자체는 충분히 인상적입니다——System One 모델이 이 작업에서 완벽히 안정적이고 완벽히 정확한 이진 판단을 해냈고, 비용과 지연은 어느 LLM 평가자보다 훨씬 낮았습니다.

이로써 Jev는 세 번째 유형의 평가자로 자리매김합니다:

  1. 코드 규칙 평가: 빠르고, 결정론적이고, 싸다——하지만 구문 검사만 가능.
  2. LLM-as-judge: 의미를 이해함——하지만 느리고, 비싸고, 분산이 큼.
  3. System One 평가(Jev): 의미를 이해하면서 빠르고, 안정적이며, 보정됨.

Jev를 써야 할 때 (아닐 때)

Jev가 맞는 상황의 공통점: 판단이 빠르게, 반복적으로 이뤄지고, 답 공간이 열거 가능할 것.

  • 지능형 분기: 경직된 if/else를 의미 이해로 대체.
  • 분류: 티켓, 로그, 문서, 의도, 위험 등급.
  • 채점: 답변 품질, 관련성, 안전성, 사실 정확도.
  • 가드레일: “이 응답에 사실적 근거가 있는가?” “이 출력이 콘텐츠 정책을 위반하는가?”
  • LLM-as-judge 대체: 대규모 시나리오에서 안정적·저렴한 자동 평가.
  • 배치 처리: map-reduce 파이프라인에서 수백만 판단을 병렬 실행.

Jev가 맞지 않는 일:

  • 장문 작성이나 코드 생성——긴 텍스트를 출력하지 않습니다.
  • 복잡한 수학적 유도——판단은 하지만 증명은 하지 않습니다.
  • 개방형 탐색——판단 공간을 미리 정의해 줘야 합니다.
  • 다단계 추론이 필요한 작업——System 2 LLM에 맡기세요.

실무에서 흔한 패턴: LLM 호출 앞뒤의 빠른 판단(라우팅, 검증, 평가)은 Jev가 담당하고, LLM은 정말 생성이 필요한 단계에 남겨둡니다.

프로덕션 통합 패턴

Jev를 도입하는 팀은 다음 실천을 따라야 합니다:

  1. 판단 공간을 명확히 정의하라. Jev 출력의 품질은 당신이 정의한 선택지와 채점 기준의 질에 달렸습니다——범주가 모호하면 확률도 모호해집니다.
  2. 구조화된 입력을 주라. 메타데이터, 검색된 문서, 대화 요약 같은 구조화 컨텍스트를 전달하고, 자유 서술 텍스트를 그냥 던지지 마세요.
  3. 최고 선택지만 보지 말고 신뢰도로 분기하라. 높은 신뢰 → 자동 실행. 중간 → 보수 경로 또는 재시도. 낮은 신뢰 → 사람 검토 또는 LLM 폴백.
  4. 보정 곡선을 감시하라. 모델이 말하는 신뢰도와 실제 정확도가 일치하는지 확인하세요. 데이터 분포가 바뀌면 보정도 따라 바뀔 수 있습니다.
  5. 원자 문제로 쪼개라. 복잡한 판단을 병렬 Choice / Score / Noul 호출로 분해하고, 각각에 독립 신뢰도를 부여하세요.
  6. 폴백을 남겨두라. 고위험 판단에서 신뢰도가 부족하면 사람 또는 더 강력하지만 느린 LLM으로 라우팅하세요.

배경: TypeSafe AI

Jev는 TypeSafe AI가 개발했습니다. 창립자 Diogo Almeida는 공개 자료 기준 ChatGPT 공동 발명자 중 한 명으로 알려져 있습니다. 회사는 2026년 9월 15일 Jev를 첫 공개 System One Model로 발표했습니다.

Jev 사용해 보기

Jev API로 Jev를 체험할 수 있습니다. DefAPI가 반값 채널을 제공합니다:

→ DefAPI에서 Jev API 사용하기