Автоматическая классификация тикетов, скоринг ответов, маршрутизация намерений пользователей в реальном времени — если поручить все эти суждения большой языковой модели, каждый вызов занимает секунды, а стоимость стремительно растёт с масштабом. TypeSafe AI представила Jev — модель, которая берёт на себя именно такие частотные низколатентные задачи «System One»: 114 миллисекунд на вызов, стоимость $0.000081, типизированный результат с калиброванной доверительностью. По официальным данным: в 193,6 раза быстрее и в 444,6 раза дешевле сопоставимого LLM.
Достигается это не уменьшением и удешевлением LLM, а созданием модели принципиально иной архитектуры. В статье разбираемся от концепции до архитектуры — чтобы вы могли понять, когда использовать Jev, а когда по-прежнему нужен LLM.
Рамка Канемана: System 1 vs System 2
Психолог Даниэль Канеман описал два режима человеческого мышления:
- System 1: быстрое, интуитивное, автоматическое. Им вы читаете дорожный знак, распознаёте сарказм, определяете, похож ли email на спам. Реакция за миллисекунды, без сознательных усилий.
- System 2: медленное, обдуманное, рассуждающее. Им вы пишете статью, доказываете теорему, отлаживаете состояние гонки. Требует устойчивого внимания и рабочей памяти.
Традиционные LLM — GPT, Claude, Gemini — по сути являются System 2: они генерируют цепочку рассуждений токен за токеном и лишь в конце дают вывод. В открытом творчестве им нет равных, но если вам нужен просто ответ «да/нет» или оценка по шкале 1–5, генерация цепочки рассуждений — это пустая трата времени и денег.
Jev — это System 1 для программного обеспечения: принимает структурированные данные и возвращает типизированное решение напрямую, без цепочки рассуждений.
Чем Jev отличается от LLM + структурированный вывод
Распространённый сегодня подход: дать LLM JSON-схему и молиться, что она её придержится:
response = llm.generate(
prompt="Классифицируй этот тикет: 'У меня загорелась видеокарта'",
schema={"category": str, "urgency": int, "confidence": float},
)
LLM по-прежнему генерирует текст токен за токеном, а вы потом парсите и валидируете. Модель может галлюцинировать поле, обернуть JSON в прозу или выдать значение перечисления, которого не существует — в лучшем случае ваш код упадёт, в худшем — система молча примет неправильный тип.
Jev работает иначе. Пространство решений определено до инференса:
decision = jev.classify(
input=ticket_text,
choices=["billing", "hardware", "software", "other"],
)
# → {"choice": "hardware", "probability": 0.97, "confidence": 0.94}
Модель параллельно оценивает предопределённые варианты и возвращает типизированный результат сразу. Она может ошибиться в том, какой вариант правильный, но никогда не вернёт поле, которого нет в вашей схеме. Нет схемы, которую можно галлюцинировать — потому что схема и есть сама архитектура.
В этом смысл «нулевой галлюцинации» Jev: ноль галлюцинаций схемы, не ноль ошибок. Разница принципиальна — Jev может неверно классифицировать тикет, но не может вернуть {"categori": "billng"}.
Три выходных примитива
Jev предоставляет три примитивных типа вопросов; каждый возвращает решение с вероятностью и доверительностью:
| Примитив | Назначение | Возвращает | Пример |
|---|---|---|---|
| Choice | Выбрать один вариант из конечного множества | Выбранная опция + вероятность + доверительность | ”Корректен ли формат этого поискового запроса?” → valid, 0,98, 0,95 |
| Score | Оценить по упорядоченным критериям | Балл + вероятность + доверительность | ”Оцени этот ответ от 1 до 5 за фактическую точность” → 4, 0,82, 0,88 |
| Noul | Определить вероятность истинности бинарного утверждения | Число с плавающей точкой 0,0–1,0 | ”Подкреплено ли это утверждение исходным документом?” → 0,93 |
Примитивы можно комбинировать. Сложное решение о маршрутизации можно разбить на три параллельных вызова Choice плюс одну проверку Noul — всё за один сетевой запрос.
Архитектура: три опоры
1. Новая архитектура, не уменьшенный LLM
TypeSafe AI формулирует прямо: Jev «ни малый, ни LLM». Это архитектура, спроектированная с нуля для оценки пространств решений, а не для авторегрессионной генерации текста. Это не GPT с ограничивающим декодером сверху — это другая разновидность модели.
2. Параллельный сэмплинг по пространству решений
Традиционные LLM генерируют токены последовательно. Чтобы ответить «это спам?», им нужно сгенерировать рассуждение, затем вывод, затем отформатировать в JSON — каждый шаг зависит от предыдущего.
Jev в одном запросе параллельно оценивает все ветви предопределённого пространства решений. Для классификации из четырёх вариантов он не рассуждает сначала про вариант A, потом B, потом C — он оценивает все четыре одновременно и за один проход возвращает распределение вероятностей по всем вариантам.
3. RLCD: обучение с подкреплением для калиброванных решений
Большинство современных моделей настраиваются с помощью RLHF (обучение с подкреплением на основе человеческой обратной связи), оптимизируя человеческие предпочтения. RLHF порождает модели, которые звучат уверенно и услужливо — но часто оказываются буквально сверх-уверенными: модель утверждает 90% уверенности, а фактическая точность — 70%.
Jev обучается с помощью RLCD (Reinforcement Learning for Calibrated Decisions), оптимизируя калибровку, а не предпочтения. Если коротко: модель не должна преувеличивать свою уверенность. Когда Jev говорит 80% доверительности, точность на аналогичных входных данных должна составлять около 80%. Для продакшн-систем это значит, что вы можете спокойно использовать доверительность для логики ветвления.
Производительность: официальные данные
TypeSafe AI опубликовала следующее сравнение для рабочего процесса задач System One:
| Метрика | Jev | Сопоставимый LLM | Коэффициент |
|---|---|---|---|
| Стоимость вызова | $0.000081 | $0.013880 | В 444,6 раза дешевле |
| Задержка | 0,114 с | 8,566 с | В 193,6 раза быстрее |
Цена входных токенов — $42 за миллиард (примерно $0,042 за миллион), по заявлению компании — в 238 раза ниже, чем у Claude Fable 5.1. Типизированные результаты Jev не тарифицируются по выходным токенам.
Примечание: на лендинге Jev AI указан консервативный диапазон из ранних бенчмарков (40–200× скорость, $0.042/M входных токенов). Значения 193,6× / 444,6× — из последнего опубликованного сравнения TypeSafe AI по состоянию на сентябрь 2026 года.
Независимая валидация: эксперимент LangChain
Бенчмарки самого вендора — это лишь ориентир; настоящую ценность имеет независимая проверка. LangChain использовал Jev как оценщик агентов в LangSmith и сравнил его с тремя LLM-оценщиками:
- Настройка: пять прогонов weather-агента, каждый из которых четыре оценщика (Jev, GPT-5.6 Luna, GPT-5.6 Terra, Claude Sonnet 4.6) повторно оценивали 100 раз по бинарному критерию
does_pass, с ручной разметкой в качестве эталона. - Результат Jev: все 500 оценок совпали с ручной разметкой (100% согласованности).
- Дисперсия: средняя per-case дисперсия Jev — 0,0000149. У GPT-5.6 Luna — в 433 раза выше, у GPT-5.6 Terra — в 913 раз, у Claude Sonnet 4.6 — в 92 раза.
- Согласованность LLM: Terra 99,8%, Luna 96,4%, Claude Sonnet 4.6 80,0%.
LangChain сам уточняет: это наблюдательный эксперимент на одной задаче — он не доказывает, что низкая дисперсия обязательно следует из RLCD-обучения. Но сам результат впечатляет: модель System One показала в этой задаче идеально стабильные, идеально точные бинарные суждения при затратах и задержке, составляющих лишь долю любого LLM-оценщика.
Так Jev позиционируется как третий тип оценщика:
- Код-правила: быстро, детерминированно, дёшево — но только синтаксис.
- LLM-as-judge: понимает семантику — но медленно, дорого, высокая дисперсия.
- System One (Jev): понимает семантику и при этом быстрый, стабильный, калиброванный.
Когда использовать Jev (и когда нет)
Сценарии, где Jev уместен, объединяет общее свойство: суждение принимается быстро и многократно, а пространство ответов перечислимо.
- Интеллектуальное ветвление: заменить жёсткие if/else семантическим пониманием.
- Классификация: тикеты, логи, документы, намерения, уровни риска.
- Скоринг: качество ответа, релевантность, безопасность, фактическая точность.
- Ограждения: “Есть ли у этого ответа фактическое основание?” “Нарушает ли этот вывод политику контента?”
- Замена LLM-as-judge: стабильная и дешёвая автоматическая оценка в масштабе.
- Пакетная обработка: миллионы параллельных решений в map-reduce-конвейерах.
Для чего Jev не подходит:
- Длинные тексты и генерация кода — он не выдаёт объёмного свободного текста.
- Сложные математические выводы — он судит, а не доказывает.
- Открытое исследование — пространство решений нужно определить заранее.
- Задачи с многошаговым рассуждением — оставьте их System 2 LLM.
Практический паттерн: Jev обрабатывает быстрые решения вокруг вызовов LLM (маршрутизация, валидация, оценка), а LLM остаётся для этапов, где действительно нужна генерация.
Практики внедрения в продакшн
Командам, внедряющим Jev, стоит следовать этим рекомендациям:
- Чётко определите пространство решений. Качество выходных данных Jev зависит от качества ваших вариантов и критериев оценки — размытые категории дают размытые вероятности.
- Давайте структурированные входные данные. Передавайте метаданные, найденные документы, сводки диалогов — а не просто бросайте длинный свободный текст.
- Ветвите по доверительности, а не только по высшему варианту. Высокая доверительность → выполнять автоматически. Средняя → консервативный путь или повтор. Низкая → ручная проверка или откат к LLM.
- Следите за кривыми калибровки. Проверяйте, совпадает ли заявленная доверительность с фактической точностью. Распределение данных меняется — калибровка может сдвинуться.
- Разбивайте на атомарные вопросы. Сложные решения раскладывайте на параллельные вызовы Choice / Score / Noul, каждый со своей доверительностью.
- Оставляйте запасной путь. Для высокорисковых решений при недостаточной доверительности направляйте к человеку или более мощному, но медленному LLM.
Предыстория: TypeSafe AI
Jev разработан компанией TypeSafe AI, основанной Диогу Алмейдой — по открытым данным, соизобретателем ChatGPT. Компания представила Jev 15 сентября 2026 года как свою первую публичную модель System One.
Попробовать Jev
Попробовать Jev можно через Jev API — DefAPI предоставляет его за полцены: