Clasificar tickets automáticamente, puntuar respuestas candidatas, enrutar intenciones de usuario en tiempo real: si delegas todos estos juicios a un modelo grande, cada llamada tarda varios segundos y el coste se dispara en cuanto escalas. TypeSafe AI presentó Jev para encargarse por separado de estas tareas «System One» de alta frecuencia y baja latencia: 114 milisegundos por llamada, un coste de $0.000081, resultados con seguridad de tipos y confianza calibrada. Según datos oficiales: 193,6× más rápido y 444,6× más barato que un LLM comparable.
No lo consigue haciendo un LLM más pequeño y barato, sino con un modelo de una arquitectura completamente distinta. Este artículo va del concepto a la arquitectura para ayudarte a decidir cuándo usar Jev y cuándo seguir necesitando un LLM.
El marco de Kahneman: System 1 vs System 2
El psicólogo Daniel Kahneman describió dos modos del pensamiento humano:
- System 1: rápido, intuitivo, automático. Lo usas para leer una señal, detectar sarcasmo o decidir si un correo parece spam. Responde en milisegundos, sin esfuerzo consciente.
- System 2: lento, deliberado, analítico. Lo usas para escribir un ensayo, demostrar un teorema o depurar una condición de carrera. Requiere atención sostenida y memoria de trabajo.
Los LLM tradicionales —GPT, Claude, Gemini— son esencialmente System 2: generan cadenas de razonamiento token a token y solo al final dan la conclusión. En creación abierta son insuperables, pero si solo necesitas un sí/no o una puntuación del 1 al 5, generar una cadena de razonamiento token a token es un desperdicio de tiempo y dinero.
Jev es el System 1 diseñado para software: recibe entrada estructurada y devuelve directamente una decisión tipada, sin cadena de razonamiento.
Cómo se diferencia Jev de un LLM + salida estructurada
El enfoque habitual hoy es darle al LLM un esquema JSON y rezar para que lo respete:
response = llm.generate(
prompt="Clasifica este ticket: 'Mi GPU está ardiendo'",
schema={"category": str, "urgency": int, "confidence": float},
)
El LLM sigue generando texto token a token, y luego tú parseas y validas. El modelo puede alucinar un campo, envolver el JSON en prosa o devolver un valor de enumeración que no existe —en el mejor caso tu código falla, en el peor tu sistema acepta silenciosamente un tipo incorrecto.
Jev funciona distinto. El espacio de decisiones ya está definido antes de la inferencia:
decision = jev.classify(
input=ticket_text,
choices=["billing", "hardware", "software", "other"],
)
# → {"choice": "hardware", "probability": 0.97, "confidence": 0.94}
El modelo evalúa en paralelo las opciones predefinidas y devuelve directamente un resultado tipado. Puede equivocarse sobre cuál opción es la correcta, pero jamás devolverá un campo que no exista en tu esquema. No hay esquema que alucinar —el esquema es la propia arquitectura.
De esto va el «cero alucinaciones» de Jev: cero alucinaciones de esquema, no cero errores. La distinción importa —Jev puede clasificar mal un ticket, pero no puede devolver {"categori": "billng"}.
Tres primitivas de salida
Jev expone tres tipos primitivos de pregunta; cada uno devuelve una decisión con probabilidad y confianza:
| Primitiva | Propósito | Devuelve | Ejemplo |
|---|---|---|---|
| Choice | Elegir una opción de un conjunto finito | Opción elegida + probabilidad + confianza | ”¿Está bien formada esta consulta de búsqueda?” → valid, 0,98, 0,95 |
| Score | Puntuar según criterios ordenados | Puntuación + probabilidad + confianza | ”Puntúa esta respuesta de 1 a 5 por precisión fáctica” → 4, 0,82, 0,88 |
| Noul | Juzgar la probabilidad de una proposición binaria | Flotante 0,0–1,0 | ”¿Está esta afirmación respaldada por el documento fuente?” → 0,93 |
Las primitivas se pueden combinar. Una decisión compleja de enrutamiento puede descomponerse en tres llamadas Choice paralelas más una comprobación Noul de salvaguarda —todo resuelto en un solo viaje de ida y vuelta.
Bajo el capó: tres pilares arquitectónicos
1. Una nueva arquitectura, no un LLM más pequeño
TypeSafe AI lo dice sin rodeos: Jev «no es pequeño ni es un LLM». Usa una arquitectura diseñada desde cero para la evaluación de espacios de decisión, no para generación autorregresiva de texto. No es un GPT con un decodificador restringido encima —es otro tipo de modelo.
2. Muestreo paralelo sobre el espacio de decisiones
Los LLM tradicionales generan tokens en secuencia. Para responder «¿esto es spam?» deben generar razonamiento, luego un veredicto, luego formatearlo como JSON —cada paso depende del anterior.
Jev evalúa todas las ramas del espacio de decisiones predefinido en paralelo, en una sola consulta. En una clasificación de cuatro opciones no razona primero la opción A, luego la B y luego la C —evalúa las cuatro simultáneamente y devuelve la distribución de probabilidad de todas en una sola pasada.
3. RLCD: Reinforcement Learning for Calibrated Decisions
La mayoría de los modelos modernos se ajustan con RLHF (aprendizaje por refuerzo a partir de retroalimentación humana), optimizando la preferencia humana. RLHF produce modelos que suenan seguros y serviciales —pero a menudo están literalmente sobreconfiados: el modelo dice tener un 90 % de certeza, y su precisión real puede rondar el 70 %.
Jev se entrena con RLCD (Reinforcement Learning for Calibrated Decisions), optimizando la calibración en lugar de la preferencia. En pocas palabras: que el modelo no exagere su seguridad. Cuando Jev dice 80 % de confianza, su tasa de acierto en entradas similares debería rondar el 80 %. Para sistemas en producción, esto significa que puedes usar la confianza para lógica de ramificación con tranquilidad.
Rendimiento: cifras oficiales
TypeSafe AI publicó la siguiente comparación para un flujo de trabajo de tareas System One:
| Métrica | Jev | LLM comparable | Factor |
|---|---|---|---|
| Coste por llamada | $0.000081 | $0.013880 | 444,6× más barato |
| Latencia | 0,114 s | 8,566 s | 193,6× más rápido |
El precio de entrada es de $42 por mil millones de tokens (aproximadamente $0,042 por millón) —según la empresa, 238× más bajo que Claude Fable 5.1. Los resultados tipados de Jev no se facturan por tokens de salida.
Nota: la landing page de Jev AI muestra un rango conservador de benchmarks anteriores (40–200× velocidad, $0.042/M tokens de entrada). Las cifras 193,6× / 444,6× provienen de la comparación más reciente publicada por TypeSafe AI a septiembre de 2026.
Validación independiente: el experimento de LangChain
Los benchmarks del propio proveedor son solo referencia; lo que vale es la validación de terceros. LangChain usó Jev como evaluador de agentes en LangSmith y lo comparó con tres evaluadores LLM:
- Configuración: cinco ejecuciones de un agente meteorológico, cada una evaluada 100 veces por cuatro evaluadores (Jev, GPT-5.6 Luna, GPT-5.6 Terra, Claude Sonnet 4.6) según el criterio binario
does_pass, con anotaciones humanas como referencia. - Resultado de Jev: las 500 evaluaciones coincidieron con las anotaciones humanas (100 % de concordancia).
- Varianza: la varianza media por caso de Jev fue 0,0000149. La de GPT-5.6 Luna fue 433× mayor, la de GPT-5.6 Terra 913× y la de Claude Sonnet 4.6 92×.
- Concordancia LLM: Terra 99,8 %, Luna 96,4 %, Claude Sonnet 4.6 80,0 %.
LangChain advierte: es un experimento observacional en una sola tarea; no demuestra que la baja varianza provenga necesariamente del entrenamiento RLCD. Pero el resultado es llamativo —un modelo System One logró en esta tarea juicios binarios perfectamente estables y perfectamente precisos, a una fracción del coste y la latencia de cualquier evaluador LLM.
Esto posiciona a Jev como una tercera categoría de evaluador:
- Evaluación por reglas de código: rápida, determinista, barata —pero limitada a comprobaciones sintácticas.
- LLM-as-judge: entiende semántica —pero lento, caro y con alta varianza.
- Evaluación System One (Jev): entiende semántica y además es rápida, estable y calibrada.
Cuándo usar Jev (y cuándo no)
Los escenarios donde Jev encaja comparten un rasgo: el juicio debe hacerse de forma rápida y repetida, y el espacio de respuestas es enumerable.
- Ramificación inteligente: sustituir if/else rígidos por comprensión semántica.
- Clasificación: tickets, logs, documentos, intenciones, niveles de riesgo.
- Puntuación: calidad de respuesta, relevancia, seguridad, precisión fáctica.
- Salvaguardas: “¿Esta respuesta tiene base fáctica?” “¿Esta salida viola la política de contenidos?”
- Reemplazar LLM-as-judge: evaluación automática estable y barata a gran escala.
- Procesamiento por lotes: millones de decisiones en paralelo en pipelines map-reduce.
Para lo que Jev no sirve:
- Redacción larga o generación de código —no produce textos extensos.
- Deducción matemática compleja —juzga, no demuestra.
- Exploración abierta —necesita que primero definas el espacio de decisiones.
- Tareas que requieren razonamiento en varios pasos —déjalas en manos de un LLM System 2.
El patrón habitual en producción: Jev se encarga de las decisiones rápidas alrededor de las llamadas al LLM (enrutamiento, validación, evaluación), y el LLM se reserva para los pasos que de verdad necesitan generar contenido.
Patrones de integración en producción
Los equipos que adoptan Jev deberían seguir estas prácticas:
- Define bien el espacio de decisiones. La calidad de la salida de Jev depende de la calidad de tus opciones y criterios de puntuación —categorías ambiguas producen probabilidades ambiguas.
- Dales entrada estructurada. Pasa metadatos, documentos recuperados, resúmenes de conversación como contexto estructurado; no metas un párrafo de texto libre sin más.
- Ramifica por confianza, no solo por la opción principal. Confianza alta → ejecutar automáticamente. Media → ruta conservadora o reintento. Baja → revisión humana o respaldo con LLM.
- Vigila las curvas de calibración. Comprueba que la confianza declarada coincida con la precisión real. Si cambia la distribución de datos, la calibración puede desajustarse.
- Divide en preguntas atómicas. Descompón decisiones complejas en llamadas Choice / Score / Noul paralelas, cada una con su propia confianza.
- Deja un plan de respaldo. En decisiones de alto riesgo con confianza insuficiente, enruta a una persona o a un LLM más potente pero más lento.
Antecedentes: TypeSafe AI
Jev fue desarrollado por TypeSafe AI, fundada por Diogo Almeida —según fuentes públicas, coinventor de ChatGPT. La empresa presentó Jev el 15 de septiembre de 2026 como su primer System One Model público.
Prueba Jev
Puedes probar Jev a través de la API de Jev; DefAPI lo ofrece a mitad de precio: