La mayor parte de lo que hace un agente de IA en producción no es escribir. Es decidir. ¿Este mensaje es urgente? ¿Va a facturación o a soporte técnico? ¿Es spam? ¿Necesita a una persona? ¿Este comando es seguro de ejecutar? Y hasta ahora, cada una de esas decisiones se resolvía igual que una redacción: pidiéndole a un modelo generativo que "piense" y escriba la respuesta, palabra por palabra, a precio de modelo generativo.
El 15 de septiembre TypeSafe AI lanzó Jev, un modelo construido para exactamente eso: decidir, no escribir. Vale la pena entender por qué cambia la ecuación de costos de un agente.
Qué es Jev en una frase
Le das un estado (un correo, un ticket, un mensaje de WhatsApp, una línea de log) y una lista de preguntas cerradas. Devuelve la respuesta a cada pregunta con su probabilidad. Nada más. No genera texto, no genera código, no conversa.
Solo hay tres tipos de pregunta:
| Tipo | Qué devuelve | Ejemplo |
|---|---|---|
Elección (choice) | Una opción de una lista que tú defines, con la confianza de cada una | ¿Qué equipo atiende esto: facturación o técnico? |
Puntuación (score) | Un número en una escala que tú defines | ¿Qué tan urgente es, del 1 al 5? |
Sí o no (null) | Una probabilidad entre 0 y 1 | ¿El cliente está pidiendo un reembolso? |
Con el ticket "me cobraron dos veces, arréglenlo hoy", el resultado se ve así: equipo facturación con 98 % de confianza, urgencia alta, reembolso sí con 91 %. Tres decisiones, una llamada, menos de un segundo.
Por qué es tan rápido y tan barato
Aquí está la diferencia de fondo. Un modelo generativo produce la respuesta de izquierda a derecha, un token a la vez, y cada pregunta extra alarga la respuesta. Jev responde todas las preguntas en paralelo y su salida no es texto sino una distribución sobre las opciones que le diste. Le haces una pregunta o cincuenta, y tarda lo mismo.
Los números que publica TypeSafe, con la salvedad de que son suyos:
- Latencia entre 70 y 500 milisegundos por llamada.
- Entrada a 0,042 dólares por millón de tokens. La salida es gratis, porque casi no hay salida que cobrar.
- Alrededor de 200 veces más rápido y 400 veces más barato que un LLM de frontera en tareas de decisión.
Para ponerlo en escala: en las evaluaciones internas de TypeSafe, un caso de triage cuesta unos 0,0004 dólares con Jev contra 3 a 8 centavos con modelos generativos. Un agente conectado a un navegador buscó y eligió un vuelo en Google Flights en 7 segundos por 0,0039 dólares.
Dónde encaja: el primer filtro
El caso de uso que más me interesa es el de los agentes de atención, sobre todo por WhatsApp, donde el volumen es alto y la mayoría de los mensajes no necesitan a un modelo grande.
Hoy, muchos agentes mandan todo al modelo grande: el "hola, ¿están abiertos?" y la queja de un cliente enojado por igual. Con Jev delante, cada mensaje se clasifica en milisegundos por casi nada, y el modelo caro solo recibe lo que de verdad lo necesita. El resultado es doble: baja el costo por conversación y baja la latencia percibida, porque la mayoría de los mensajes ni siquiera espera a un LLM.
La misma lógica aplica en otros lugares donde ya se usa un modelo generativo para "decidir":
- Moderación de comentarios y chats: ¿permitir, revisar o borrar? Con confianza baja, va a revisión humana.
- Guardrails de agentes: antes de ejecutar un comando o una herramienta, ¿es de solo lectura, reversible o destructivo? ¿Pide permisos elevados? Es el "confirmar antes de destruir" convertido en un chequeo automático de 100 milisegundos.
- Enrutamiento de modelos: clasificar la dificultad de una pregunta y elegir el modelo más barato que la resuelve.
- Filtrado antes del contexto: de 200 fragmentos recuperados, ¿cuáles son relevantes? Mandarle al LLM solo esos.
- Etiquetado masivo: idioma, tema, sentimiento y urgencia sobre millones de registros, a un costo que antes no cerraba.
- Interfaces adaptativas: decidir qué componentes ya existentes mostrar según el contexto, sin generar HTML.
TypeSafe lista casos por industria: soporte al cliente, reclamos de seguros, detección de fraude financiero, cumplimiento legal, marketplaces, reclutamiento, publicidad y pronóstico de demanda. Son todos el mismo patrón: muchas decisiones acotadas, muy seguidas.
Lo que hay que saber antes de usarlo
"Cero alucinaciones" tiene letra chica. Es cierto en un sentido: Jev no puede inventar una opción que no le diste. Si las opciones son facturación o técnico, jamás responderá marketing. Pero sí puede equivocarse dentro de las opciones, y su respuesta no es determinista: la misma pregunta puede dar confianzas distintas en llamadas distintas. Por eso la confianza importa tanto como la respuesta. La regla práctica es definir un umbral y mandar a revisión humana todo lo que quede por debajo.
Hay que cambiar la forma de preguntar. Jev rinde mejor con preguntas atómicas que con preguntas amplias. En lugar de "¿cuántas veces aparece la letra R en esta palabra?", conviene preguntar letra por letra y dejar que las responda en paralelo. El costo es el mismo, la precisión sube.
No es multimodal y no conversa. No ve imágenes ni genera texto. Necesita que otra capa le prepare el estado. En un agente real, Jev decide y un modelo generativo redacta.
Es código cerrado. Existe una alternativa abierta, Kev, una familia de modelos pequeños sobre Qwen entrenados con la misma idea, compatible con la misma API, que se puede afinar con datos propios. Está unos puntos por debajo de Jev en su benchmark, pero corre en tu propia infraestructura.
Dónde probarlo
- Vercel AI Gateway: el modelo se llama
typesafe-ai/jev, con 32 000 tokens de contexto. Varias fuentes reportan una ventana promocional gratuita hasta el 25 de septiembre de 2026; la página oficial del modelo ya muestra el precio regular, así que conviene verificarlo antes de asumirlo. - TypeSafe AI directamente, desde su consola y SDK, al precio publicado.
Lo que creo que pasa después
Jev no compite con los modelos generativos. Los complementa en el lugar donde más dinero se estaba desperdiciando: las decisiones pequeñas. Y la idea es tan clara que no me sorprendería ver equivalentes de los grandes laboratorios y de la comunidad abierta en pocos meses.
Mientras tanto, la pregunta para cualquiera que tenga un agente en producción es sencilla: ¿cuántas de las llamadas al modelo caro son, en realidad, una decisión de sí o no?
Sobre por qué las decisiones de un agente necesitan un chequeo antes de actuar escribí antes en confirmar-alcance-antes-de-destruir. Y sobre cómo un modelo de frontera saca valor de los datos cuando ya están ordenados, en tu-empresa-ya-tiene-los-datos-lo-que-faltaba-era-alguien-que-los-leyera-todos.
Fuentes: typesafe.ai, documentación de casos de uso de TypeSafe, Jev en Vercel AI Gateway, Kev en GitHub.
