TypeSafe AI ha puesto en marcha Jev, un modelo que no genera texto: devuelve decisiones tipadas con probabilidades para que tu código actúe o escale. En mi feed técnico no ha parado de salir desde mediados de septiembre, y esta semana InfoQ lo resume como lo que muchos equipos llevaban buscando: clasificadores, enrutado y filtros de seguridad sin pagar por miles de tokens de salida. Suena a solución elegante. Tambien suena demasiado limpio.
Diogo Almeida, ex de OpenAI y uno de los nombres detrás del proyecto, vende la idea de un System One model: intuición rápida, no razonamiento largo. Le mandas un estado (texto o JSON) y un conjunto de preguntas cerradas; Jev responde con distribuciones de probabilidad en una sola pasada. Input barato, salida gratis, latencias que TypeSafe sitúa entre 70 y 500 ms. Vercel lo metió en AI Gateway al día siguiente del lanzamiento; LangChain y Netlify corrieron detrás. Cuando casi el 13 % de los equipos de pago de Vercel lo prueba en 24 horas, como recoge InfoQ citando a la propia plataforma, no estamos ante un experimento de nicho: estamos ante gente harta de usar un martillo de 200 mil millones de parámetros para clavar un tachuela.
Yo lo entiendo. Si mantienes una web con IA integrada —chat de soporte, enrutado de tickets, moderación de comentarios—, lo normal es que hayas acabado llamando a un LLM para tareas que en realidad son clasificación con esteroides. Gastas latencia y dinero en que el modelo redacte una frase que luego igual ni enseñas al usuario. Jev invierte el guion: el software decide con umbrales; el LLM grande solo entra cuando hace falta profundidad. En la práctica, varios desarrolladores han reportado clasificadores cinco a dieciocho veces más rápidos que el LLM que sustituyeron. Eso en producción se nota en la factura y en los timeouts del navegador.
Pero aquí empieza lo que nadie pone en el titular del comunicado. Armin Ronacher, CTO de Earendil, le dijo a TechCrunch que el diseño delega un poco el problema de las alucinaciones al usuario: tú tienes que decidir si un 50 % de confianza merece bloquear una acción o dejarla pasar. Correcto. Y incómodo. Porque la mayoría de equipos que conozco no tienen definido qué hacer con un 0,73 frente a un 0,71; tienen un botón de “activar IA” y un PM que pide “que sea seguro”. Jev no alucina texto porque no genera texto; eso no significa que no te equivoques al interpretar sus números.
TypeSafe promete calibración mediante lo que llama Reinforcement Learning for Calibrated Decisions. Suena bien en un paper mental. En el mercado real, un análisis de OpenChamber sobre miles de tuits del lanzamiento —citado por InfoQ— deja una foto menos épica: aceleraciones medianas de unas 7x frente al titular de 193x, ahorros de coste medianos de 30x. Sigue siendo relevante. Pero si construyes tu arquitectura asumiendo el mejor caso del blog de la empresa, te vas a llevar una sorpresa en el primer pico de tráfico black friday.
Tampoco me convence del todo el silencio sobre la arquitectura. TechCrunch recoge la sospecha habitual de la comunidad: que Jev podría apoyarse en un LLM open-weight por debajo, aunque TypeSafe hable de arquitectura propia y datos sintéticos. No es un crimen; casi todos hacemos capas encima de modelos existentes. Lo que me molesta es la narrativa de “no es un LLM” cuando, para muchos casos de uso, sigues en el ecosistema de la incertidumbre estadística que ya conoces, solo que empaquetada distinto.
Lo más interesante de la semana no es solo Jev, sino la reacción de OpenAI. TechCrunch describe una API de decisiones en preview que huele a respuesta directa al mismo nicho: probabilidades baratas para automatización y, sobre todo, para vigilar agentes. Tras el lío de agentes escapando en entornos de prueba y accesos no autorizados a sistemas en Australia y Canadá, tiene sentido comercial vender un guardián que cueste céntimos por llamada. Un demo citado en ese artículo habla de monitorizar cada acción agentica por unos 2,94 dólares con Jev frente a cientos con un LLM grande. Si eso se sostiene en tu carga real, cambia la economía de “dejar correr el agente y rezar”.
Para ti, que montas proyectos web y SaaS, la lección práctica es otra: separa las tareas. Enrutado, moderación, detección de intención, comprobación de permisos antes de ejecutar un tool call: candidatos claros para un modelo de decisiones. Redacción de emails, informes legales, contenido largo para el blog: sigue siendo territorio LLM (o humano). Mezclarlos por pereza de arquitectura es lo que ha inflado facturas de API en 2025 y 2026.
Antes de migrar nada, haría tres comprobaciones en staging: calibración en tus datos (no en el benchmark de TypeSafe), coste total incluyendo reintentos y escalados al modelo grande, y trazabilidad —qué probabilidad tenías cuando el sistema dejó pasar algo que no debía. Jev en versión 1.13.0 ya documenta estados poco fiables en ciertos inputs; eso es honestidad técnica, no marketing.
No creo que Jev sustituya a GPT, Gemini ni a lo que uses para redactar. Creo que obliga a admitir que buena parte de la “IA en la web” no necesitaba nunca un chatbot elocuente, sino un interruptor bien calibrado. La pregunta incómoda es si tu equipo está dispuesto a definir esos umbrales y asumir la responsabilidad cuando el número sale en gris, o si preferís seguir escondiendo la incertidumbre detrás de un párrafo bonito generado por un LLM.
Si mañana tuvieras que elegir entre dejar un agente con acceso a tu WordPress sin supervisión o pagar unos euros al mes para que cada tool call pase por un clasificador tipo Jev con umbral al 85 %, ¿qué umbral pondrías y quién en tu empresa firma ese valor cuando falle?