23 de septiembre de 2026 # Jev, o la *primitiva de decisión semántica*: el modelo que solo sabe decidir, explicado de forma sencilla (y detallada) ![](./attachments/23-primitiva-de-decision-semantica-4.webp) **Primitiva de decisión semántica.** Así se define **Jev**, el modelo de IA de que TypeSafe AI presentó el 15 de septiembre, y es de lo más interesante que ha salido este mes. También es un nombre bastante horroroso, así que empiezo traduciéndolo. Una **primitiva**, en software, es una pieza pequeña que hace una sola cosa y que combinas con otras para montar algo más grande. Un ladrillo. **Semántica** quiere decir que entiende el significado de lo que le pasas, no solo el formato. Y **decisión** es literalmente lo único que hace. No escribe. No es que escriba mal: es que no puede escribir, no existe esa salida. Le das una situación en lenguaje natural, le haces una pregunta cerrada, y te devuelve un valor con su probabilidad. ¿Este ticket es urgente? ¿Este correo es phishing? ¿Esta respuesta cumple la rúbrica, del 1 al 5? Y ahí se acaba. Suena a poco, y creo que es justo al revés. La [[Investigacion-Jev-el-modelo-que-decide-en-vez-de-escribir|investigación que acompaña a este post]] entra en la arquitectura, los benchmarks uno a uno, la privacidad, el perfil del fundador y todo lo que TypeSafe no cuenta, que es bastante. Aquí os quiero explicar la idea, que me parece que se entiende en cinco minutos y que vale la pena tener en la cabeza. ## Casi todo el trabajo de IA en producción no es escribir ![](./attachments/23-primitiva-de-decision-semantica.webp) Cuando montáis algo con IA que funcione de verdad, y no una demo, la mayor parte de las llamadas al modelo no piden un texto. Piden un juicio: clasifica esto, enruta aquello, puntúa esta respuesta, comprueba si esa salida se le puede mandar al cliente. Y para eso estáis pagando un modelo que además sabe escribir sonetos, razonar sobre topología y montaros un backend entero. Es como llamar a un abogado por horas para que os diga si un sobre lleva sello. Contesta bien, seguro. Pero estáis pagando por lo que no le pedís, y esperando lo que tarda en pensárselo. Jev quita todo lo demás. Y al quitarlo se lleva por delante el coste y la espera. ## Jev solo sabe contestar tres tipos de pregunta ![](./attachments/23-primitiva-de-decision-semantica-1.webp) | Pregunta | Qué hace | Qué devuelve | | --- | --- | --- | | **Choice** | Elige entre opciones que tú defines | la opción, las probabilidades y su confianza | | **Score** | Puntúa según una rúbrica que tú defines | la nota, las probabilidades y su confianza | | **Noul** | ¿Esta afirmación es cierta? | un número entre 0 y 1 | Nada más. Ni texto libre, ni JSON inventado, ni herramientas, ni navegar, ni planificar. Tres formas de preguntar y un número de vuelta. Lo bueno de esto no es la limitación en sí. Es que la salida la puede usar tu código directamente, sin parsear nada y sin rezar. Si devuelve una puntuación del 1 al 5, va a ser del 1 al 5. Eso no es una promesa de calidad, es una propiedad del sistema. ## El detalle que me ha parecido más interesante ![](./attachments/23-primitiva-de-decision-semantica-5.webp) Cinco preguntas a Jev cuestan casi lo mismo que una. Una medición externa dio 70 milisegundos con una pregunta y 74 con cinco, porque las evalúa en paralelo sobre el mismo estado. Básicamente, estamos acostumbrados a LLMs secuenciales, y esto es bastante distinto. De repente salen a cuenta cosas que con un modelo grande son un lujo: - preguntar lo mismo de cinco maneras distintas y quedarte con lo que salga más veces; - verificar cada paso intermedio de un agente en vez de mirar solo el resultado; - partir una decisión complicada en juicios pequeños y combinarlos tú, en código, con los pesos que tú decidas; - y usar la confianza como semáforo: si va alta, sigue; si va baja, que lo mire una persona. Ese último punto es el que más me interesa, porque es el que la gente se salta. No es lo mismo un sistema que decide que un sistema que sabe cuándo no debería decidir. En el benchmark de phishing se ve bien. El veredicto de Jev, a pelo, perdió contra Claude Haiku 4.5. Pero cinco preguntas de señal combinadas con una regresión logística llegaron al 95,1% de exactitud. No ganó el modelo, ganó el procedimiento. ## Eso de que "no puede alucinar" es verdad a medias ![](./attachments/23-primitiva-de-decision-semantica-2.webp) TypeSafe dice que Jev no puede alucinar, y esa frase se está repitiendo mucho estos días. Conviene entender qué significa exactamente. Porque **no puede alucinar, pero sí puede equivocarse.** Es verdad que no puede inventarse un campo, ni una cita, ni un JSON con una forma rara, ni soltarte tres párrafos que nadie ha pedido. Esas salidas no existen en su mundo. Pero sí puede elegir la categoría equivocada, darte una probabilidad engañosa, entender mal la situación o aprobar con mucha confianza algo que no debería aprobar. Un usuario lo dejó clavado: **el formato está garantizado, el juicio puede seguir siendo malo.** Que no es poco, ojo. Pero es otra cosa, y la diferencia entre las dos es justo donde la gente se hace daño. ## La parte que sigue sin demostrarse ![](./attachments/23-primitiva-de-decision-semantica-3.webp) TypeSafe habla de "nueva arquitectura de modelo" y de "inteligencia frontera". Y a mí me parece exagerado. Esto es un poco un *tech bro* diciendo *"trust me bro, I'm an engineer"*. No han publicado artículo, ni ficha de modelo, ni número de parámetros, ni cómo lo han entrenado, ni un estudio de calibración en condiciones. Sin eso, no hay manera de distinguir entre una arquitectura nueva de verdad y un modelo pequeño muy bien especializado con técnicas conocidas. Puede ser cualquiera de las dos, y de momento nadie de fuera puede decirlo. Y hay una comparación que nadie ha hecho todavía. Jev se compara siempre contra los modelos frontera, que es la comparación fácil y la más halagadora. Contra un reranker moderno, contra un clasificador de embeddings o contra un modelo pequeño con salida estructurada estricta, la ventaja se estrecha bastante. En algunas pruebas se queda en 1,4 o 1,7 veces más barato, que está muy lejos de los órdenes de magnitud del anuncio. Al final, lo que me parece más sólido de todo esto no es Jev en concreto, que ya veremos. Es el reparto de trabajo que propone: que los modelos grandes generen, investiguen y actúen, y que un cacharro barato vaya comprobando por detrás lo que va saliendo. Eso me cuadra bastante más que cualquier historia de sustitución. Dentro de seis meses lo sabremos. Esa es un poco la gracia de este campo. --- Si queréis la versión larga, con los benchmarks desmontados uno a uno, lo que dice la letra pequeña de privacidad y todas las fuentes --> [[Investigacion-Jev-el-modelo-que-decide-en-vez-de-escribir|Investigación: Jev, el modelo que decide en vez de escribir]]. --- Publicado el 23 de septiembre de 2026