Volver al blog
IAAgentesArquitecturaSystem One

Modelos System One: la IA que decide en vez de escribir

Modelos System One: la IA que decide en vez de escribir

Un modelo System One es una clase de modelo que devuelve decisiones tipadas y acotadas, con probabilidades calibradas, en lugar de texto generado. Le envías un estado y un conjunto de preguntas tipadas, y te devuelve respuestas que tu código consume directamente, sin paso de parseo y sin ingeniería de prompt para que la salida mantenga la forma.

¿Qué ha lanzado TypeSafe exactamente?

El 22 de septiembre de 2026, TypeSafe AI, un laboratorio de San Francisco, publicó Jev, al que llama el primer modelo System One público. El nombre viene de Kahneman: el Sistema 1 es el juicio rápido y automático; el Sistema 2, la deliberación lenta. Los modelos de chat se construyeron para el segundo. Jev está hecho para el primero.

Responde a tres tipos de pregunta:

PrimitivaQué preguntasQué devuelve
ChoiceElige una opción de un conjunto definidoLa opción, una probabilidad para cada opción y una confianza
ScorePuntúa el estado contra niveles ordenadosEl nivel, una probabilidad por nivel y una confianza
Noul¿Esta afirmación es cierta?La probabilidad de que la respuesta sea sí, de 0 a 1

No sabe escribir una frase, y ese es el intercambio deliberado: renuncia a generar cadenas de texto y gana salidas que son estructuralmente incapaces de llegar mal formadas. TypeSafe admite hasta 255 opciones en una misma elección, y entrena el modelo con un método que llama RLCD, Reinforcement Learning for Calibrated Decisions, orientado a que la confianza sea honesta: que lo que responde con un 90 % acierte en torno al 90 % de las veces.

¿Son ciertas las cifras?

Las cifras de TypeSafe son respuestas de extremo a extremo en 70–500 ms, entrada a 0,042 $ por millón de tokens con la salida gratis y, en su evaluación interna de flujos de trabajo, 193,6× más rápido y 444,6× más barato que un modelo frontera.

Son los números del fabricante, y merecen la advertencia que el propio fabricante aporta. TypeSafe afirma que ha decidido deliberadamente no usar benchmarks públicos, y recomienda no darles ningún peso: prefiere que cada equipo construya sus evaluaciones para su propio caso de uso. Jev está en acceso anticipado, detrás de una lista de espera. Todavía no hay ninguna medición independiente a la que apuntar, así que cualquier cifra que leas hoy, estas incluidas, procede de la empresa que vende el modelo.

La afirmación de «cero alucinaciones» pide el mismo cuidado. Es una garantía de tipos, no de acierto: el modelo no puede devolver un valor fuera del esquema que hayas definido, pero sí puede elegir la opción equivocada dentro de él. Cero salidas fuera de esquema no es cero respuestas erróneas. Esa distinción es justo el fondo del asunto, y conviene tenerla clara antes de que alguien repita el titular.

¿Qué cambia esto en un agente?

Esta es la parte que se sostiene al margen de qué fabricante acabe ganando.

Casi todos los agentes que hoy están en producción usan un mismo modelo generalista para dos trabajos muy distintos: escribir cosas que leerá una persona y decidir cosas que solo leerá el software. En el segundo es donde el modelo generalista encaja peor. Clasificar este ticket, enrutar esta petición, puntuar este lead, decidir si se escala, elegir la siguiente herramienta: recibes un párrafo donde necesitabas un enum, lo parseas, añades un reintento para cuando el parseo falle, y aun así no tienes ninguna señal honesta de cómo de seguro estaba el modelo.

Separar esos dos trabajos es una decisión de arquitectura sólida por sí misma:

Modelo de chatModelo System One
SalidaUna cadena que hay que parsearUn valor tipado que consume tu código
Modo de falloSalida mal formada o inventadaUna elección equivocada dentro de un conjunto válido
IncertidumbreImplícita en la redacción, si acasoUna probabilidad explícita y una confianza aparte
Sirve paraRedactar, razonar, programarClasificar, enrutar, puntuar, bifurcar

La consecuencia práctica es un segundo eje para el flujo de control. Cuando la respuesta trae una confianza calibrada, tu código puede actuar sobre ella: seguir por encima de un umbral, caer a un modelo mayor en la banda intermedia, escalar a una persona por debajo. Esa regla vive en tu código, donde puedes leerla, versionarla y probarla, en lugar de dentro de un prompt.

¿Hay que migrar algo hoy?

No, y nadie puede decirte lo contrario con honestidad mientras el modelo siga en acceso anticipado y sin benchmarks públicos detrás.

Lo que sí merece la pena hoy cuesta menos y dura más: contar cuántas de las llamadas de tu agente son decisiones y no redacción. Ese número es el que te dice si esto te afecta, y sacarlo es trabajo de una mañana. Esas llamadas son las que están pagando la latencia y el coste de un modelo hecho para un trabajo que no están haciendo, y son las que podrás mover más adelante: a un modelo System One cuando esté disponible y medido por terceros, a un clasificador pequeño afinado, o a código normal que nunca necesitó un modelo.

Construimos agentes y los backends que los sostienen, y hacemos esa cuenta antes de recomendar a nadie que cambie una línea. Si resulta que tus decisiones van en código corriente, te lo diremos.