El 15 de septiembre de 2026, Diogo Almeida publicó un hilo en X. Almeida no es un desconocido: es co-autor del paper InstructGPT de 2022 —el trabajo de RLHF que se convirtió en la investigación detrás de ChatGPT— y venía de dos años en sigilo. En ese hilo anunció Jev, el primer modelo de su empresa, TypeSafe AI: un modelo que, dice, es "20-200x más rápido y 40-400x más barato". El hilo pasó los 27,8 millones de vistas en un día.

El mismo día, TypeSafe publicaba su propio blog técnico. Y su página principal mostraba otra cifra distinta. Si uno lee las tres superficies que anuncian el mismo producto —el hilo, el blog y la home— aparece algo que casi ningún titular recogió: los múltiplos no coinciden entre sí.

Este artículo no dice que Jev sea humo. Al contrario: el núcleo técnico es genuino y probablemente útil para una clase muy concreta de problemas. Lo que hacemos es algo más incómodo y, creemos, más valioso: tomar el lanzamiento más viral de la semana y usarlo como caso de estudio de cómo se fabrica —y cómo se lee— el hype en IA. Porque la pregunta que de verdad importa no es "¿es real?", sino "¿quién corrigió la tarea?".

🔴 LA TESIS

Jev es un producto real con una innovación real: hace decisiones tipadas sin generar texto, y eso lo vuelve genuinamente rápido y barato para tareas de decisión. Pero su campaña —como casi todas las del sector— descansa en un patrón que conviene aprender a leer: múltiplos espectaculares, una sola fuente, y una tarea que corrigió el propio autor.

El mismo modelo es "200x más rápido" o "25x más rápido" según quién mida. La diferencia entre creerlo y entenderlo es una sola pregunta, siempre la misma: ¿quién corrió el examen, y con qué respuestas de referencia?

1. El lanzamiento: un hilo viral, un currículum que se sostiene

Empecemos por separar lo que está confirmado de lo que es afirmación. Es el hábito que defendemos en cada análisis y que casi ninguna cobertura hizo con este caso.

Hechos confirmados y verificables:

Lo que es afirmación (claim, no resultado establecido): los múltiplos de velocidad y costo. El propio medio que mejor lo cubrió lo dijo sin rodeos: "ningún tercero ha medido la velocidad o el costo a los múltiplos reclamados". Es decir, la métrica estrella de la campaña no pasó por un laboratorio independiente. Pasó por un hilo, un blog y una home.

Y aquí está el primer detalle incómodo para la industria del titular: el mismo producto cita tres velocidades distintas. Lo vemos ahora mismo.

2. Primero, lo que Jev es (y por qué el núcleo es genuino)

Sería fácil y perezoso escribir "otro modelo sobrevalorado". No es el caso. Lo que Almeida construyó es una idea arquitectónicamente distinta a la de ChatGPT, Claude o Gemini, y merece explicarse bien antes de criticar la campaña.

System One: el fast thinking de Kahneman, aplicado a máquinas

TypeSafe llama a Jev el primer "System One Model" —en referencia a la distinción de Daniel Kahneman en Thinking, Fast and Slow—. El Sistema 1 es el juicio rápido e intuitivo ("¿este mail es spam?"). El Sistema 2 es el análisis lento y consciente. Los LLM actuales son, por diseño, Sistema 2: razonan paso a paso, token a token. Jev es Sistema 1 puro: toma una entrada y devuelve una decisión rápida, calibrada, sin escribir una sola palabra.

Los tres primitivos: Choice, Score y Sí/No

Jev no "escribe una respuesta". Devuelve exactamente una de tres formas tipadas, cada una con probabilidad calibrada y score de confianza:

PrimitivoQué haceEjemplo
ChoiceElige exactamente una opción entre hasta 255"¿Este ticket es crítico / normal / bajo?"
ScorePuntúa una situación en una escala definida"Riesgo de churn en escala 0.0–1.0"
Sí/NoDecisión binaria con probabilidad"¿Este texto contiene datos personales?"

Los tres se combinan en una sola llamada —y en paralelo—: puedes preguntarle 20 cosas del mismo input y Jev las responde todas en un único forward pass. No hay generación token a token, no hay bucle autorregresivo. De ahí sale la velocidad. Técnicamente usa un parallel sampler y un método de entrenamiento propio que llama RLCD (Reinforcement Learning for Calibrated Decisions): en vez de optimizar texto que "gusta a un humano" (RLHF) o que "se puede verificar" (RLVR), optimiza decisiones con probabilidades epistémicamente honestas.

Por qué el output es gratis (y no es un truco)

TypeSafe cobra $0.042 por millón de tokens de entrada y nada por la salida. No es una promoción: es mecánica. Como Jev no decodifica tokens de salida, no hay tokens de salida que facturar. Latencia declarada: 70–500 ms, contra 3 a 329 segundos de los modelos de frontera en tareas de decisión.

El nombre es un manifiesto: Jevons, no el módulo lunar

Jev se llama así por William Stanley Jevons, el economista de la paradoja de Jevons: cuando un recurso se abarata radicalmente, su consumo se dispara en lugar de caer. El nombre no es decoración: es una tesis de mercado. Si una decisión pasa de costar centavos a costar fracciones de centavo y de tardar segundos a tardar milisegundos, tomarás millones de decisiones que hoy ni te planteas. Ese es el negocio que Almeida está persiguiendo —y es un negocio serio.

🟢 LO QUE ES HONESTO RECONOCER

El núcleo técnico de Jev es genuinamente bueno: renunciar a generar texto para ganar velocidad, costo y tipo-seguridad es una decisión de diseño valiente, no una moda. Que un LLM pueda "alucinar" y Jev no pueda devolver un valor fuera del esquema es una garantía estructural real y útil para poner decisiones dentro de software de producción. Si tu problema es "hacer la misma decisión chica millones de veces, rápido y barato", Jev apunta exactamente ahí. El problema no es el modelo. Es cómo se lo está vendiendo.

3. El mismo modelo, tres verdades: los múltiplos que cambian de página en página

Acá empieza el caso de estudio. La métrica estrella de Jev —"200x más rápido, 400x más barato"— no es un número. Es un rango que se mueve según en qué página de la propia empresa lo leas.

SuperficieLo que dice
📝 El blog técnico de TypeSafe"40x–200x más rápido"
🐦 El hilo de lanzamiento (X)"20–200x más rápido · 40–400x más barato"
🏠 La página principal"193.6x más rápido · 444.6x más barato"

Lee esos tres renglones otra vez. Son tres claims distintos, para el mismo modelo, publicados por la misma empresa, el mismo mes. El número subió de 193.6x a 444.6x sin que cambiara una sola línea del modelo. Lo único que cambió fue dónde se lo publicaba.

Esto no es necesariamente mala fe: es cómo funciona el marketing de métricas. Un múltiplo de "hasta X" se calcula en el caso más favorable —el mejor workflow, el input más corto, la comparación más generosa— y luego viaja por los titulares como si fuera la media. El "hasta" se cae y queda el número grande. Y el número grande es el que se comparte.

🟡 LA REGLA DEL MÚLTIPLO

Cuando una empresa publica un múltiplo "hasta X veces", ese X es el mejor caso medido en el mejor escenario —no el desempeño típico. Es información, pero es el techo, no el promedio. Si el techo no viene acompañado de la distribución (mediana, peor caso, tamaño de muestra), no estás comprando un dato: estás comprando una ilustración.

¿Y ese "hasta 200x" contra qué se compara? Contra respuestas de referencia que, admite el propio blog, promedian dos modelos rivales. Guarda ese detalle, porque el siguiente punto es demoledor.

4. La tarea autocorregida: los tres asteriscos que el propio blog admite

Este es el hallazgo central del artículo, y tiene una virtud rara: lo dijo la propia TypeSafe. Su blog técnico es, en general, más honesto que su home. Y en medio de las tablas de "receipts" (recibos), deja caer tres asteriscos que desarman el titular:

🔴 LOS TRES ASTERISCOS (EN PALABRAS DE LA PROPIA EMPRESA)
  1. "Nuestras respuestas de referencia promedian dos modelos rivales." — El listón contra el que Jev compite no es un benchmark neutral: es un promedio de competidores, lo cual suele inflar la ventaja.
  2. "Nuestros workflows de prueba vienen de nuestro equipo de model capabilities, so some bias could exist." — La empresa admite, con esas palabras, que los tests los diseñó su propio equipo. La tarea la corrigió quien participa de la tarea.
  3. El "0% de errores de tipo" es "not empirical". — La cifra estrella del gráfico de "no puede fallar" no es una medición: es una consecuencia matemática del diseño (el esquema garantiza el tipo). Válido, pero no es lo que un ojo apurado cree que ve.

Traduzcamos. En cualquier examen, hay dos preguntas: qué se mide y quién corrige. TypeSafe construyó el examen (los workflows), eligió el estándar de corrección (el promedio de dos rivales) y lo aprobó. Eso no convierte a Jev en un mal producto —conviene repetirlo—, pero convierte al "200x" en un resultado de laboratorio interno que recién ahora espera su primera prueba independiente.

"Extraordinary claims require extraordinary evidence." — El propio blog de TypeSafe cita esta frase, y merece crédito por hacerlo. La pregunta es si la evidencia que sigue está a la altura de la frase que la precede.

La lección es transferible a cualquier proveedor: cuando una métrica de "inteligencia" la produce y la corrige el mismo equipo que vende el producto, no estamos ante un benchmark. Estamos ante una demo. Puede ser una demo excelente. Pero no es independiente, y esa distinción es todo.

5. El test que sí existió (y por qué decía 25x, no 200x)

Aquí hay que ser justos: sí hubo una prueba externa, y es la parte más interesante del lanzamiento —porque es la única con números de terceros—. El equipo editorial de Every corrió Jev con datos propios:

Medición independiente (Every)Resultado
Carga de trabajo777 decisiones sobre 37 documentos
Tiempo totalMenos de 0,7 segundos
Costo totalAproximadamente un cuarto de centavo
Latencia mediana0,35 s (Jev) vs 8,83 s (Claude Fable 5.1)
Velocidad relativa~25x más rápido
Costo relativo~1/580 del costo

Un 25x de velocidad es espectacular. Pero no es 200x. Y una diferencia de ~580x en costo es asombrosa, pero no es 400x —es incluso mejor que el claim, lo que muestra algo igual de importante: los múltiplos no son reproducibles entre cargas de trabajo. Dependen del caso, del input, del rival elegido. Eso es normal en ingeniería. Lo anormal es vender el máximo como si fuera el número del producto.

🔵 LA COMPARACIÓN JUSTA

La medida honesta de Jev no es "200x". Es: "~25x más rápido y ~1/580 el costo de un modelo de frontera en tareas de decisión, medido por un tercero, en un set chico y real". Ese número —más chico, más específico, con fuente externa— es mucho más impresionante que el "200x" de la home, porque sobrevive a la verificación. El hype, paradójicamente, le hace el peor favor a la tecnología que promociona.

6. El pushback de Hacker News: no fue "es falso", fue el encuadre

El lanzamiento se comió más de 1.500 puntos y 426 comentarios en Hacker News en un día —lo más parecido que tiene la industria a un peer review exprés—. Y vale la pena leer bien qué criticaron, porque no criticaron la tecnología.

Varios comentaristas, incluidos ingenieros que dijeron que lo usarían en producción, pensaban que la idea subyacente era genuinamente buena. El reproche fue por el encuadre. Dos objeciones concretas:

Ese es el patrón completo del hype moderno, y es idéntico al que documentamos en otros lanzamientos de 2026: la tecnología es real, pero el vocabulario la estira hasta donde ya no resiste verificación. "Frontera", "no alucina", "200x". Tres palabras que, puestas juntas, venden una categoría distinta de la que el producto realmente ocupa.

7. Dónde sí brilla Jev — y la lección para comprar IA

Jev no viene a reemplazar a los LLM. Viene a ocupar un hueco que los LLM nunca llenaron bien: la decisión chica, repetida, rápida y barata que hoy le pides a un modelo carísimo y lento. La arquitectura que gana no es "Jev o el LLM", es:

Jev decide. El LLM escribe. El patrón que la propia industria empieza a adoptar: el modelo de frontera razona, redacta y planifica (Sistema 2); Jev toma la decisión estructurada, en milisegundos y por fracciones de centavo (Sistema 1). Uno piensa; el otro decide. Y los dos son necesarios.

Puesta así, la tecnología de Almeida es una pieza legítima y valiosa de un stack. El problema nunca fue el producto: fue el titular. Y eso nos deja una guía práctica que sirve para el próximo lanzamiento viral —porque habrá uno la semana que viene—:

🟢 LA CONCLUSIÓN

Jev es buena tecnología con mala campaña —o, más precisamente, con una campaña buenísima para el marketing y flojísima para la evidencia. El modelo merece una oportunidad seria; los múltiplos, un escepticismo igual de serio.

Y la lección de fondo nos sirve a todos los que compramos o construimos con IA en LATAM: en un mercado donde el número grande viaja y el asterisco pequeño se queda, la ventaja competitiva ya no es tener el modelo más nuevo —es saber leer el lanzamiento más ruidoso. El que no lee los asteriscos compra humo al precio de la frontera; el que los lee compra la herramienta correcta al precio correcto, y llega antes.

Diogo Almeida citó a Carl Sagan en su propio blog: "afirmaciones extraordinarias requieren evidencia extraordinaria." Estamos de acuerdo. Y la evidencia extraordinaria que Jev realmente tiene —~25x medido por un tercero, decisiones tipadas imposibles de sacar de esquema, output gratis por diseño— no necesita el "200x" para ser una gran noticia. El número grande no le suma. Le resta.

La próxima vez que un lanzamiento te diga un múltiplo, no preguntes "¿cuánto más rápido?". Pregunta: ¿quién corrió el examen, con qué respuestas de referencia, y en cuántos casos midió la mediana? Si no puedes responder eso, no tienes una métrica. Tienes un titular —y los titulares, como los múltiplos sin fuente, no corren en producción.

¿Tu próxima decisión de IA la vas a tomar con el titular o con el asterisco?

En Wagner Solutions evaluamos modelos y proveedores contra el caso de uso real de tu negocio, no contra el número de la home. Separamos el claim del evidence, medimos con tus datos y armamos el stack que sí rinde —sobre tu propia infraestructura y con gobernanza explícita—. Si estás por adoptar un modelo de frontera (o uno "200x más rápido"), hablemos antes de firmar, no después.

Hablemos 30 minutos →