Esta semana alguien me pasó una acusación que circula como verdad revelada: que Gemini es “deliberadamente demócrata” y que se nota a simple vista, sin necesidad de testearlo. Que no es un sesgo de entrenamiento, sino una decisión de diseño. Y que Grok, en la vereda de enfrente, es el modelo “conservador” del mercado. La historia tiene todo lo que vuelve viral a un relato: un villano corporativo, un rebelde que se planta frente al sistema, y una sospecha de manipulación. Solo le faltaba una cosa: que fuera verdad.

Antes de escribir este artículo hice lo que casi nadie hace cuando repite una acusación así: fui a verificarla. Busqué estudios, no tuits. Y lo que encontré es más jugoso que la acusación misma — no porque la respuesta sea un “sí” o un “no” limpio, sino porque la pregunta estaba mal planteada desde el principio.

Porque si el ruido trataba sobre el color político de las máquinas, el hallazgo real trataba sobre algo mucho más profundo. Cada vez más gente (y cada vez más empresas) le pide la verdad a un chatbot. Y la evidencia más dura de que eso está roto no está en su política: está en sus citas. Bajo un test adversarial, las fuentes que citan los modelos líderes solo fueron válidas el 46% de las veces. El resto eran inventadas, irrelevantes, o afirmaban lo contrario de lo que el modelo acababa de decir.

🔴 LA TESIS DE ESTE ARTÍCULO

El debate de si un modelo es “de izquierda” o “de derecha” es la pregunta equivocada, por tres razones que se apilan:

1. El sesgo es estructural e inevitable — no un complot de ingenieros, sino una consecuencia matemática del objetivo de alineación.

2. El mismo modelo parece izquierdista, centrista o derechista según el instrumento con que lo midas. Los estudios se contradicen entre sí porque miden cosas distintas.

3. Y lo grave —lo que de verdad debería quitarnos el sueño— no es su opinión política: es que cuando le pedís la evidencia de lo que afirma, la fabrica. El instrumento que usarías para verificar su sesgo es el mismo que te da la respuesta sesgada. El bucle de verificación está roto en su origen.

Una advertencia de honestidad, como en cada artículo. Aquí separamos hechos verificables (qué midieron los estudios, con qué método, y qué encontraron) de interpretación (qué significan esos hallazgos para quien usa un LLM como fuente). Y vamos a marcar explícitamente lo que los propios estudios no resuelven — porque en este tema la incertidumbre metodológica es parte de la historia, no un pie de página.

El recorrido es este. Primero, la acusación y por qué engancha tanto. Segundo, qué dice la evidencia: por qué la acusación contra Gemini se cae y la de Grok se sostiene solo a medias. Tercero, por qué los estudios se contradicen — y por qué eso no es un error, es el punto. Cuarto, por qué el sesgo es inevitable y no un complot. Quinto, el escándalo real: el 46% de fuentes que no existen. Sexto, el error de categoría de tratar un LLM como fuente de verdad. Y séptimo, cómo usamos nosotros estas herramientas sin convertirlas en oráculos.

1. La acusación, y por qué engancha tanto

Empecemos por entender por qué la historia funciona, antes de ver si es cierta. La acusación tiene dos mitades simétricas que se refuerzan:

No es un relato que salió de la nada. El contexto es real y está documentado: en 2026 se firmó una orden ejecutiva para que los sistemas de IA usados por el gobierno federal funcionen como “herramientas neutrales, no partidistas”; hay una guerra abierta entre sectores políticos y empresas de IA; y desde el lado conservador circulan investigaciones concretas. Por ejemplo, el libro del autor Wynton Hall afirma que Gemini clasificó como hate speech el discurso de varios senadores republicanos y no encontró objeción alguna en los demócratas. Y publicaciones como el Media Research Center sostienen que Gemini admitió haber consultado —para decidir qué fuentes citar— calificadores de medios, fact-checkers y “listas negras” de fuentes de centroderecha. Del otro lado, Musk insiste públicamente en que Grok era “demasiado woke” y que estaba “trabajando en arreglarlo”.

O sea: hay agravios documentables de ambos lados. Eso es precisamente lo que hace la acusación irresistible. Le da a una audiencia la historia que ya quería creer, con villano incluido.

Pero fíjate en la estructura del relato. Convierte un artefacto probabilístico en un actor intencional. Nos da un culpable (los ingenieros del mal) en lugar de un problema (una función de entrenamiento). Y ahí hay una trampa epistemológica clásica: queremos que sea un complot, porque un complot se puede denunciar, indignar y corregir. Una consecuencia matemática, no.

Y la parte de “deliberadamente” es, casi siempre, la primera que no sobrevive al escrutinio.

2. Qué dice la evidencia: una acusación se cae, la otra se sostiene a medias

Vamos a los estudios. El test más citado es el de The Washington Post (junio de 2026), diseñado junto a investigadores del Polarization Research Lab de Dartmouth y de Stanford, con más de dos docenas de preguntas políticas. Testearon ChatGPT, Gemini, Claude, Grok, DeepSeek y una IA llamada Arya, de la red conservadora Gab. Los resultados:

ModeloResultado en el test de WaPo¿Coincide con la acusación?
ChatGPT El tilt más fuerte a la izquierda: respondió casi todas las preguntas exclusivamente con argumentos de izquierda; ofreció una posición de derecha una sola vez en todo el set. ⬅️ Fue el más sesgado… y nadie lo acusaba a él.
Gemini La excepción más clara: presentó ambos lados en más del 90% de sus respuestas. El más balanceado de todos. ❌ Contradice la acusación (“deliberadamente demócrata y notorio”).
Grok Dio más respuestas de derecha que cualquier otro modelo… pero aun así, la mayoría de sus respuestas fueron íntegramente de izquierda. ⚠️ A medias: el “menos izquierdista”, no un “conservador”.
Arya (Gab) La IA “construida con valores cristianos y principios conservadores” respondió con argumentos de izquierda 12 veces más seguido que con argumentos de derecha. 😅 Hasta el modelo diseñado para ser conservador se fue a la izquierda.

Léelo otra vez, porque es demoledor en ambas direcciones. La acusación fuerte contra Gemini no se sostiene: en el test más citado, Gemini fue el modelo más equilibrado, no el más sesgado. Y la acusación a favor de Grok se sostiene solo a medias: es el más “a la derecha” del set, sí, pero en términos absolutos sigue produciendo respuestas mayoritariamente de izquierda. El New York Times ya había mostrado algo parecido en 2025: los updates de Musk empujaron a Grok a la derecha en temas de gobierno y economía, pero en cerca de un tercio de las preguntas —las de temas sociales como aborto o discriminación— se movió a la izquierda. Conclusión: “Grok es conservador” describe una dirección de viaje, no un destino, y ni siquiera esa dirección es completa.

Y el dato de Arya es el que da vuelta todo el marco. Si una IA construida explícitamente con valores conservadores termina inclinándose a la izquierda 12 veces más seguido, entonces la hipótesis “los laboratorios las hicieron demócratas a propósito” pierde fuerza. Lo que sugiere es algo más incómodo: hay algo en cómo se construyen estos modelos —hoy, con estas técnicas— que empuja hacia un lado, y es muy difícil de des-empujar. Lo cual nos lleva al siguiente punto.

3. Los estudios se contradicen: no hay “el sesgo”, hay tu regla

Ahora el giro que casi nadie menciona: los estudios no están de acuerdo entre sí.

El Washington Post encontró que Gemini es el más balanceado. Pero un análisis posterior del instituto Just Facts (13-ago-2026) encontró que ChatGPT y Gemini sacan una “C” —es decir, fallan más— en preguntas diseñadas para detectar falsedades de la izquierda, mientras que solo Grok se inclina hacia la derecha. ¿Se contradicen? No exactamente. Y entender por qué es la clave de todo el artículo:

Son dos instrumentos distintos midiendo dos cosas distintas. Y por eso dan veredictos distintos. Un modelo puede parecer equilibrado (presenta ambos lados) mientras su tasa de error sigue cargada hacia un lado. O puede citar “ambos lados” y aun así fallar más en un sentido. “Sesgo” no es una propiedad que el modelo tenga; es una relación entre el modelo y la regla con que lo medís. Cambiá la regla, cambiá el veredicto.

🟡 LO QUE LOS PROPIOS ESTUDIOS NO RESUELVEN

Honestidad radical: ninguno de estos tests es concluyente, y sus autores lo saben.

  • WaPo: las respuestas las puntuó un solo reportero — o sea, un criterio subjetivo. Y la propia nota admite que “los métodos de medición de sesgo siguen siendo objeto de disputa entre investigadores”, y que responder a dos docenas de preguntas estructuradas puede no reflejar cómo el modelo maneja “las preguntas más desordenadas que los usuarios realmente hacen”.
  • Versiones: no se sabe con certeza qué versión específica de cada modelo se testeó. Los modelos cambian cada semana.
  • Just Facts: es un instituto con una postura editorial (conservadora). Eso no invalida su test —de hecho, un test adversarial es útil— pero es exactamente el punto: el que mide también trae su propia regla.

Traducción: si dos estudios serios sobre el mismo fenómeno no coinciden, la conclusión honesta no es “uno miente”. Es que estamos midiendo un blanco móvil con reglas distintas.

Esto tiene una consecuencia práctica enorme: cualquiera puede “probar” lo que quiera. Sacás el test A para decir “Gemini es neutral”; sacás el test B para decir “Gemini es de izquierda”. Los dos citan datos reales. Los dos se equivocan al pretender que su regla es la regla. Y así se fabrican titulares virales en ambas direcciones — sin que nadie haya mentido.

Y ojo: ese es exactamente el vicio que la acusación original tenía. Circulaba como “notorio” y “a simple vista”, sin un test limpio detrás. La acusación era, ella misma, un ejemplo de tomar algo por verdad sin verificarlo. Guarda esa idea, porque va a volver.

4. Por qué el sesgo es inevitable (y no es un complot)

Hasta acá: la acusación no se sostiene, los estudios se contradicen. Ahora la pregunta de fondo: ¿por qué hay sesgo, entonces? Si no es un comité malvado, ¿qué es?

Hay una respuesta técnica y elegante, de un paper de Thilo Hagendorff (2025): “On the Inevitability of Left-Leaning Political Bias in Aligned Language Models”. Su argumento es que los LLMs alineados bajo los principios HHH (harmless, helpful, honest) necesariamente exhiben un sesgo hacia la izquierda. No por conspiración, sino porque los supuestos normativos que sostienen la alineación —evitar el daño, la inclusividad, la equidad, la veracidad empírica— coinciden con marcos morales progresistas. Alineás un modelo para ser inofensivo y honesto, y estás programando, casi por definición, parte del paquete de valores que la izquierda política reclama como propios.

“Los sistemas inteligentes entrenados para ser inofensivos y honestos deben exhibir un sesgo político de izquierda. Es una consecuencia, no una decisión.” Thilo Hagendorff, arXiv 2507.15328 (2025)

Y hay más evidencia que apunta a lo mismo, desde distintos ángulos:

Junta las piezas y aparece el trap: si quisieras “quitarle” el sesgo de izquierda, una de las palancas sería hacer que el modelo mienta sobre el clima o la salud pública. Ahí entiendes por qué la instrucción “simplemente hacelo neutral” es imposible de cumplir de forma limpia. El sesgo no es una capa que se remueve; es, en parte, la sombra del propio objetivo de entrenamiento. No hay diamante sin sombra.

🟢 LA CONCLUSIÓN DE ESTA SECCIÓN

No hay un ingeniero torciendo el modelo a propósito. Hay un objetivo de diseño (ser inofensivo, honesto, útil) que arrastra consigo un marco de valores. El resultado es un sesgo real, medible y persistente — pero emergente, no intencional. Confundir esas dos cosas es lo que nos lleva a buscar villanos donde hay matemática. Y buscar el villano es perder el tiempo que deberíamos dedicar a lo que sí importa.

5. El escándalo real: el 46%

Aquí llegamos al corazón del asunto, y ya no estamos hablando de política. Estamos hablando de si podés confiar en lo que la máquina te dice.

Volvamos al análisis de Just Facts, porque ahí hay un dato que debería estar en todos los titulares y no está. Metodología: le dieron a las versiones premium de cuatro chatbots (ChatGPT, Gemini, Grok, Claude) 100 preguntas de opción múltiple, diseñadas para provocar falsedades tanto de la izquierda como de la derecha. En total, 400 respuestas. Encontraron 74 respuestas falsas. Hasta ahí, el debate de sesgo que ya vimos.

Pero el hallazgo demoledor es otro. Los modelos no solo contestan: citan fuentes. Y cuando Just Facts verificó esas fuentes, encontró esto:

Categoría de fuenteCantidad
Fuentes que no existen (ni rastro en Internet Archive ni en Google)86
Fuentes que no responden la pregunta77
Fuentes completamente ajenas al tema18
Fuentes que afirman lo contrario de lo que dijo el modelo15
Fuentes demostrablemente falsas13
Fuentes válidas y pertinentessolo 46%

Y el desglose por modelo es aún más brutal. La tasa de fuentes válidas fue:

ModeloFuentes válidas
ChatGPT57%
Gemini49%
Claude44%
Grok32%

Los cuatro sacaron una “F” rotunda. Y aquí está la frase que hay que subrayar: sus tasas de fuentes válidas fueron mucho más bajas que sus tasas de respuestas correctas. Es decir —léelo dos veces—: el modelo suele acertar la respuesta, pero inventa la cita que la respalda.

🔴 EL PROBLEMA NO ES EL COLOR POLÍTICO. ES ESTO.

Cuando tú (o tu equipo, o tu empresa) le pides una verdad a un LLM, no te quedas con la respuesta desnuda: le pides la fuente. Y la fuente es justamente el mecanismo con el que verificarías la respuesta.

Si el 54% de esas fuentes son inventadas, irrelevantes o afirman lo contrario de lo que se dijo, entonces el modelo no solo se equivoca: sabotea el instrumento con el que ibas a detectar el error. Te da un plano de una salida de emergencia que no existe, dibujado con mano firme.

Y acá se cierra el círculo con el punto 3, de una forma que da un poco de vértigo. La razón por la que el debate de “izquierda vs derecha” es la pregunta equivocada no es solo que el sesgo sea inevitable. Es que el sesgo es el problema visible —el que da titulares, el que genera indignación, el que se pelea en redes. El problema invisible es la fabricación de fuentes — y es más grave, porque corrompe la herramienta que usarías para auditar el problema visible. Es un sistema meta-roto: para saber si el modelo te está mintiendo por sesgo, le pides que te pruebe lo que dice… y otra vez el modelo.

Y aquí vuelve la acusación del comienzo, ahora vista con otra luz. “Gemini es deliberadamente demócrata y es notorio” circula como verdad. Pero ya vimos que el test más citado la contradice, y que los propios tests son discutidos. La acusación era, ella misma, una fuente no verificada. El chiste se escribe solo: el debate sobre la fiabilidad de las IA se transmitió como un rumor sobre la fiabilidad de las IA.

6. El error de categoría: un LLM no es una fuente de verdad, es un componente

Ahora, la síntesis. Después de todo lo anterior, ¿cuál es el error de fondo? Confundir la categoría de la cosa.

Un LLM no es un oráculo. No es una base de datos. No es una fuente. No es un testigo. Es un componente probabilístico que genera texto plausible dado un contexto. Y tiene dos propiedades que se combinan de la peor manera posible cuando lo tratás como fuente:

Cuando le preguntas “¿es verdad X?”, no recibes una verdad: recibes una muestra sacada de una distribución de texto plausible, envuelta en prosa convincente, y a veces adornada con citas fabricadas para justificarla. Usar eso como fuente de verdad es un error de categoría — como usar un generador de mapas plausibles como GPS. El mapa se ve perfecto. Es el territorio el que no existe.

Y una vez que ves esto, todo lo demás encaja:

La conclusión práctica no es “no uses LLMs”. Es al revés: son demasiado útiles como para usarlos mal. La pregunta correcta no es “¿está sesgado?” ni “¿en qué cree?”. La pregunta correcta es: “¿cómo uso un instrumento que está con seguridad equivocado en algún punto, y que cita fuentes que a veces no existen?” Y la respuesta a esa pregunta no está en el modelo. Está en el sistema que lo rodea.

7. Cómo lo hacemos nosotros: el modelo como componente, no como oráculo

Este artículo no podía terminar en diagnóstico. Y aquí nuestro interés es doble: no solo hablamos de esto, vivimos de esto. Así que te contamos el método, porque es la respuesta concreta al problema del 46%.

Esa es toda la diferencia. No se trata de confiar en la IA ni de desconfiar de la IA. Se trata de tratarla por lo que es: un motor potentísimo de plausibilidad que hace falta meter dentro de un sistema con verificación, trazabilidad y memoria. El oráculo es la fantasía. El componente con un sistema alrededor es la realidad que funciona.

Porque al final, la pregunta que deberías hacerle a cualquier IA no es “¿qué es la verdad?”. Es:

“¿Cómo sabría que esto es verdad?”

Y si la única respuesta es “porque lo dijo la IA”… entonces todavía no lo sabes. La única defensa que no depende de la máquina.

El debate de si Gemini es demócrata o si Grok es conservador va a seguir dando titulares, en ambas direcciones, con estudios que se contradicen y capturas que se viralizan. Nosotros preferimos mirar el número que casi nadie comparte: el 46%. Porque el verdadero riesgo de 2026 no es de qué lado político está la máquina. Es que le pedimos la verdad y nos devolvió una cita que no existe.

¿Tu empresa está tratando un LLM como fuente de verdad?

Diseñamos sistemas de IA donde el modelo es un componente —con verificación, trazabilidad y memoria soberana—, no un oráculo al que hay que creer. Si estás construyendo con IA y te importa que las respuestas se puedan auditar, conversemos.

Conversemos