En 2025, OpenAI generó $3.7 mil millones en ingresos... y perdió $5 mil millones. La empresa detrás de ChatGPT — el producto de IA más usado del planeta — gastó $1.35 por cada dólar que ganó. Para 2026, las proyecciones empeoran: OpenAI perdería ~$14 mil millones sobre ~$25 mil millones de ingresos, y Anthropic ~$19 mil millones. Son las dos empresas más valiosas de la industria, con la tecnología más demandada de la historia, y ninguna puede pagar sus propias cuentas.

La explicación que escucharás en los medios es "están invirtiendo en el futuro". Es verdad, pero incompleta. Hay una razón más profunda, estructural, que casi nadie analiza con números: el costo de producir un token de un modelo denso es tan alto que ni siquiera los precios de lista más caros del mercado lo cubren. Y del otro lado del Pacífico, una generación de labs chinos construyó sus modelos con una arquitectura distinta — Mixture of Experts — que produce el mismo token por una fracción del costo.

💰 LA TESIS DE ESTE ARTÍCULO

Occidente no pierde dinero porque venda barato: pierde porque su token cuesta producirlo caro. El modelo denso activa el 100% de sus parámetros en cada token; el MoE activa el 3%. Esa diferencia arquitectónica — no el hardware, no los precios — es la ventaja estructural de los labs chinos. Y las restricciones de chips, lejos de frenarlos, los obligaron a perfeccionar el software hasta convertirlo en su verdadera arma. La rentabilidad es la prueba: el modelo no es el producto — el harness lo es.

1. El COGS del token: lo que nadie mira cuando habla de precios

Cuando se compara el precio de las APIs de IA, casi todos miran la etiqueta: GPT-5.6 cuesta $10/$30 por millón de tokens; Claude $5/$15; DeepSeek V4-Flash $0.14/$0.28. "Los chinos venden barato", concluyen. Pero el precio de venta es la consecuencia, no la causa. La pregunta correcta es otra: ¿cuánto cuesta PRODUCIR un millón de tokens?

Ese número — el costo de los bienes vendidos (COGS) de la inferencia — es la métrica que determina si una empresa de IA puede existir sin subsidios. Y depende de una decisión de arquitectura tomada años antes de que existiera el producto:

"A hypothetical dense model at 671 billion parameters would require every token to pass through all 671 billion parameters at inference. At that scale, the compute cost makes the model economically non-viable for API-level serving at competitive prices. You either pay a lot per token, or you do not run it." — DeepInfra, "How Mixture of Experts Changed LLM Economics" (mayo 2026)

La matemática es brutal: en un modelo denso, el costo de inferencia escala linealmente con el tamaño. Quieres el doble de capacidad → doblas parámetros → doblas el costo de cada token. No hay escape. Por eso los modelos densos de frontera son económicamente inviables para servir a escala competitiva: o cobras muchísimo por token, o no los corres.

2. La revolución MoE: activar el 3% y competir con el 100%

DeepSeek no inventó el MoE — la idea tiene décadas — pero lo llevó a un extremo que nadie en Occidente replicó a escala. En 2026, cada modelo open-weight que cerró la brecha con GPT-5.5 y Claude Opus 4.7 es MoE. La tabla de los pesos pesados:

ModeloLabParámetros totalesActivos por token% activo
DeepSeek V4-ProDeepSeek 🇨🇳1.6T49B~3%
DeepSeek V4-FlashDeepSeek 🇨🇳284B13B~4.6%
Kimi K2.6Moonshot 🇨🇳1T32B~3.2%
GLM-5.2Zhipu AI 🇨🇳744B40B~5.4%
MiniMax M2.7MiniMax 🇨🇳10B~
Qwen 3.8-MaxAlibaba 🇨🇳2.4T~
Kimi K3Moonshot 🇨🇳2.8T~

Fíjate en la columna del medio: modelos con más parámetros totales que cualquier modelo occidental conocido — 1.6T, 2.4T, 2.8T — pero que en cada token solo "despiertan" una fracción diminuta. Esa es la jugada: tener el conocimiento de un gigante con el costo de un enano.

El resultado práctico lo midió Slack: al migrar de un modelo denso de 34B a un MoE, redujeron sus costos de inferencia en 55% manteniendo calidad. Y la regla de oro de la industria en 2026 es contundente: todo modelo que se vende por menos de $1 por millón de tokens es MoE. No hay excepción.

📐 DATO DURO — LA DIFERENCIA ARQUITECTÓNICA

DeepSeek V4-Pro tiene 1.6T de parámetros y activa 49B por token: 3% del total. Un modelo denso equivalente activaría el 100% — es decir, ~33x más cómputo por token para el mismo nivel de capacidad. Esa es la brecha de COGS que ningún precio de lista puede esconder.

3. Los números de producción reales: $0.12 vs $2.35

¿Cuánto cuesta realmente producir un millón de tokens? Los benchmarks independientes de SemiAnalysis / InferenceX (julio 2026) lo midieron sobre hardware real:

ConfiguraciónHardwareCosto de producción $/M
DeepSeek V4-Pro (MoE)GB300 NVL72 (Blackwell)$0.12
DeepSeek V4-Pro (MoE)GB200 NVL72 (Blackwell)$0.28
DeepSeek R1, MTP apagadoGB300 NVL72$2.35
DeepSeek R1, MTP encendidoGB300 NVL72$0.11
GLM-5 (FP8 + MTP)AMD MI355X$0.22

Tres lecturas de esta tabla — y las tres destruyen el mito del "precio chino barato":

  1. Un MoE produce un millón de tokens por $0.12-0.28. DeepSeek V4-Pro se vende a $0.435/$0.87. Es decir: margen bruto real y positivo, sin ningún subsidio. El precio no es dumping: es COGS bajo.
  2. El software vale más que el hardware. El mismo modelo, el mismo rack GB300, con una técnica de decodificación (multi-token prediction) apagada o encendida: $2.35 vs $0.11 — 21x de diferencia solo por software. La eficiencia no está en el chip, está en el stack.
  3. La métrica que predice el margen de un datacenter no es el peak FLOPs: son los tokens por megawatt. Los benchmarks muestran una dispersión de hasta 20x en el costo por millón de tokens sobre el mismo silicio, dependiendo solo del software.
⚠️ EL MATIZ QUE CAMBIA TODO

Cuando costlens y otros análisis estiman "márgenes del 80-95%" para las APIs occidentales, usan el costo marginal (la GPU ya comprada y encendida). Pero el costo total incluye el capex de los datacenters, la energía, la amortización, el personal, la investigación y — sobre todo — la utilización. Un modelo denso necesita muchos más chips por token, y si la demanda fluctúa, esos chips generan costo sin generar tokens. Por eso OpenAI pierde $1.35 por cada dólar: el costo marginal por token puede ser bajo, pero el costo estructural de servir modelos densos a escala masiva es insostenible.

4. El subsidio occidental: $14B + $19B al año de pérdidas

Con ese COGS en la mano, los números de los labs occidentales dejan de ser un misterio:

MétricaOpenAIAnthropic
Ingresos 2026 (proyectados)~$25B~$8-10B
Pérdida 2026 (proyectada)~$14B~$19B
Gasto en cómputo~$13B solo en Azure/StargateMulti-miles de millones en clústeres
Rentabilidad proyectada~2030s~2028
Precio flagship $/M (in/out)$10 / $30$5 / $15

Lee esa tabla con cuidado: ni siquiera los precios más altos de la industria cubren el costo estructural. OpenAI cobra $30 por millón de tokens de salida de su modelo tope y aún así pierde $14 mil millones al año. Eso no es una crisis de ingresos: es una crisis de costos de producción. El token denso es estructuralmente subsidiado — y el subsidio lo pagan los inversionistas, no los clientes.

El paper de un investigador ganador del Premio Turing (publicado a inicios de 2026) lo confirmó: el costo de inferencia — el cómputo requerido para generar cada respuesta — es el cuello de botella económico primario que impide la rentabilidad de las empresas de IA. No el entrenamiento. No el talento. La inferencia. Y la inferencia cuesta caro precisamente por la arquitectura densa.

💸 EL SUBSIDIO, EN UNA FRASE

El modelo de negocio de los labs occidentales en 2026 es: vender tokens a precio de mercado... mientras sus inversionistas pagan la diferencia entre ese precio y el costo real de producirlos. Es un subsidio de decenas de miles de millones de dólares al año, sostenido por valoraciones de $850B (OpenAI) y $380B (Anthropic). El problema: los subsidios se terminan. La arquitectura no cambia.

5. La paradoja de las restricciones: el arma que se volvió en contra

Aquí es donde la historia se pone interesante — y donde la narrativa oficial "China copia, China no puede" se derrumba con datos.

Desde octubre de 2022, Estados Unidos restringió el acceso de China a los chips más avanzados. Para 2026, el panorama es: H200 a China: "muy pocas" unidades (declaración oficial de Commerce ante el Congreso, julio 2026), la participación de NVIDIA en el mercado chino cayó a ~8%, y un arancel del 25% encareció aún más lo poco que entra. En enero de 2026, la nueva regla BIS elevó los umbrales de TPP y puso revisiones caso por caso.

El resultado esperado por Washington: China se queda atrás. El resultado real: China construyó la industria de IA más eficiente del planeta. Por tres razones que las restricciones, literalmente, obligaron:

"US export controls have delayed China's top-tier AI frontier development, but they have also accelerated Beijing's transition toward domestic silicon self-reliance." — "US-China AI Chip War 2026: Export Controls, Rare Earths & Decoupling"

La paradoja es total: cada restricción de chips fue un impuesto que China pagó en forma de innovación de eficiencia. El resultado es que hoy su ventaja no depende del hardware que Washington puede controlar — depende de la arquitectura y el software, que ningún arancel puede tocar. Las restricciones no frenaron la ventaja china: la crearon.

6. La prueba china: rentabilidad sin subsidio

Si el MoE fuera solo teoría, los labs chinos estarían tan quebrados como los occidentales. No es el caso. La evidencia de que el COGS bajo es real — y no un espejismo contable — está en el comportamiento del mercado:

✅ EL RESUMEN EN UNA FRASE

DeepSeek puede cobrar 1% del precio de Anthropic y aun así ser financieramente viable, porque su costo de producción es 10-50x menor. Los labs chinos no ganan vendiendo barato: ganan produciendo barato. Y esa ventaja no está en un chip que se pueda embargar — está en una decisión de arquitectura que ya está publicada, open-weight, y que cualquier empresa del mundo puede adoptar.

7. La semana en que el mundo entendió (o no) la lección

Esta semana el mercado nos dio la confirmación definitiva. El 27 de agosto, "AI in China" documentó lo que Bloomberg ya había titulado: China creó una "death zone" económica para los fabricantes de modelos occidentales — una zona de muerte donde ofrecer calidad de frontera a precios que rompen el mercado hace imposible sobrevivir a quien tenga una estructura de costos radicalmente distinta.

Modelo (agosto 2026)ParamsPrecio in/out $/Mvs Claude Fable 5Licencia
DeepSeek V4-Flash284B$0.14 / $0.28~1%MIT
GLM 5.2744B$0.80 / $2.56~5%MIT
Qwen 3.8-Max2.4T$2.00 / $6.00~13%Apache 2.0
Kimi K32.8T$3.00 / $15.00~20%MIT
Claude Fable 5$5.00 / $15.00100%Cerrado
GPT-5.6 Sol$10.00 / $30.00~200%Cerrado

Y aquí está el detalle que la mayoría pasa por alto: DeepSeek V4-Flash rinde 82.7% en Terminal Bench 2.1 — superando a su propio V4-Pro en tareas agénticas — al 1% del precio de Claude. No es un modelo "barato y malo": es un modelo de frontera con costos de producción de commodity. Esa combinación solo es posible con la arquitectura correcta.

Cuando Hugging Face — el hub de modelos open-weight más grande del mundo — tuiteó "China is winning the AI race on open models", no estaba opinando: estaba describiendo la consecuencia lógica de esta tabla. La eficiencia no es ideología: es COGS.

8. Qué significa esto para LATAM (y para tu empresa)

Si eres una empresa que consume IA — no que la fabrica — esta historia tiene tres implicaciones directas:

🔒 EL DOBLE IMPUESTO DEL LOCK-IN

Si usas un modelo cerrado occidental de frontera, pagas dos veces: 1) el precio de lista alto (que no refleja el costo, sino la necesidad de financiar un COGS insostenible), y 2) el riesgo estructural de que tu proveedor ajuste precios, capacidad o acceso cuando su subsidio se termine. El harness multiprovider — modelos abiertos y cerrados, rotación por tarea, control de costos — es la única posición desde la cual ninguna de esas dos cosas puede tocarte.

Conclusión: la rentabilidad es la prueba de la tesis

Llevamos desde marzo diciendo algo que sonaba a ideología: el modelo no es el producto — el harness lo es. Esta semana, los números lo confirmaron con la dureza de una hoja de balance. Los labs chinos demostraron que la inteligencia artificial de frontera puede producirse con márgenes positivos — si eliges la arquitectura correcta. Los labs occidentales demostraron que se puede perder $14-19 mil millones al año — si eliges la incorrecta.

Las restricciones de chips iban a frenar a China. En cambio, le regalaron la ventaja estructural más importante de la década: una industria entera obligada a optimizar el software hasta el límite, con el MoE como consecuencia inevitable. El resultado es que la IA más barata del mundo no la produce el país con más chips: la produce el país con mejor arquitectura.

Para LATAM, la lección no podría ser más clara. No necesitamos elegir entre pagar el subsidio occidental o depender de un proveedor extranjero. Podemos hacer lo que los labs chinos hicieron con la escasez: construir con eficiencia, con estándares abiertos, con control de nuestros datos y de nuestros costos. El harness multiprovider — una capa que conecta tu operación con cientos de modelos, abiertos y cerrados, rotando por tarea con control de calidad y costo — es exactamente esa arquitectura aplicada a la empresa. Y existe hoy.

¿Cuánto estás pagando por producir un token que puedes producir 20x más barato?

En Wagner Solutions diseñamos e implementamos harness multiprovider: la capa que conecta tu operación con cientos de modelos (DeepSeek, Qwen, GLM, Kimi, OpenRouter, y los que necesites), con rotación por tarea, control de costos y datos en tu infraestructura, auditables bajo la Ley 21.719. Agenda una conversación de 30 minutos — con datos reales de tu operación, no con promesas.

Agendar diagnóstico gratuito →