En 2025, OpenAI generó $3.7 mil millones en ingresos... y perdió $5 mil millones. La empresa detrás de ChatGPT — el producto de IA más usado del planeta — gastó $1.35 por cada dólar que ganó. Para 2026, las proyecciones empeoran: OpenAI perdería ~$14 mil millones sobre ~$25 mil millones de ingresos, y Anthropic ~$19 mil millones. Son las dos empresas más valiosas de la industria, con la tecnología más demandada de la historia, y ninguna puede pagar sus propias cuentas.
La explicación que escucharás en los medios es "están invirtiendo en el futuro". Es verdad, pero incompleta. Hay una razón más profunda, estructural, que casi nadie analiza con números: el costo de producir un token de un modelo denso es tan alto que ni siquiera los precios de lista más caros del mercado lo cubren. Y del otro lado del Pacífico, una generación de labs chinos construyó sus modelos con una arquitectura distinta — Mixture of Experts — que produce el mismo token por una fracción del costo.
Occidente no pierde dinero porque venda barato: pierde porque su token cuesta producirlo caro. El modelo denso activa el 100% de sus parámetros en cada token; el MoE activa el 3%. Esa diferencia arquitectónica — no el hardware, no los precios — es la ventaja estructural de los labs chinos. Y las restricciones de chips, lejos de frenarlos, los obligaron a perfeccionar el software hasta convertirlo en su verdadera arma. La rentabilidad es la prueba: el modelo no es el producto — el harness lo es.
1. El COGS del token: lo que nadie mira cuando habla de precios
Cuando se compara el precio de las APIs de IA, casi todos miran la etiqueta: GPT-5.6 cuesta $10/$30 por millón de tokens; Claude $5/$15; DeepSeek V4-Flash $0.14/$0.28. "Los chinos venden barato", concluyen. Pero el precio de venta es la consecuencia, no la causa. La pregunta correcta es otra: ¿cuánto cuesta PRODUCIR un millón de tokens?
Ese número — el costo de los bienes vendidos (COGS) de la inferencia — es la métrica que determina si una empresa de IA puede existir sin subsidios. Y depende de una decisión de arquitectura tomada años antes de que existiera el producto:
- Modelo denso: cada token que procesas atraviesa el 100% de los parámetros de la red. Siempre. Sin excepción. Un modelo denso de 70B usa los 70 mil millones de parámetros para cada palabra que genera.
- Modelo MoE (Mixture of Experts): la red se divide en "expertos" especializados y un router decide cuáles activar para cada token. DeepSeek V4-Pro tiene 1.6 trillones de parámetros totales, pero solo activa 49 mil millones por token — el 3%.
La matemática es brutal: en un modelo denso, el costo de inferencia escala linealmente con el tamaño. Quieres el doble de capacidad → doblas parámetros → doblas el costo de cada token. No hay escape. Por eso los modelos densos de frontera son económicamente inviables para servir a escala competitiva: o cobras muchísimo por token, o no los corres.
2. La revolución MoE: activar el 3% y competir con el 100%
DeepSeek no inventó el MoE — la idea tiene décadas — pero lo llevó a un extremo que nadie en Occidente replicó a escala. En 2026, cada modelo open-weight que cerró la brecha con GPT-5.5 y Claude Opus 4.7 es MoE. La tabla de los pesos pesados:
| Modelo | Lab | Parámetros totales | Activos por token | % activo |
|---|---|---|---|---|
| DeepSeek V4-Pro | DeepSeek 🇨🇳 | 1.6T | 49B | ~3% |
| DeepSeek V4-Flash | DeepSeek 🇨🇳 | 284B | 13B | ~4.6% |
| Kimi K2.6 | Moonshot 🇨🇳 | 1T | 32B | ~3.2% |
| GLM-5.2 | Zhipu AI 🇨🇳 | 744B | 40B | ~5.4% |
| MiniMax M2.7 | MiniMax 🇨🇳 | — | 10B | ~ |
| Qwen 3.8-Max | Alibaba 🇨🇳 | 2.4T | — | ~ |
| Kimi K3 | Moonshot 🇨🇳 | 2.8T | — | ~ |
Fíjate en la columna del medio: modelos con más parámetros totales que cualquier modelo occidental conocido — 1.6T, 2.4T, 2.8T — pero que en cada token solo "despiertan" una fracción diminuta. Esa es la jugada: tener el conocimiento de un gigante con el costo de un enano.
El resultado práctico lo midió Slack: al migrar de un modelo denso de 34B a un MoE, redujeron sus costos de inferencia en 55% manteniendo calidad. Y la regla de oro de la industria en 2026 es contundente: todo modelo que se vende por menos de $1 por millón de tokens es MoE. No hay excepción.
DeepSeek V4-Pro tiene 1.6T de parámetros y activa 49B por token: 3% del total. Un modelo denso equivalente activaría el 100% — es decir, ~33x más cómputo por token para el mismo nivel de capacidad. Esa es la brecha de COGS que ningún precio de lista puede esconder.
3. Los números de producción reales: $0.12 vs $2.35
¿Cuánto cuesta realmente producir un millón de tokens? Los benchmarks independientes de SemiAnalysis / InferenceX (julio 2026) lo midieron sobre hardware real:
| Configuración | Hardware | Costo de producción $/M |
|---|---|---|
| DeepSeek V4-Pro (MoE) | GB300 NVL72 (Blackwell) | $0.12 |
| DeepSeek V4-Pro (MoE) | GB200 NVL72 (Blackwell) | $0.28 |
| DeepSeek R1, MTP apagado | GB300 NVL72 | $2.35 |
| DeepSeek R1, MTP encendido | GB300 NVL72 | $0.11 |
| GLM-5 (FP8 + MTP) | AMD MI355X | $0.22 |
Tres lecturas de esta tabla — y las tres destruyen el mito del "precio chino barato":
- Un MoE produce un millón de tokens por $0.12-0.28. DeepSeek V4-Pro se vende a $0.435/$0.87. Es decir: margen bruto real y positivo, sin ningún subsidio. El precio no es dumping: es COGS bajo.
- El software vale más que el hardware. El mismo modelo, el mismo rack GB300, con una técnica de decodificación (multi-token prediction) apagada o encendida: $2.35 vs $0.11 — 21x de diferencia solo por software. La eficiencia no está en el chip, está en el stack.
- La métrica que predice el margen de un datacenter no es el peak FLOPs: son los tokens por megawatt. Los benchmarks muestran una dispersión de hasta 20x en el costo por millón de tokens sobre el mismo silicio, dependiendo solo del software.
Cuando costlens y otros análisis estiman "márgenes del 80-95%" para las APIs occidentales, usan el costo marginal (la GPU ya comprada y encendida). Pero el costo total incluye el capex de los datacenters, la energía, la amortización, el personal, la investigación y — sobre todo — la utilización. Un modelo denso necesita muchos más chips por token, y si la demanda fluctúa, esos chips generan costo sin generar tokens. Por eso OpenAI pierde $1.35 por cada dólar: el costo marginal por token puede ser bajo, pero el costo estructural de servir modelos densos a escala masiva es insostenible.
4. El subsidio occidental: $14B + $19B al año de pérdidas
Con ese COGS en la mano, los números de los labs occidentales dejan de ser un misterio:
| Métrica | OpenAI | Anthropic |
|---|---|---|
| Ingresos 2026 (proyectados) | ~$25B | ~$8-10B |
| Pérdida 2026 (proyectada) | ~$14B | ~$19B |
| Gasto en cómputo | ~$13B solo en Azure/Stargate | Multi-miles de millones en clústeres |
| Rentabilidad proyectada | ~2030s | ~2028 |
| Precio flagship $/M (in/out) | $10 / $30 | $5 / $15 |
Lee esa tabla con cuidado: ni siquiera los precios más altos de la industria cubren el costo estructural. OpenAI cobra $30 por millón de tokens de salida de su modelo tope y aún así pierde $14 mil millones al año. Eso no es una crisis de ingresos: es una crisis de costos de producción. El token denso es estructuralmente subsidiado — y el subsidio lo pagan los inversionistas, no los clientes.
El paper de un investigador ganador del Premio Turing (publicado a inicios de 2026) lo confirmó: el costo de inferencia — el cómputo requerido para generar cada respuesta — es el cuello de botella económico primario que impide la rentabilidad de las empresas de IA. No el entrenamiento. No el talento. La inferencia. Y la inferencia cuesta caro precisamente por la arquitectura densa.
El modelo de negocio de los labs occidentales en 2026 es: vender tokens a precio de mercado... mientras sus inversionistas pagan la diferencia entre ese precio y el costo real de producirlos. Es un subsidio de decenas de miles de millones de dólares al año, sostenido por valoraciones de $850B (OpenAI) y $380B (Anthropic). El problema: los subsidios se terminan. La arquitectura no cambia.
5. La paradoja de las restricciones: el arma que se volvió en contra
Aquí es donde la historia se pone interesante — y donde la narrativa oficial "China copia, China no puede" se derrumba con datos.
Desde octubre de 2022, Estados Unidos restringió el acceso de China a los chips más avanzados. Para 2026, el panorama es: H200 a China: "muy pocas" unidades (declaración oficial de Commerce ante el Congreso, julio 2026), la participación de NVIDIA en el mercado chino cayó a ~8%, y un arancel del 25% encareció aún más lo poco que entra. En enero de 2026, la nueva regla BIS elevó los umbrales de TPP y puso revisiones caso por caso.
El resultado esperado por Washington: China se queda atrás. El resultado real: China construyó la industria de IA más eficiente del planeta. Por tres razones que las restricciones, literalmente, obligaron:
- 1. La escasez de cómputo forzó la optimización obsesiva del software. Sin GPUs de sobra, cada FLOP cuenta. DeepSeek desarrolló Multi-head Latent Attention (MLA) para reducir la memoria del KV-cache, sparse attention para no pagar costo cuadrático en contextos largos, FP8/FP4 para duplicar el rendimiento por chip, y multi-token prediction (MTP) — la técnica que sola baja el costo 21x en la tabla anterior.
- 2. El MoE como estrategia de supervivencia. Cuando no puedes comprar más hardware, la única forma de escalar capacidad sin escalar costo es activar menos parámetros por token. Los labs chinos no eligieron MoE por moda: lo eligieron porque era la única arquitectura que les permitía competir con el hardware que tenían.
- 3. El silicio doméstico llegó. Huawei Ascend 910C (fabricado por SMIC en 7nm, con ~1/3 del rendimiento BF16 de un B200) tiene un plan de 600,000 unidades para 2026 — y en agosto de 2026 completó el post-training de DeepSeek V4-Pro (1.6T de parámetros) con un clúster de 1,000 chips. La eficiencia por software compensó la inferioridad del hardware.
La paradoja es total: cada restricción de chips fue un impuesto que China pagó en forma de innovación de eficiencia. El resultado es que hoy su ventaja no depende del hardware que Washington puede controlar — depende de la arquitectura y el software, que ningún arancel puede tocar. Las restricciones no frenaron la ventaja china: la crearon.
6. La prueba china: rentabilidad sin subsidio
Si el MoE fuera solo teoría, los labs chinos estarían tan quebrados como los occidentales. No es el caso. La evidencia de que el COGS bajo es real — y no un espejismo contable — está en el comportamiento del mercado:
- DeepSeek operó dos años sin financiación externa, autofinanciado por High-Flyer (la firma de trading cuantitativo de su fundador Liang Wenfeng). Recién en mayo 2026 abrió su primera ronda, a una valoración de $45-51.5 mil millones, liderada por fondos estatales chinos. Una empresa que no puede pagar sus cuentas no sobrevive dos años sin capital externo — DeepSeek sí, porque su token es rentable desde el día uno.
- Alibaba: la IA ya es el 52% de sus ingresos cloud. Baidu: 52% de sus ingresos del Q1 2026. ByteDance comprometió $23 mil millones anuales en infraestructura de IA. Son números de negocios que generan caja, no de laboratorios subsidiados.
- El mercado lo valida con dinero: cuando Moonshot lanzó Kimi K3 (2.8T parámetros, open-weight), el market cap de NVIDIA cayó ~$600 mil millones. Los mercados no reaccionan así a un "precio de promoción": reaccionan a una ventaja de costo estructural que amenaza el monopolio del cómputo.
- La guerra de precios china no es suicida: desde que DeepSeek-V2 puso el listón en 1 RMB por millón de tokens (mayo 2024), Alibaba cortó precios 97%, ByteDance llegó a 0.0008 RMB por mil tokens y el eslogan "1 yuan = 1 millón de tokens" se hizo real. En marzo de 2026, Alibaba subió sus precios de cómputo hasta 34% por demanda excedente — nadie sube precios cuando está perdiendo dinero por token. Suben cuando el COGS te lo permite.
DeepSeek puede cobrar 1% del precio de Anthropic y aun así ser financieramente viable, porque su costo de producción es 10-50x menor. Los labs chinos no ganan vendiendo barato: ganan produciendo barato. Y esa ventaja no está en un chip que se pueda embargar — está en una decisión de arquitectura que ya está publicada, open-weight, y que cualquier empresa del mundo puede adoptar.
7. La semana en que el mundo entendió (o no) la lección
Esta semana el mercado nos dio la confirmación definitiva. El 27 de agosto, "AI in China" documentó lo que Bloomberg ya había titulado: China creó una "death zone" económica para los fabricantes de modelos occidentales — una zona de muerte donde ofrecer calidad de frontera a precios que rompen el mercado hace imposible sobrevivir a quien tenga una estructura de costos radicalmente distinta.
| Modelo (agosto 2026) | Params | Precio in/out $/M | vs Claude Fable 5 | Licencia |
|---|---|---|---|---|
| DeepSeek V4-Flash | 284B | $0.14 / $0.28 | ~1% | MIT |
| GLM 5.2 | 744B | $0.80 / $2.56 | ~5% | MIT |
| Qwen 3.8-Max | 2.4T | $2.00 / $6.00 | ~13% | Apache 2.0 |
| Kimi K3 | 2.8T | $3.00 / $15.00 | ~20% | MIT |
| Claude Fable 5 | — | $5.00 / $15.00 | 100% | Cerrado |
| GPT-5.6 Sol | — | $10.00 / $30.00 | ~200% | Cerrado |
Y aquí está el detalle que la mayoría pasa por alto: DeepSeek V4-Flash rinde 82.7% en Terminal Bench 2.1 — superando a su propio V4-Pro en tareas agénticas — al 1% del precio de Claude. No es un modelo "barato y malo": es un modelo de frontera con costos de producción de commodity. Esa combinación solo es posible con la arquitectura correcta.
Cuando Hugging Face — el hub de modelos open-weight más grande del mundo — tuiteó "China is winning the AI race on open models", no estaba opinando: estaba describiendo la consecuencia lógica de esta tabla. La eficiencia no es ideología: es COGS.
8. Qué significa esto para LATAM (y para tu empresa)
Si eres una empresa que consume IA — no que la fabrica — esta historia tiene tres implicaciones directas:
- 1. El precio de los modelos abiertos seguirá cayendo; el de los cerrados, no. La arquitectura MoE + open-weight crea una presión de costos imparable: cada modelo chino nuevo baja el precio del mercado global. Pero los modelos cerrados occidentales no pueden bajar el suyo sin morir — su COGS no lo permite. La brecha se va a ensanchar, no a cerrar.
- 2. Depender de un solo proveedor es doblemente caro. Si tu operación cuelga de la API de un lab occidental, pagas el precio alto y cargas con su estructura de costos insostenible: cuando el subsidio se acabe (y se acabará), o suben precios, o recortan capacidad, o cortan acceso — como OpenAI hizo con Cursor esta misma semana.
- 3. La soberanía ya no es un ideal: es la opción racional. Los modelos open-weight de calidad de frontera (MIT/Apache 2.0) corren en tu infraestructura, en tu país, bajo tu control, a una fracción del costo — y con la Ley 21.719 a 92 días de su vigencia en Chile, los datos que salen de tu territorio tienen costo legal, no solo económico.
Si usas un modelo cerrado occidental de frontera, pagas dos veces: 1) el precio de lista alto (que no refleja el costo, sino la necesidad de financiar un COGS insostenible), y 2) el riesgo estructural de que tu proveedor ajuste precios, capacidad o acceso cuando su subsidio se termine. El harness multiprovider — modelos abiertos y cerrados, rotación por tarea, control de costos — es la única posición desde la cual ninguna de esas dos cosas puede tocarte.
Conclusión: la rentabilidad es la prueba de la tesis
Llevamos desde marzo diciendo algo que sonaba a ideología: el modelo no es el producto — el harness lo es. Esta semana, los números lo confirmaron con la dureza de una hoja de balance. Los labs chinos demostraron que la inteligencia artificial de frontera puede producirse con márgenes positivos — si eliges la arquitectura correcta. Los labs occidentales demostraron que se puede perder $14-19 mil millones al año — si eliges la incorrecta.
Las restricciones de chips iban a frenar a China. En cambio, le regalaron la ventaja estructural más importante de la década: una industria entera obligada a optimizar el software hasta el límite, con el MoE como consecuencia inevitable. El resultado es que la IA más barata del mundo no la produce el país con más chips: la produce el país con mejor arquitectura.
Para LATAM, la lección no podría ser más clara. No necesitamos elegir entre pagar el subsidio occidental o depender de un proveedor extranjero. Podemos hacer lo que los labs chinos hicieron con la escasez: construir con eficiencia, con estándares abiertos, con control de nuestros datos y de nuestros costos. El harness multiprovider — una capa que conecta tu operación con cientos de modelos, abiertos y cerrados, rotando por tarea con control de calidad y costo — es exactamente esa arquitectura aplicada a la empresa. Y existe hoy.
¿Cuánto estás pagando por producir un token que puedes producir 20x más barato?
En Wagner Solutions diseñamos e implementamos harness multiprovider: la capa que conecta tu operación con cientos de modelos (DeepSeek, Qwen, GLM, Kimi, OpenRouter, y los que necesites), con rotación por tarea, control de costos y datos en tu infraestructura, auditables bajo la Ley 21.719. Agenda una conversación de 30 minutos — con datos reales de tu operación, no con promesas.
Agendar diagnóstico gratuito →