El 3 de agosto de 2026, Forbes publicó: "DeepSeek V4-Flash: 105x más barato que Claude Fable 5". Quartz, Propakistani y Artificial Analysis siguieron el mismo día. El titular que los medios "descubrieron" ayer — que la métrica real de la IA no es el precio por token, sino el costo por tarea completada — es algo que nosotros venimos midiendo y publicando con datos de producción reales desde mayo de 2026.
Y ahora viene la parte que me molesta: el término se volvió tendencia, y como toda métrica que se pone de moda, está siendo cooptada para manipular la narrativa. Ya he visto a varios "influencers" de IA usar el concepto de costo por tarea para afirmar cosas técnicamente insostenibles — la más común siendo:
Esa afirmación no tiene ningún sustento técnico. Y lo digo no con opiniones, sino con lo que pasa cuando pones modelos de verdad en producción, con datos reales de facturación. Hoy te muestro el caso más limpio que tenemos: dos modelos que cobran exactamente lo mismo por token, y que en la práctica nos costaron 62x distinto por tarea. Y de paso, desmontamos la afirmación del gurú con arquitectura, no con marketing.
1. El experimento perfecto: MiMo vs DeepSeek, mismo precio por token
Para que una comparación de "costo por tarea" sea limpia, necesitas controlar las variables. Lo más difícil de controlar es el precio por token: si un modelo cobra 178x más caro que otro, cualquier diferencia de eficiencia queda opacada por el precio.
Pues bien: en 2026 existe un caso donde el precio por token es prácticamente idéntico. Xiaomi lanzó su familia MiMo con una estrategia de precios que calca a DeepSeek:
| Modelo | Input / 1M tokens | Output / 1M tokens | Arquitectura |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | MoE (284B total / 13B activos) |
| MiMo V2.5 (standard) | $0.14 | $0.28 | MoE (~309B) |
Mismo precio por token. Misma arquitectura MoE. Incluso el mismo descuento de cache (~98%). Si el costo por tarea dependiera solo del precio por token — como implícitamente asume el gurú cuando compara "precio por token × supuesta inteligencia" — ambos modelos deberían costar casi lo mismo por tarea.
No fue lo que pasó en nuestra producción.
En UN día (6 de abril de 2026) gastamos $37.31 con MiMo V2 Pro en 555 requests. Eso es más que lo que gastamos con DeepSeek V4 Flash en 3 MESES completos de operación (~$36.5). Mismo precio por token, misma arquitectura MoE, misma clase de tareas agénticas. La única variable que cambió: cuántos tokens consume cada modelo para completar la misma tarea.
2. Los datos completos: 62x más caro por tarea, con el mismo precio por token
Aquí está el detalle completo de nuestra facturación real (sin especulación, sin benchmarks sintéticos — facturas de producción):
| Métrica | MiMo V2 Pro (2 días, abr 2026) | DeepSeek V4 Flash (30 días, jun-jul 2026) |
|---|---|---|
| Requests procesados | 846 | 14,167 |
| Tokens totales inyectados | 145.4M | 693.9M |
| Output tokens generados | 324,760 | 8,783,931 |
| Costo total | $44.13 | $11.93 |
| Costo por request | $0.0522 | $0.000842 |
Lee bien la tabla: con 16.7x menos requests, MiMo nos costó 3.7x más dinero. Por request, MiMo fue 62x más caro que DeepSeek — con exactamente el mismo precio por token.
¿Cómo es posible? Por dos números que el gurú nunca mira: tokens por tarea y precio real del cache.
| La variable que importa | MiMo V2 Pro | DeepSeek V4 Flash | Diferencia |
|---|---|---|---|
| Tokens inyectados por tarea | 171,832 | 48,980 | 3.5x más |
| Precio efectivo del cache hit | $0.291 / 1M | $0.0028 / 1M | 104x más caro |
| % del costo total que es cache | 95% ($41.97) | 15% ($1.76) | el cache = el costo |
El costo por tarea no es "precio por token × inteligencia". Es (tokens por tarea) × (precio efectivo del contexto y cache). MiMo nos inyectó 3.5x más tokens por cada tarea que DeepSeek — su gestión de contexto es estructuralmente más derrochadora — y su cache costaba 104x más. Resultado: el 95% de la factura de MiMo fue cache. DeepSeek, con cache automático al 98% de descuento, convirtió el cache en su ventaja más grande, no en su costo más grande.
3. Por qué "Claude es más barato por tarea porque es más inteligente" es técnicamente falso
Ahora volvamos al argumento del gurú. Dice: "Claude es más barato por tarea que DeepSeek porque es más inteligente y usa menos tokens."
Para que eso fuera cierto, tendría que pasar lo siguiente: Claude tendría que usar 178x menos tokens que DeepSeek por tarea (porque cuesta 178x más por token: $50 vs $0.28 por 1M de output). Ningún modelo en la historia de la IA ha logrado una eficiencia de tokens de esa magnitud. Pero no hace falta apelar a la imposibilidad matemática: la estructura técnica del modelo lo hace imposible.
3.1 Arquitectura: los modelos densos queman más tokens por diseño
Claude y GPT son modelos densos: activan el 100% de sus parámetros en cada token que generan. DeepSeek y MiMo son MoE (Mixture of Experts): activan solo una fracción.
| Modelo | Parámetros totales | Parámetros activos por token | % activado |
|---|---|---|---|
| Claude / GPT (densos) | ~X00B | 100% de los parámetros | 100% |
| DeepSeek V4 Flash (MoE) | 284B | 13B | ~4.6% |
| MiMo V2.5 (MoE) | ~309B | ~15B | ~5% |
La física del costo es simple: el costo computacional por token escala con los parámetros activos, no los totales. Un modelo denso quema los mismos FLOPs en cada token. Un MoE enciende solo los expertos que necesita. Por estructura, los densos son las máquinas menos eficientes del mercado para el mismo output. Decir que un denso "usa menos tokens por tarea que un MoE" contradice la física de cómo operan ambos.
3.2 Contexto y memoria: el multiplicador oculto que nadie mide
Aquí está la parte que ningún gurú toca, porque requiere haber operado agentes en producción: la mala gestión de contexto quema millones de tokens — y ese desperdicio es multiplicativo.
- Archivos pesados en el chat: un PDF de 200 páginas se tokeniza completo en cada llamada. Un "archivo de contexto" de 100K tokens se reenvía en cada turno.
- Historial completo reenviado: 30 mensajes de conversación = 30x el contexto acumulado, en cada llamada nueva.
- Ventanas de contexto gigantes: el modelo "ve" todo lo que le metiste aunque solo necesite 3 líneas para responder.
- Herramientas con output descomunal: un agente que llama a una tool que devuelve 50K tokens de logs — eso entra al contexto y se queda ahí para siempre.
- RAG mal implementado: metes el documento entero "por si acaso" en vez de solo el chunk relevante.
Los modelos con interfaces "premium" (Claude Code, ChatGPT) invitan a ese desperdicio: subes archivos sin pensar, el chat acumula, la ventana es enorme. En manos del usuario promedio, ese desperdicio convierte un modelo caro en un pozo sin fondo. Y cuando el modelo cuesta 30x más por token y quema 5x más tokens por mala gestión de contexto, el costo real por tarea no es "similar" — es 150x más caro en la práctica.
3.3 Cache: donde DeepSeek revienta a los densos
El golpe final. En un agente real, el 80-95% de los tokens de entrada son repetidos: system prompt, historial, contexto cargado. Ahí entra el cache:
| DeepSeek V4 Flash | Claude (Anthropic) | |
|---|---|---|
| Descuento en cache hit | ~98% ($0.0028/M) | ~90% (0.1x del input base) |
| Activación | Automática — cero configuración | Manual (cache_control en cada llamada) |
| Costo de escribir cache | No existe | Sí pagas por escribir el cache |
| TTL | Persistente con tráfico recurrente | 5 minutos (extensible a 1h con setup) |
Para que Claude te dé ese 90%, tú (desarrollador) tienes que: configurar cache_control manualmente en cada llamada, pagar por escribir el cache, vivir con un TTL de 5 minutos (si tu usuario tarda 6 minutos entre mensajes, cache muerto), y rezar para que el prefijo del prompt sea byte-idéntico entre llamadas. DeepSeek simplemente lo hace solo — y nuestro 92% de cache hit rate en producción lo confirma. Cero fricción, cero configuración, cero costos ocultos.
Nuestra factura real de DeepSeek en 30 días: $11.93 por 14,167 requests (agente 24/7 en producción, 92% cache hit). ¿Cuánto habría costado lo mismo en Claude? Simulado con precios públicos: $43.92 con el modelo más barato de Anthropic (Haiku), $87.84 con Sonnet, $219.60 con Opus, $439.20 con Fable 5. O sea: entre 18x y 179x más caro — y eso sin contar la verbosidad densa ni la mala gestión de contexto. El gurú que dice "Claude es más barato por tarea" defiende al peor candidato posible: el modelo más caro por token, denso por estructura, y con cache manual frágil.
4. Y lo más importante: los benchmarks miden modelos + harness, no el modelo puro
Hay una última capa que ningún influencer menciona, porque requiere honestidad intelectual: los benchmarks tipo "Intelligence Index" de Artificial Analysis no miden el modelo aislado. Miden modelo + harness — la capa que lo orquesta (prompting, tool calling, memoria, agent loop, gestión de contexto).
De hecho, Artificial Analysis lo admite en su propia página de DeepSeek V4 Flash: el modelo es "muy verboso" (210M tokens generados en el índice vs mediana de 100M) — que es exactamente lo que los gurús citan para decir "quema más tokens". Pero el mismo reporte dice que evaluar el índice completo costó $72 con DeepSeek. ¿Cuánto costó con Fable 5? Miles de dólares. La verbosidad no mata una ventaja de 178x — solo la reduce un poco, y la reducción queda compensada con creces por el cache.
En resumen: el "costo por tarea" es real, es la métrica correcta, y nosotros lo dijimos primero con datos. Pero usarlo para afirmar que "Claude es más barato porque es más inteligente" es el equivalente a decir que un Ferrari es más barato por kilómetro porque "es más rápido" — ignorando que consume 20L/100km, necesita mecánico especializado y se descompone si no lo cuidas a mano.
5. La parte honesta: cuándo SÍ tiene sentido pagar premium
Para no caer exactamente en lo que criticamos — repetir una verdad a medias como si fuera la verdad completa — seamos honestos sobre dónde el modelo caro gana:
- Tareas donde la precisión vale más que el costo: en un contrato de millones, pagar $50 en vez de $0.28 por una tarea crítica que se hace una vez al mes es irrelevante. La métrica de costo por tarea importa a escala: cuando tu agente hace 14,000 requests al mes, la diferencia es de $11.93 a $400+.
- Calidad en razonamiento encadenado largo: los MoE pueden "saltar" entre expertos y perder coherencia en refactors complejos o cadenas de razonamiento muy largas. Es un trade-off real del MoE, y hay tareas donde el denso rinde mejor.
- El harness que ya tienes: si tu equipo ya domina Claude Code y su ecosistema, el costo de migrar puede superar el ahorro. La métrica del costo por tarea también debe incluir el costo de tu propio tiempo.
Pero ojo con lo que dice este punto: eso no hace que "Claude sea más barato por tarea". Lo hace más caro por tarea pero con mejor calidad en ciertos casos — que es un argumento completamente distinto, y honesto. El gurú que necesita mentir sobre el costo para venderte calidad es un gurú que no tiene argumentos de calidad.
6. Conclusión: la métrica que importa, y cómo medirla tú mismo
Hagamos el resumen en cuatro puntos:
- El costo por tarea es la métrica correcta — y no es una novedad de agosto de 2026: lo publicamos en mayo, con datos, cuando nadie hablaba de eso.
- El precio por token no determina el costo por tarea: nuestro caso MiMo vs DeepSeek lo demuestra con facturas reales — mismo precio por token, 62x de diferencia por tarea.
- La afirmación "Claude es más barato por tarea porque es más inteligente" es técnicamente falsa: por arquitectura (denso vs MoE), por gestión de contexto (desperdicio multiplicativo) y por cache (manual, frágil y caro vs automático).
- Cuando alguien te da una conclusión sobre costos sin datos, desconfía: pide las facturas, pide el desglose de tokens por tarea, pide el cache hit rate. Si no los tienen, no están midiendo — están repitiendo un titular.
Nosotros medimos el costo por tarea porque operamos agentes de IA en producción 24/7 para empresas reales — y porque cada dólar que ahorramos en infraestructura es un dólar que el cliente no paga. La eficiencia no es un truco de marketing: es la diferencia entre un proyecto de IA que sobrevive y uno que muere en la segunda factura.
Si quieres saber cuánto te está costando de verdad cada tarea de tu stack de IA — con datos, no con benchmarks — hablemos.
⚡ ¿Estás pagando 62x más por tarea sin saberlo?
Auditamos tu stack de IA: medimos costo por tarea real, cache hit rate y eficiencia de contexto de tus agentes. Con datos, no con opiniones. Y te decimos exactamente dónde estás quemando dinero.
Auditar mi stack →📖 ¿Quieres profundizar en la economía de la IA?
Llevamos meses publicando el análisis técnico que los titulares no cuentan: costos reales, arquitectura y datos de producción.
Ver todos los artículos →