Comparativa de Consumo de CUs: Por qué elegir el artefacto incorrecto puede costarte miles de euros al año
Autor
Kilian Baccaro Salinas
Categoría
Optimización
Tiempo de lectura
04 min de lectura
Fecha de publicación
18 feb, 2026
Microsoft Fabric utiliza un modelo de consumo basado en Capacity Units (CUs) para medir y facturar el uso de recursos computacionales. Comprender cómo diferentes artefactos y escenarios de ingesta de datos impactan en el consumo de CUs es fundamental para optimizar costos y seleccionar la herramienta más eficiente para cada caso de uso.
Este artículo presenta una comparativa práctica y detallada del consumo de CUs en Microsoft Fabric al cargar datos desde diferentes orígenes y formatos utilizando los principales artefactos disponibles en la plataforma.
Metodología
Para cada escenario se han capturado las siguientes métricas mediante la aplicación Microsoft Fabric Capacity Metrics:
-
CUs consumidas: Total de Capacity Units utilizadas en la operación
-
Duración: Tiempo de ejecución en segundos
-
Coste: Coste económico calculado en base a la duración y el precio de la capacidad
Configuración de la Capacidad
Capacidad F2 en modo Pay-as-you-go en Spain Central, precio €0.323/hora.
Cálculo del coste:
Coste (€) = (Duración en segundos × €0.323) / 3600
Escenario 1: Ingesta de Fichero CSV
Dataset utilizado
- Archivo: sales.csv
- Tamaño: 189 MB
- Tipo: Datos de ventas en formato CSV

Operación: Lectura de CSV y escritura en tabla Delta sin transformaciones.
Resultados

Coste económico
- Pipeline: €0.0035 — El más económico por tiempo
- Notebook Python: €0.0038 — 9% más que Pipeline
- Copy Job: €0.0042 — 20% más que Pipeline
- Dataflow Gen2: €0.0047 — 34% más que Pipeline
- Notebook PySpark: €0.0060 — 71% más que Pipeline
Consumo de CUs y tiempos de ejecución

Comparativa PySpark vs Python (Pandas)
| Característica | Notebook PySpark | Notebook Python | Diferencia |
|---|---|---|---|
| Motor de procesamiento | Apache Spark (distribuido) | Pandas (single-node) | - |
| CUs consumidas | 267.81 | 85.15 | -68% ✅ |
| Tiempo de ejecución | 66.95s | 42.58s | -36% ✅ |
| Throughput | 169.18 MB/min | 266.01 MB/min | +57% ✅ |
| Coste | €0.0060 | €0.0038 | -37% ✅ |
| Mejor para archivos | > 5 GB | < 1 GB | - |
Para archivos pequeños, Python/Pandas es claramente superior en todos los aspectos. El overhead de Spark solo se justifica con grandes volúmenes donde su procesamiento distribuido compensa los costes de inicialización.
Escenario 2: Ingesta de fichero CSV de gran volumen
Dataset utilizado
- Archivo: cms_unificado.csv
- Tamaño: 83.76 GB
- Tipo: Datos de CMS consolidados en formato CSV
Resultados

El Notebook Python no pudo evaluarse:
# Error exit code: -9 (Forced-process termination.
# This is often caused by insufficient memory causing the process to be killed.)Pandas carga todo el dataset en memoria RAM. Con 83.76 GB, la capacidad F2 es insuficiente → proceso eliminado por OOM.
Coste económico
- Notebook PySpark: €0.0610 — El más económico 💰
- Pipeline: €0.3135 — 5.14x más caro que PySpark
- Copy Job: €0.3158 — 5.18x más caro que PySpark
- Dataflow Gen2: €0.3748 — 6.15x más caro que PySpark
Consumo de CUs y tiempos de ejecución

El Notebook PySpark consume menos de 1/8 de las CUs del Pipeline y menos de 1/25 del Dataflow Gen2. Completa la carga en 11 minutos, mientras los demás tardan entre 58 y 70 minutos.
Análisis crítico del Dataflow Gen2 en grandes volúmenes
- 24.54x más CUs que PySpark (63,980 CUs de diferencia)
- 6.15x más tiempo que PySpark (casi 70 minutos vs 11 minutos)
- €0.3138 más por ejecución (+515% de coste)
Proyección anual con carga diaria:
- Coste PySpark: €22.27/año
- Coste Dataflow Gen2: €136.80/año
- Sobrecoste: €114.53/año (para un solo archivo)
Aunque Dataflow Gen2 ofrece una interfaz visual atractiva, su uso en producción con archivos grandes es técnicamente inadecuado y económicamente inviable. La facilidad de uso no justifica un sobrecosto del 515% y un tiempo de ejecución 6x superior.
Escenario 3: Ingesta desde Azure SQL Database
Datasets utilizados
Tabla Customer (Pequeña)
- Registros: 1,679,846
- Tamaño: 679.47 MB
Tabla Sales (Mediana-Grande)
- Registros: 23,719,935
- Tamaño: 2.99 GB
Tabla Customer — Resultados

Coste económico:
- Pipeline: €0.0047 — El más económico por tiempo
- Notebook PySpark: €0.0050 — Prácticamente igual (+6%)
- Copy Job: €0.0052 — Similar (+11%)
- Dataflow Gen2: €0.0116 — 147% más caro que Pipeline

Tabla Sales — Resultados

Coste económico:
- Notebook PySpark: €0.0082 — El más económico
- Copy Job: €0.0173 — 2.11x más caro
- Pipeline: €0.0236 — 2.88x más caro
- Dataflow Gen2: €0.0667 — 8.13x más caro

PySpark consume 3x menos CUs que Pipeline y menos de 23x que Dataflow Gen2, siendo además casi 3 veces más rápido que Pipeline.
Conclusión final
La elección del artefacto correcto en Microsoft Fabric es una decisión estratégica que impacta en costes operativos, tiempos de ejecución y capacidad disponible.
Lecciones aprendidas:
-
El tamaño importa exponencialmente: Una diferencia del 9% en archivos pequeños se convierte en 500% en archivos grandes
-
El origen importa: Azure SQL es más eficiente que CSV para todos los artefactos
-
PySpark es el rey indiscutible en producción: Para cualquier volumen >1 GB, PySpark es superior en todos los aspectos medibles
-
Dataflow Gen2 no escala: Su facilidad de uso no justifica sobrecostos del 500-700% en producción
-
La formación se paga sola: Invertir en formación de PySpark se amortiza en semanas con el ahorro en CUs
La interfaz visual y facilidad de uso tienen un precio en Capacity Units. En archivos o tablas pequeñas, ese precio puede ser aceptable. En archivos o tablas grandes, ese precio es prohibitivo.