Comparativa de Consumo de CUs: Por qué elegir el artefacto incorrecto puede costarte miles de euros al año

Autor

Kilian Baccaro Salinas

Categoría

Optimización

Tiempo de lectura

04 min de lectura

Fecha de publicación

18 feb, 2026

Microsoft Fabric utiliza un modelo de consumo basado en Capacity Units (CUs) para medir y facturar el uso de recursos computacionales. Comprender cómo diferentes artefactos y escenarios de ingesta de datos impactan en el consumo de CUs es fundamental para optimizar costos y seleccionar la herramienta más eficiente para cada caso de uso.

Este artículo presenta una comparativa práctica y detallada del consumo de CUs en Microsoft Fabric al cargar datos desde diferentes orígenes y formatos utilizando los principales artefactos disponibles en la plataforma.

Metodología

Para cada escenario se han capturado las siguientes métricas mediante la aplicación Microsoft Fabric Capacity Metrics:

  • CUs consumidas: Total de Capacity Units utilizadas en la operación

  • Duración: Tiempo de ejecución en segundos

  • Coste: Coste económico calculado en base a la duración y el precio de la capacidad

Importante: Todas las pruebas corresponden a cargas completas (full load) sin optimizaciones de carga, sin CDC, sin filtrado ni transformaciones. El objetivo es medir el coste base del movimiento de datos puro.

Configuración de la Capacidad

Capacidad F2 en modo Pay-as-you-go en Spain Central, precio €0.323/hora.

Cálculo del coste:

Coste (€) = (Duración en segundos × €0.323) / 3600

Escenario 1: Ingesta de Fichero CSV

Dataset utilizado

  • Archivo: sales.csv
  • Tamaño: 189 MB
  • Tipo: Datos de ventas en formato CSV

Operación: Lectura de CSV y escritura en tabla Delta sin transformaciones.

Resultados

Coste económico

  • Pipeline: €0.0035 — El más económico por tiempo
  • Notebook Python: €0.0038 — 9% más que Pipeline
  • Copy Job: €0.0042 — 20% más que Pipeline
  • Dataflow Gen2: €0.0047 — 34% más que Pipeline
  • Notebook PySpark: €0.0060 — 71% más que Pipeline

Consumo de CUs y tiempos de ejecución

💡
En archivos pequeños, Notebook Python es el más eficiente en CUs (76% menos que Pipeline), mientras que Pipeline es el más rápido (9% más rápido que Python).

Comparativa PySpark vs Python (Pandas)

CaracterísticaNotebook PySparkNotebook PythonDiferencia
Motor de procesamientoApache Spark (distribuido)Pandas (single-node)-
CUs consumidas267.8185.15-68%
Tiempo de ejecución66.95s42.58s-36%
Throughput169.18 MB/min266.01 MB/min+57%
Coste€0.0060€0.0038-37%
Mejor para archivos> 5 GB< 1 GB-

Para archivos pequeños, Python/Pandas es claramente superior en todos los aspectos. El overhead de Spark solo se justifica con grandes volúmenes donde su procesamiento distribuido compensa los costes de inicialización.


Escenario 2: Ingesta de fichero CSV de gran volumen

Dataset utilizado

  • Archivo: cms_unificado.csv
  • Tamaño: 83.76 GB
  • Tipo: Datos de CMS consolidados en formato CSV

Resultados

El Notebook Python no pudo evaluarse:

# Error exit code: -9 (Forced-process termination. 
# This is often caused by insufficient memory causing the process to be killed.)

Pandas carga todo el dataset en memoria RAM. Con 83.76 GB, la capacidad F2 es insuficiente → proceso eliminado por OOM.

Coste económico

  • Notebook PySpark: €0.0610 — El más económico 💰
  • Pipeline: €0.3135 — 5.14x más caro que PySpark
  • Copy Job: €0.3158 — 5.18x más caro que PySpark
  • Dataflow Gen2: €0.3748 — 6.15x más caro que PySpark

Consumo de CUs y tiempos de ejecución

En archivos grandes, PySpark es el campeón absoluto: consume 87% menos CUs, es 5x más rápido y cuesta 5x menos que Pipeline.

El Notebook PySpark consume menos de 1/8 de las CUs del Pipeline y menos de 1/25 del Dataflow Gen2. Completa la carga en 11 minutos, mientras los demás tardan entre 58 y 70 minutos.

Análisis crítico del Dataflow Gen2 en grandes volúmenes

  • 24.54x más CUs que PySpark (63,980 CUs de diferencia)
  • 6.15x más tiempo que PySpark (casi 70 minutos vs 11 minutos)
  • €0.3138 más por ejecución (+515% de coste)

Proyección anual con carga diaria:

  • Coste PySpark: €22.27/año
  • Coste Dataflow Gen2: €136.80/año
  • Sobrecoste: €114.53/año (para un solo archivo)

Aunque Dataflow Gen2 ofrece una interfaz visual atractiva, su uso en producción con archivos grandes es técnicamente inadecuado y económicamente inviable. La facilidad de uso no justifica un sobrecosto del 515% y un tiempo de ejecución 6x superior.


Escenario 3: Ingesta desde Azure SQL Database

Datasets utilizados

Tabla Customer (Pequeña)

  • Registros: 1,679,846
  • Tamaño: 679.47 MB

Tabla Sales (Mediana-Grande)

  • Registros: 23,719,935
  • Tamaño: 2.99 GB

Tabla Customer — Resultados

Coste económico:

  • Pipeline: €0.0047 — El más económico por tiempo
  • Notebook PySpark: €0.0050 — Prácticamente igual (+6%)
  • Copy Job: €0.0052 — Similar (+11%)
  • Dataflow Gen2: €0.0116 — 147% más caro que Pipeline

💡
En tablas SQL pequeñas, tanto Pipeline como PySpark son opciones válidas con diferencias mínimas. PySpark es más eficiente en CUs, Pipeline ligeramente más rápido.

Tabla Sales — Resultados

Coste económico:

  • Notebook PySpark: €0.0082 — El más económico
  • Copy Job: €0.0173 — 2.11x más caro
  • Pipeline: €0.0236 — 2.88x más caro
  • Dataflow Gen2: €0.0667 — 8.13x más caro

PySpark consume 3x menos CUs que Pipeline y menos de 23x que Dataflow Gen2, siendo además casi 3 veces más rápido que Pipeline.


Conclusión final

La elección del artefacto correcto en Microsoft Fabric es una decisión estratégica que impacta en costes operativos, tiempos de ejecución y capacidad disponible.

Lecciones aprendidas:

  1. El tamaño importa exponencialmente: Una diferencia del 9% en archivos pequeños se convierte en 500% en archivos grandes

  2. El origen importa: Azure SQL es más eficiente que CSV para todos los artefactos

  3. PySpark es el rey indiscutible en producción: Para cualquier volumen >1 GB, PySpark es superior en todos los aspectos medibles

  4. Dataflow Gen2 no escala: Su facilidad de uso no justifica sobrecostos del 500-700% en producción

  5. La formación se paga sola: Invertir en formación de PySpark se amortiza en semanas con el ahorro en CUs

La interfaz visual y facilidad de uso tienen un precio en Capacity Units. En archivos o tablas pequeñas, ese precio puede ser aceptable. En archivos o tablas grandes, ese precio es prohibitivo.