Etiqueta

#delta-lake

Change Data Feed en Delta Lake: Captura incremental de cambios para pipelines modernos en Microsoft Fabric
Delta Lake 24 mar, 2026 · 17 min de lectura

Change Data Feed en Delta Lake: Captura incremental de cambios para pipelines modernos en Microsoft Fabric

Descubre cómo Change Data Feed, el CDC nativo de Delta Lake, registra inserciones, actualizaciones y eliminaciones a nivel de fila sin herramientas externas. Aprende a activarlo y aprovecharlo en pipelines incrementales modernos dentro de Microsoft Fabric

Kilian Baccaro Salinas Data Architect
PySpark 09 ene, 2026 · 02 min de lectura

Sparkwise: Optimización Inteligente para Apache Spark en Microsoft Fabric

Sparkwise es una librería Python que automatiza el diagnóstico y optimización de Apache Spark en Microsoft Fabric: analiza configuraciones, detecta data skew, predice costos y ofrece recomendaciones priorizadas.

Kilian Baccaro Salinas Data Architect
¿Qué es la deduplicación de datos y por qué es tan importante?
PySpark 15 dic, 2025 · 02 min de lectura

¿Qué es la deduplicación de datos y por qué es tan importante?

Qué es la deduplicación de datos, por qué es crítica para la calidad de datos, y cómo implementarla en PySpark con dropDuplicates(), Window functions y ROW_NUMBER() para obtener siempre el registro más reciente.

Kilian Baccaro Salinas Data Architect
Delta Lake 04 dic, 2025 · 03 min de lectura

Deletion Vectors en Delta Lake: Funcionamiento interno, impacto en el rendimiento y recomendaciones prácticas

Guía técnica sobre Deletion Vectors en Delta Lake: cómo funcionan internamente, benchmarks reales de DELETE/UPDATE/MERGE y SELECT en tablas de 100 millones de filas, y cuándo habilitarlos en Microsoft Fabric.

Kilian Baccaro Salinas Data Architect
¿Qué es Liquid Clustering y por qué es un game changer?
Delta Lake 25 feb, 2025 · 04 min de lectura

¿Qué es Liquid Clustering y por qué es un game changer?

Qué es Liquid Clustering en Delta Lake, cómo supera al particionado y Z-Order, cuándo usarlo y una comparativa real sobre 443 millones de registros del dataset Yellow Taxi Trip.

Kilian Baccaro Salinas Data Architect
Como crear una dimensión Date con PySpark
PySpark 06 jul, 2024 · 01 min de lectura

Como crear una dimensión Date con PySpark

Tutorial paso a paso para crear una dimensión Date optimizada con PySpark y Spark SQL, con nombres de mes y día en español, lista para guardar como tabla Delta en tu Fabric Lakehouse.

Kilian Baccaro Salinas Data Architect
Evolución de Esquemas en Delta Lake
Delta Lake 16 mar, 2024 · 04 min de lectura

Evolución de Esquemas en Delta Lake

Aprende a gestionar la evolución de esquemas en Delta Lake: qué es schema enforcement, cómo usar mergeSchema y cuándo activar autoMerge para pipelines flexibles.

Kilian Baccaro Salinas Data Architect
Delta Table History y Vacuum
Delta Lake 03 mar, 2024 · 04 min de lectura

Delta Table History y Vacuum

Descubre cómo usar los comandos HISTORY y VACUUM en Delta Lake para auditar cambios, restaurar versiones anteriores y liberar espacio en disco de forma segura.

Kilian Baccaro Salinas Data Architect