Categoría

PySpark

PySpark 09 ene, 2026 · 02 min de lectura

Sparkwise: Optimización Inteligente para Apache Spark en Microsoft Fabric

Sparkwise es una librería Python que automatiza el diagnóstico y optimización de Apache Spark en Microsoft Fabric: analiza configuraciones, detecta data skew, predice costos y ofrece recomendaciones priorizadas.

Kilian Baccaro Salinas Data Architect
¿Qué es la deduplicación de datos y por qué es tan importante?
PySpark 15 dic, 2025 · 02 min de lectura

¿Qué es la deduplicación de datos y por qué es tan importante?

Qué es la deduplicación de datos, por qué es crítica para la calidad de datos, y cómo implementarla en PySpark con dropDuplicates(), Window functions y ROW_NUMBER() para obtener siempre el registro más reciente.

Kilian Baccaro Salinas Data Architect
PySpark 08 sep, 2025 · 02 min de lectura

Actualiza el environment de tus notebooks de manera programática

Cómo usar Semantic Link Labs para obtener, modificar y actualizar programáticamente el environment asignado a tus notebooks de Microsoft Fabric, incluso en bloque para toda un área de trabajo.

Kilian Baccaro Salinas Data Architect
PySpark 16 ene, 2025 · 01 min de lectura

Como obtener todas las configuraciones de la sesión de Spark + secretos de Azure Key Vault

Aprende a listar todas las configuraciones de tu sesión de Spark con getConf().getAll(), acceder a parámetros internos de Fabric con 'trident' y leer secretos de Azure Key Vault desde notebooks.

Kilian Baccaro Salinas Data Architect
Ejecutando notebooks en paralelo usando runMultiple
PySpark 22 sep, 2024 · 02 min de lectura

Ejecutando notebooks en paralelo usando runMultiple

Aprende a usar la API runMultiple de NotebookUtils en Microsoft Fabric para lanzar varios notebooks en paralelo, definir dependencias con DAG y coordinar flujos de trabajo complejos.

Kilian Baccaro Salinas Data Architect
Como crear una dimensión Date con PySpark
PySpark 06 jul, 2024 · 01 min de lectura

Como crear una dimensión Date con PySpark

Tutorial paso a paso para crear una dimensión Date optimizada con PySpark y Spark SQL, con nombres de mes y día en español, lista para guardar como tabla Delta en tu Fabric Lakehouse.

Kilian Baccaro Salinas Data Architect