PySpark
Sparkwise: Optimización Inteligente para Apache Spark en Microsoft Fabric
Sparkwise es una librería Python que automatiza el diagnóstico y optimización de Apache Spark en Microsoft Fabric: analiza configuraciones, detecta data skew, predice costos y ofrece recomendaciones priorizadas.
¿Qué es la deduplicación de datos y por qué es tan importante?
Qué es la deduplicación de datos, por qué es crítica para la calidad de datos, y cómo implementarla en PySpark con dropDuplicates(), Window functions y ROW_NUMBER() para obtener siempre el registro más reciente.
Actualiza el environment de tus notebooks de manera programática
Cómo usar Semantic Link Labs para obtener, modificar y actualizar programáticamente el environment asignado a tus notebooks de Microsoft Fabric, incluso en bloque para toda un área de trabajo.
Como obtener todas las configuraciones de la sesión de Spark + secretos de Azure Key Vault
Aprende a listar todas las configuraciones de tu sesión de Spark con getConf().getAll(), acceder a parámetros internos de Fabric con 'trident' y leer secretos de Azure Key Vault desde notebooks.
Ejecutando notebooks en paralelo usando runMultiple
Aprende a usar la API runMultiple de NotebookUtils en Microsoft Fabric para lanzar varios notebooks en paralelo, definir dependencias con DAG y coordinar flujos de trabajo complejos.
Como crear una dimensión Date con PySpark
Tutorial paso a paso para crear una dimensión Date optimizada con PySpark y Spark SQL, con nombres de mes y día en español, lista para guardar como tabla Delta en tu Fabric Lakehouse.