#pyspark
Comparativa de Consumo de CUs: Por qué elegir el artefacto incorrecto puede costarte miles de euros al año
Comparativa exhaustiva del consumo de Capacity Units en Microsoft Fabric: Notebooks PySpark/Python, Pipelines, Copy Jobs y Dataflows Gen2 en tres escenarios reales —CSV pequeño, CSV de 83 GB y Azure SQL— con coste económico calculado.
Cómo recuperar Workspaces eliminados en Microsoft Fabric
Cómo usar la API REST de administración de Microsoft Fabric para listar y restaurar workspaces eliminados, incluyendo todos sus artefactos (lakehouses, notebooks, pipelines), con un notebook de PySpark.
Sparkwise: Optimización Inteligente para Apache Spark en Microsoft Fabric
Sparkwise es una librería Python que automatiza el diagnóstico y optimización de Apache Spark en Microsoft Fabric: analiza configuraciones, detecta data skew, predice costos y ofrece recomendaciones priorizadas.
¿Qué es la deduplicación de datos y por qué es tan importante?
Qué es la deduplicación de datos, por qué es crítica para la calidad de datos, y cómo implementarla en PySpark con dropDuplicates(), Window functions y ROW_NUMBER() para obtener siempre el registro más reciente.
Actualiza el environment de tus notebooks de manera programática
Cómo usar Semantic Link Labs para obtener, modificar y actualizar programáticamente el environment asignado a tus notebooks de Microsoft Fabric, incluso en bloque para toda un área de trabajo.
¿Cuántos datos están siendo almacenados en mi OneLake?
Notebook de PySpark que usa Semantic Link y notebookutils para calcular el tamaño de cada artefacto de Fabric en OneLake —Lakehouses, Warehouses, Modelos Semánticos y bases de datos KQL— y volcarlos en una tabla Delta.
Semantic Link: Automatiza la creación de tu arquitectura Medallion
Alternativa en Python con Semantic Link Labs para automatizar la creación de la arquitectura Medallion en Microsoft Fabric: workspaces, lakehouses y almacenamiento opcional de IDs en Azure Key Vault.
¿Qué es Liquid Clustering y por qué es un game changer?
Qué es Liquid Clustering en Delta Lake, cómo supera al particionado y Z-Order, cuándo usarlo y una comparativa real sobre 443 millones de registros del dataset Yellow Taxi Trip.
Como obtener todas las configuraciones de la sesión de Spark + secretos de Azure Key Vault
Aprende a listar todas las configuraciones de tu sesión de Spark con getConf().getAll(), acceder a parámetros internos de Fabric con 'trident' y leer secretos de Azure Key Vault desde notebooks.
Ejecutando notebooks en paralelo usando runMultiple
Aprende a usar la API runMultiple de NotebookUtils en Microsoft Fabric para lanzar varios notebooks en paralelo, definir dependencias con DAG y coordinar flujos de trabajo complejos.
Como crear una dimensión Date con PySpark
Tutorial paso a paso para crear una dimensión Date optimizada con PySpark y Spark SQL, con nombres de mes y día en español, lista para guardar como tabla Delta en tu Fabric Lakehouse.
Actualizando el modelo semántico
Cómo controlar el refresco de un modelo semántico en modo Direct Lake: vía Power BI API, actividad de pipeline, o desde un notebook con Semantic Link y TOM.
Evolución de Esquemas en Delta Lake
Aprende a gestionar la evolución de esquemas en Delta Lake: qué es schema enforcement, cómo usar mergeSchema y cuándo activar autoMerge para pipelines flexibles.
Delta Table History y Vacuum
Descubre cómo usar los comandos HISTORY y VACUUM en Delta Lake para auditar cambios, restaurar versiones anteriores y liberar espacio en disco de forma segura.