Etiqueta

#pyspark

Comparativa de Consumo de CUs: Por qué elegir el artefacto incorrecto puede costarte miles de euros al año
Optimización 18 feb, 2026 · 04 min de lectura

Comparativa de Consumo de CUs: Por qué elegir el artefacto incorrecto puede costarte miles de euros al año

Comparativa exhaustiva del consumo de Capacity Units en Microsoft Fabric: Notebooks PySpark/Python, Pipelines, Copy Jobs y Dataflows Gen2 en tres escenarios reales —CSV pequeño, CSV de 83 GB y Azure SQL— con coste económico calculado.

Kilian Baccaro Salinas Data Architect
Cómo recuperar Workspaces eliminados en Microsoft Fabric
API 16 ene, 2026 · 02 min de lectura

Cómo recuperar Workspaces eliminados en Microsoft Fabric

Cómo usar la API REST de administración de Microsoft Fabric para listar y restaurar workspaces eliminados, incluyendo todos sus artefactos (lakehouses, notebooks, pipelines), con un notebook de PySpark.

Kilian Baccaro Salinas Data Architect
PySpark 09 ene, 2026 · 02 min de lectura

Sparkwise: Optimización Inteligente para Apache Spark en Microsoft Fabric

Sparkwise es una librería Python que automatiza el diagnóstico y optimización de Apache Spark en Microsoft Fabric: analiza configuraciones, detecta data skew, predice costos y ofrece recomendaciones priorizadas.

Kilian Baccaro Salinas Data Architect
¿Qué es la deduplicación de datos y por qué es tan importante?
PySpark 15 dic, 2025 · 02 min de lectura

¿Qué es la deduplicación de datos y por qué es tan importante?

Qué es la deduplicación de datos, por qué es crítica para la calidad de datos, y cómo implementarla en PySpark con dropDuplicates(), Window functions y ROW_NUMBER() para obtener siempre el registro más reciente.

Kilian Baccaro Salinas Data Architect
PySpark 08 sep, 2025 · 02 min de lectura

Actualiza el environment de tus notebooks de manera programática

Cómo usar Semantic Link Labs para obtener, modificar y actualizar programáticamente el environment asignado a tus notebooks de Microsoft Fabric, incluso en bloque para toda un área de trabajo.

Kilian Baccaro Salinas Data Architect
Lakehouse 12 may, 2025 · 04 min de lectura

¿Cuántos datos están siendo almacenados en mi OneLake?

Notebook de PySpark que usa Semantic Link y notebookutils para calcular el tamaño de cada artefacto de Fabric en OneLake —Lakehouses, Warehouses, Modelos Semánticos y bases de datos KQL— y volcarlos en una tabla Delta.

Kilian Baccaro Salinas Data Architect
API 06 abr, 2025 · 01 min de lectura

Semantic Link: Automatiza la creación de tu arquitectura Medallion

Alternativa en Python con Semantic Link Labs para automatizar la creación de la arquitectura Medallion en Microsoft Fabric: workspaces, lakehouses y almacenamiento opcional de IDs en Azure Key Vault.

Kilian Baccaro Salinas Data Architect
¿Qué es Liquid Clustering y por qué es un game changer?
Delta Lake 25 feb, 2025 · 04 min de lectura

¿Qué es Liquid Clustering y por qué es un game changer?

Qué es Liquid Clustering en Delta Lake, cómo supera al particionado y Z-Order, cuándo usarlo y una comparativa real sobre 443 millones de registros del dataset Yellow Taxi Trip.

Kilian Baccaro Salinas Data Architect
PySpark 16 ene, 2025 · 01 min de lectura

Como obtener todas las configuraciones de la sesión de Spark + secretos de Azure Key Vault

Aprende a listar todas las configuraciones de tu sesión de Spark con getConf().getAll(), acceder a parámetros internos de Fabric con 'trident' y leer secretos de Azure Key Vault desde notebooks.

Kilian Baccaro Salinas Data Architect
Ejecutando notebooks en paralelo usando runMultiple
PySpark 22 sep, 2024 · 02 min de lectura

Ejecutando notebooks en paralelo usando runMultiple

Aprende a usar la API runMultiple de NotebookUtils en Microsoft Fabric para lanzar varios notebooks en paralelo, definir dependencias con DAG y coordinar flujos de trabajo complejos.

Kilian Baccaro Salinas Data Architect
Como crear una dimensión Date con PySpark
PySpark 06 jul, 2024 · 01 min de lectura

Como crear una dimensión Date con PySpark

Tutorial paso a paso para crear una dimensión Date optimizada con PySpark y Spark SQL, con nombres de mes y día en español, lista para guardar como tabla Delta en tu Fabric Lakehouse.

Kilian Baccaro Salinas Data Architect
Actualizando el modelo semántico
Semantic Model 01 may, 2024 · 04 min de lectura

Actualizando el modelo semántico

Cómo controlar el refresco de un modelo semántico en modo Direct Lake: vía Power BI API, actividad de pipeline, o desde un notebook con Semantic Link y TOM.

Kilian Baccaro Salinas Data Architect
Evolución de Esquemas en Delta Lake
Delta Lake 16 mar, 2024 · 04 min de lectura

Evolución de Esquemas en Delta Lake

Aprende a gestionar la evolución de esquemas en Delta Lake: qué es schema enforcement, cómo usar mergeSchema y cuándo activar autoMerge para pipelines flexibles.

Kilian Baccaro Salinas Data Architect
Delta Table History y Vacuum
Delta Lake 03 mar, 2024 · 04 min de lectura

Delta Table History y Vacuum

Descubre cómo usar los comandos HISTORY y VACUUM en Delta Lake para auditar cambios, restaurar versiones anteriores y liberar espacio en disco de forma segura.

Kilian Baccaro Salinas Data Architect