Ponte en Contacto
 Duración 35 horas

Temario del curso

Introducción, Objetivos y Estrategia de Migración

  • Objetivos del curso, alineación del perfil del participante y criterios de éxito
  • Enfoques de migración a alto nivel y consideraciones de riesgo
  • Configuración de espacios de trabajo, repositorios y conjuntos de datos para laboratorios

Día 1 — Fundamentos de migración y arquitectura

  • Conceptos de Lakehouse, visión general de Delta Lake y arquitectura de Databricks
  • Diferencias entre SMP y MPP e implicaciones para la migración
  • Diseño Medallion (Bronze→Silver→Gold) y visión general de Unity Catalog

Lab del Día 1 — Traducción de un procedimiento almacenado

  • Migración práctica de un procedimiento almacenado de ejemplo a un notebook
  • Mapeo de tablas temporales y cursores a transformaciones de DataFrame
  • Validación y comparación con la salida original

Día 2 — Delta Lake avanzado y carga incremental

  • Transacciones ACID, registros de commit, versionamiento y viaje en el tiempo (time travel)
  • Auto Loader, patrones MERGE INTO, upserts y evolución de esquema
  • OPTIMIZE, VACUUM, Z-ORDER, particionado y ajuste de almacenamiento

Lab del Día 2 — Ingestión incremental y optimización

  • Implementación de ingestión con Auto Loader y flujos de trabajo MERGE
  • Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados
  • Medición de mejoras en el rendimiento de lectura/escritura

Día 3 — SQL en Databricks, rendimiento y depuración

  • Características analíticas de SQL: funciones de ventana, funciones de orden superior, manejo de JSON/arrays
  • Lectura de la UI de Spark, DAGs, mezclas (shuffles), etapas, tareas y diagnóstico de cuellos de botella
  • Patrones de ajuste de consultas: uniones de difusión (broadcast joins), pistas (hints), caché y reducción de derrames (spill)

Lab del Día 3 — Refactorización de SQL y ajuste de rendimiento

  • Refactorización de un proceso SQL pesado a Spark SQL optimizado
  • Uso de trazas de la UI de Spark para identificar y corregir problemas de sesgo (skew) y mezclas (shuffle)
  • Benchmark antes/después y documentación de los pasos de ajuste

Día 4 — PySpark táctico: Reemplazo de la lógica procedural

  • Modelo de ejecución de Spark: driver, executors, evaluación perezosa (lazy evaluation) y estrategias de particionado
  • Transformación de bucles y cursores en operaciones vectorizadas de DataFrame
  • Modularización, UDFs/pandas UDFs, widgets y bibliotecas reutilizables

Lab del Día 4 — Refactorización de scripts procedurales

  • Refactorización de un script ETL procedural en notebooks modulares de PySpark
  • Introducción de parametrización, pruebas de estilo unitario y funciones reutilizables
  • Revisión de código y aplicación de la lista de verificación de mejores prácticas

Día 5 — Orquestación, Tubería de extremo a extremo y mejores prácticas

  • Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenantes (triggers) y manejo de errores
  • Diseño de tuberías Medallion incrementales con reglas de calidad y validación de esquemas
  • Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para lógica de PySpark

Lab del Día 5 — Construir una tubería completa de extremo a extremo

  • Ensamblaje de la tubería Bronze→Silver→Gold orquestada con Workflows
  • Implementación de registro de eventos (logging), auditoría, reintentos y validaciones automatizadas
  • Ejecución de la tubería completa, validación de salidas y preparación de notas de despliegue

Operacionalización, Gobernanza y preparación para producción

  • Mejores prácticas de gobernanza de Unity Catalog, linaje (lineage) y controles de acceso
  • Costo, dimensionamiento de clústeres, autoescalado (autoscaling) y patrones de concurrencia de trabajos
  • Listas de verificación de despliegue, estrategias de reversión (rollback) y creación de guías de operación (runbooks)

Revisión final, Transferencia de conocimientos y próximos pasos

  • Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas
  • Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de formación
  • Referencias, rutas de aprendizaje adicionales y opciones de soporte

Requerimientos

  • Comprensión de los conceptos de ingeniería de datos
  • Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server)
  • Conocimiento de los conceptos de orquestación de ETL (ADF o similar)

Público objetivo

  • Gerentes de tecnología con antecedentes en ingeniería de datos
  • Ingenieros de datos que transitan la lógica procedural OLAP hacia patrones Lakehouse
  • Ingenieros de plataforma responsables de la adopción de Databricks

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas