Temario del curso
Introducción, Objetivos y Estrategia de Migración
- Objetivos del curso, alineación con el perfil del participante y criterios de éxito
- Enfoques de migración de alto nivel y consideraciones de riesgo
- Configuración de espacios de trabajo (workspaces), repositorios y conjuntos de datos para el laboratorio
Día 1 — Fundamentos de Migración y Arquitectura
- Conceptos de Lakehouse, resumen de Delta Lake y arquitectura de Databricks
- Diferencias entre SMP y MPP e implicaciones para la migración
- Diseño Medallion (Bronze→Silver→Gold) y resumen de Unity Catalog
Laboratorio Día 1 — Traducción de un Procedimiento Almacenado
- Migración práctica de un procedimiento almacenado de ejemplo a un notebook
- Mapeo de tablas temporales y cursores a transformaciones de DataFrames
- Validación y comparación con la salida original
Día 2 — Delta Lake Avanzado y Carga Incremental
- Transacciones ACID, registros de commit, versionado y time travel
- Auto Loader, patrones MERGE INTO, inserciones actualizables (upserts) y evolución de esquema
- OPTIMIZE, VACUUM, Z-ORDER, particionamiento y ajuste de almacenamiento
Laboratorio Día 2 — Ingesta Incremental y Optimización
- Implementación de ingesta con Auto Loader y flujos de trabajo MERGE
- Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados
- Medición de mejoras en el rendimiento de lectura/escritura
Día 3 — SQL en Databricks, Rendimiento y Depuración
- Características de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays
- Lectura de la interfaz de Spark UI, DAGs, mezclas (shuffles), etapas, tareas y diagnóstico de cuellos de botella
- Patrones de ajuste de consultas: uniones difusadas (broadcast joins), indicaciones (hints), caché y reducción de desbordamiento (spill)
Laboratorio Día 3 — Refactorización de SQL y Ajuste de Rendimiento
- Refactorización de un proceso SQL pesado en Spark SQL optimizado
- Uso de trazas de Spark UI para identificar y corregir problemas de sesgo (skew) y mezcla (shuffle)
- Benchmarking antes/después y documentación de los pasos de ajuste
Día 4 — PySpark Táctico: Reemplazo de Lógica Procedural
- Modelo de ejecución de Spark: conductor (driver), ejecutores (executors), evaluación perezosa y estrategias de particionamiento
- Transformación de bucles y cursores en operaciones vectorizadas de DataFrames
- Modularización, UDFs/UDFs de pandas, widgets y bibliotecas reutilizables
Laboratorio Día 4 — Refactorización de Scripts Procedurales
- Refactorización de un script ETL procedural en notebooks modulares de PySpark
- Introducción a la parametrización, pruebas de estilo unitario y funciones reutilizables
- Revisión de código y aplicación de la lista de comprobación de mejores prácticas
Día 5 — Orquestación, Pipeline de Extremo a Extremo y Mejores Prácticas
- Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenantes y manejo de errores
- Diseño de pipelines Medallion incrementales con reglas de calidad y validación de esquema
- Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para lógica PySpark
Laboratorio Día 5 — Construcción de un Pipeline Completo de Extremo a Extremo
- Ensamblaje del pipeline Bronze→Silver→Gold orquestado con Workflows
- Implementación de registro de eventos (logging), auditoría, reintentos y validaciones automatizadas
- Ejecución del pipeline completo, validación de salidas y preparación de notas de despliegue
Operacionalización, Gobernanza y Listo para Producción
- Mejores prácticas de gobernanza de Unity Catalog, linaje y controles de acceso
- Costos, dimensionamiento de clústeres, autoescalado y patrones de concurrencia de trabajos
- Listas de comprobación para el despliegue, estrategias de reversión y creación de manuales de operaciones (runbooks)
Revisión Final, Transferencia de Conocimiento y Próximos Pasos
- Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas
- Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación
- Referencias, rutas de aprendizaje adicionales y opciones de soporte
Requerimientos
- Comprensión de los conceptos de ingeniería de datos
- Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server)
- Conocimiento de los conceptos de orquestación ETL (ADF o similares)
Público objetivo
- Gerentes de tecnología con experiencia en ingeniería de datos
- Ingenieros de datos que migran lógica procedural OLAP a patrones Lakehouse
- Ingenieros de plataforma responsables de la adopción de Databricks
Reseñas (1)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.