Ponte en Contacto

Temario del curso

Fundamentos de la Plataforma Databricks y Lakehouse

  • Arquitectura y componentes del Lakehouse de Databricks.
  • Organización de áreas de trabajo y catálogos.

Área de trabajo de Databricks y Notebooks

  • Navegación del área de trabajo y desarrollo basado en notebooks.
  • Estructuración del código en notebooks reutilizables.

Arquitectura y ejecución de Apache Spark

  • Arquitectura del entorno de ejecución de Spark y modelo de ejecución.
  • Evaluación perezosa y el DAG del trabajo.

DataFrames de PySpark y la API de DataFrame

  • Abstracciones de DataFrame y esquemas.
  • Operaciones principales de DataFrame y expresiones de columnas.

Traducción de SQL a DataFrames de PySpark

  • Traducción de cláusulas SQL centrales a operaciones de DataFrame.
  • Funciones de ventana y agregaciones en PySpark.

Lectura y escritura de datos en Databricks

  • Lectura desde fuentes comunes de archivos y bases de datos.
  • Escripción y particionado de datos en el Lakehouse.

Delta Lake y gestión de tablas

  • Tablas Delta y transacciones ACID.
  • Viaje en el tiempo (time travel) y evolución del esquema.

Patrones de limpieza y transformación de datos

  • Limpieza de datos y conversión de tipos.
  • Construcción de lógica de transformación reutilizable.

Funciones definidas por el usuario (UDF) y código modular

  • UDFs de Python y pandas UDFs.
  • Modularización de lógica procedural en funciones.

Ajuste de rendimiento y optimización

  • Estrategias de particionado y almacenamiento en caché (caching).
  • Diagnóstico de cuellos de botella con la interfaz de usuario de Spark.

Fundamentos de Structured Streaming

  • Modelos de procesamiento por lotes frente a streaming.
  • DataFrames en streaming y agregaciones básicas.

Trabajos (Jobs) y orquestación de flujos de trabajo en Databricks

  • Programación de notebooks como trabajos y tareas.
  • Construcción de flujos de trabajo multietapa con dependencias.

Unity Catalog y gobernanza de datos

  • Arquitectura y espacios de nombres de Unity Catalog.
  • Control de acceso y linaje de datos.

Pruebas, depuración y prácticas de producción

  • Pruebas unitarias de la lógica de PySpark.
  • Depuración y estándares de calidad del código.

Casos de uso integrales en servicios financieros

  • Construcción de un pipeline ETL bancario end-to-end.
  • Traducción de procesos SQL heredados a PySpark.

Migración de cargas de trabajo SQL a PySpark

  • Estrategias de migración y patrones de planificación.
  • Conversión incremental de flujos de trabajo SQL a PySpark.

Requerimientos

  • Experiencia con programación en Python, incluyendo funciones y tipos de datos.
  • Comprensión de SQL, incluyendo joins, agregaciones y subconsultas.
  • No se requiere experiencia previa con Databricks o PySpark.

Público objetivo

  • Ingenieros de datos, analistas de datos y profesionales del sector de datos.
  • Equipos que están migrando flujos de trabajo basados en SQL existentes a Databricks y PySpark.
 35 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas