Ponte en Contacto
 Duración 21 horas

Temario del curso

Introducción:

  • Apache Spark en el ecosistema de Hadoop
  • Introducción breve a Python y Scala

Fundamentos (teoría):

  • Arquitectura
  • RDD
  • Transformaciones y acciones
  • Etapas (Stage), tareas y dependencias

Comprensión de los fundamentos usando el entorno de Databricks (taller práctico):

  • Ejercicios utilizando la API de RDD
  • Funciones básicas de acciones y transformaciones
  • PairRDD
  • Join
  • Estrategias de caché
  • Ejercicios utilizando la API de DataFrame
  • SparkSQL
  • DataFrame: select, filter, group, sort
  • UDF (Función definida por el usuario)
  • Exploración de la API de DataSet
  • Streaming

Comprensión de la implementación usando el entorno de AWS (taller práctico):

  • Fundamentos de AWS Glue
  • Comprensión de las diferencias entre AWS EMR y AWS Glue
  • Ejemplos de trabajos en ambos entornos
  • Comprensión de ventajas y desventajas

Adicional:

  • Introducción a la orquestación con Apache Airflow

Requerimientos

Conocimientos de programación (preferiblemente en Python o Scala)

Fundamentos de SQL

Número de participantes


Precio por participante

Reseñas (3)

Próximos cursos

Categorías Relacionadas