Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 21 horas
Temario del curso
Introducción:
- Apache Spark en el ecosistema de Hadoop
- Introducción breve a Python y Scala
Fundamentos (teoría):
- Arquitectura
- RDD
- Transformaciones y acciones
- Etapas (Stage), tareas y dependencias
Comprensión de los fundamentos usando el entorno de Databricks (taller práctico):
- Ejercicios utilizando la API de RDD
- Funciones básicas de acciones y transformaciones
- PairRDD
- Join
- Estrategias de caché
- Ejercicios utilizando la API de DataFrame
- SparkSQL
- DataFrame: select, filter, group, sort
- UDF (Función definida por el usuario)
- Exploración de la API de DataSet
- Streaming
Comprensión de la implementación usando el entorno de AWS (taller práctico):
- Fundamentos de AWS Glue
- Comprensión de las diferencias entre AWS EMR y AWS Glue
- Ejemplos de trabajos en ambos entornos
- Comprensión de ventajas y desventajas
Adicional:
- Introducción a la orquestación con Apache Airflow
Requerimientos
Conocimientos de programación (preferiblemente en Python o Scala)
Fundamentos de SQL
Reseñas (3)
Tener sesiones prácticas / asignaciones
Poornima Chenthamarakshan - Intelligent Medical Objects
Curso - Apache Spark in the Cloud
Traducción Automática
1. Equilibrio adecuado entre conceptos de alto nivel y detalles técnicos. 2. Andras es muy conocedor de su enseñanza. 3. Ejercicio
Steven Wu - Intelligent Medical Objects
Curso - Apache Spark in the Cloud
Traducción Automática
Aprende sobre el streaming de Spark, Databricks y AWS Redshift
Lim Meng Tee - Jobstreet.com Shared Services Sdn. Bhd.
Curso - Apache Spark in the Cloud
Traducción Automática