Ponte en Contacto

Temario del curso

Introducción

Comprensión del Big Data

Resumen de Spark

Resumen de Python

Resumen de PySpark

  • Distribución de datos utilizando el marco de trabajo Resilient Distributed Datasets (RDD).
  • Distribución de la computación utilizando los operadores de la API de Spark.

Configuración de Python con Spark

Configuración de PySpark

Uso de instancias EC2 de Amazon Web Services (AWS) para Spark

Configuración de Databricks

Configuración del clúster AWS EMR

Aprendizaje de los fundamentos de la programación en Python

  • Introducción a Python
  • Uso del Jupyter Notebook
  • Uso de variables y tipos de datos simples
  • Trabajo con listas
  • Uso de sentencias if
  • Uso de entradas de usuario
  • Trabajo con bucles while
  • Implementación de funciones
  • Trabajo con clases
  • Trabajo con archivos y excepciones
  • Trabajo con proyectos, datos y APIs

Aprendizaje de los fundamentos del DataFrame de Spark

  • Introducción a los DataFrames de Spark
  • Implementación de operaciones básicas con Spark
  • Uso de operaciones Groupby y de agregación
  • Trabajo con marcas de tiempo y fechas

Ejercicio de proyecto en DataFrame de Spark

Comprensión del Machine Learning con MLlib

Trabajo con MLlib, Spark y Python para Machine Learning

Comprensión de las regresiones

  • Aprendizaje de la teoría de la regresión lineal
  • Implementación de un código de evaluación de regresión
  • Ejercicio de muestra de regresión lineal
  • Aprendizaje de la teoría de la regresión logística
  • Implementación de un código de regresión logística
  • Ejercicio de muestra de regresión logística

Comprensión de los bosques aleatorios y los árboles de decisión

  • Aprendizaje de la teoría de los métodos de árboles
  • Implementación de códigos para árboles de decisión y bosques aleatorios
  • Ejercicio de muestra de clasificación con bosques aleatorios

Trabajo con el agrupamiento K-means

  • Comprensión de la teoría del agrupamiento K-means
  • Implementación de un código de agrupamiento K-means
  • Ejercicio de muestra de agrupamiento

Trabajo con sistemas de recomendación

Implementación del Procesamiento del Lenguaje Natural

  • Comprensión del Procesamiento del Lenguaje Natural (NLP)
  • Resumen de las herramientas de NLP
  • Ejercicio de muestra de NLP

Streaming con Spark en Python

  • Resumen del Streaming con Spark
  • Ejercicio de muestra de Streaming con Spark

Requerimientos

  • Habilidades generales de programación.

Público objetivo

  • Desarrolladores.
  • Profesionales de TI.
  • Científicos de datos.
 21 Horas

Número de participantes


Precio por participante

Reseñas (6)

Próximos cursos

Categorías Relacionadas