Contacta con nosotros

Temario del curso

Introducción

Comprensión del Big Data

Visión general de Spark

Visión general de Python

Visión general de PySpark

  • Distribución de datos utilizando el marco de trabajo Resilient Distributed Datasets
  • Distribución de computación mediante operadores de la API de Spark

Configuración de Python con Spark

Configuración de PySpark

Uso de instancias EC2 de Amazon Web Services (AWS) para Spark

Configuración de Databricks

Configuración del clúster AWS EMR

Aprendiendo los fundamentos de la programación en Python

  • Iniciándose con Python
  • Uso del cuaderno Jupyter
  • Uso de variables y tipos de datos simples
  • Trabajo con listas
  • Uso de sentencias if
  • Gestión de entradas de usuario
  • Trabajo con bucles while
  • Implementación de funciones
  • Trabajo con clases
  • Trabajo con archivos y excepciones
  • Trabajo con proyectos, datos y API

Aprendiendo los fundamentos de Spark DataFrame

  • Iniciándose con DataFrames de Spark
  • Implementación de operaciones básicas con Spark
  • Uso de operaciones de agrupamiento (groupby) y agregación
  • Trabajo con marcas temporales y fechas

Ejercicio práctico con un proyecto de Spark DataFrame

Comprensión del aprendizaje automático con MLlib

Trabajo con MLlib, Spark y Python para aprendizaje automático

Comprensión de las regresiones

  • Aprendiendo la teoría de la regresión lineal
  • Implementación de código de evaluación de regresión
  • Ejercicio práctico de muestra sobre regresión lineal
  • Aprendiendo la teoría de la regresión logística
  • Implementación de código de regresión logística
  • Ejercicio práctico de muestra sobre regresión logística

Comprensión de bosques aleatorios y árboles de decisión

  • Aprendiendo la teoría de métodos de árbol
  • Implementación de códigos para árboles de decisión y bosques aleatorios
  • Ejercicio práctico de muestra sobre clasificación con bosques aleatorios

Trabajo con agrupamiento K-means

  • Comprensión de la teoría del agrupamiento K-means
  • Implementación de código para agrupamiento K-means
  • Ejercicio práctico de muestra sobre clustering

Trabajo con sistemas de recomendación

Implementación de procesamiento de lenguaje natural

  • Comprensión del Procesamiento de Lenguaje Natural (PLN)
  • Visión general de herramientas de PLN
  • Ejercicio práctico de muestra sobre PLN

Streaming con Spark en Python

  • Visión general del streaming con Spark
  • Ejercicio práctico de muestra de streaming con Spark

Comentarios finales

Requerimientos

  • Habilidades generales de programación

Público objetivo

  • Desarrolladores
  • Profesionales de TI
  • Científicos de Datos
 21 Horas

Número de participantes


Precio por participante

Testimonios (6)

Próximos cursos

Categorías Relacionadas