Integración de Big Data con Talend
Talend Open Studio para Big Data es una herramienta ETL de código abierto diseñada para procesar grandes volúmenes de datos. Incluye un entorno de desarrollo que permite interactuar con orígenes y destinos de Big Data, además de ejecutar procesos sin necesidad de escribir código.
Esta formación en vivo impartida por un instructor (en línea o presencial) está dirigida a personas técnicas que deseen desplegar Talend Open Studio para Big Data con el fin de simplificar el proceso de lectura y análisis de grandes cantidades de datos.
Al finalizar esta capacitación, los participantes podrán:
- Instalar y configurar Talend Open Studio para Big Data.
- Conectarse con sistemas de Big Data como Cloudera, HortonWorks, MapR, Amazon EMR y Apache.
- Comprender y configurar los componentes y conectores de Big Data de Open Studio.
- Configurar parámetros para generar automáticamente código MapReduce.
- Utilizar la interfaz de arrastrar y soltar de Open Studio para ejecutar trabajos en Hadoop.
- Desarrollar prototipos de tuberías (pipelines) de Big Data.
- Automatizar proyectos de integración de Big Data.
Formato del curso
- Lecciones interactivas y sesiones de discusión.
- Numerosos ejercicios y práctica continua.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, póngase en contacto con nosotros para coordinarla.
Temario del curso
Introducción
Descripción general de las características y arquitectura de "Open Studio para Big Data"
Configuración inicial de Open Studio para Big Data
Navegación por la interfaz de usuario (UI)
Comprensión de los componentes y conectores de Big Data
Conexión a un clúster de Hadoop
Lectura y escritura de datos
Procesamiento de datos con Hive y MapReduce
Análisis de los resultados
Mejora de la calidad de los datos masivos (Big Data)
Construcción de una tubería (pipeline) de Big Data
Gestión de usuarios, grupos, roles y proyectos
Despliegue de Open Studio en entornos de producción
Monitoreo de Open Studio
Solución de problemas (troubleshooting)
Resumen y conclusiones
Requerimientos
- Conocimientos sobre bases de datos relacionales.
- Conocimientos sobre almacenes de datos (data warehousing).
- Comprensión de los conceptos ETL (Extract, Transform, Load o Extracción, Transformación y Carga).
Público objetivo
- Profesionales de la inteligencia empresarial (BI).
- Profesionales de bases de datos.
- Desarrolladores SQL.
- Desarrolladores ETL.
- Arquitectos de soluciones.
- Arquitectos de datos.
- Profesionales del almacenamiento de datos (data warehousing).
- Administradores e integradores de sistemas.
Los cursos públicos requieren más de 5 participantes.
Integración de Big Data con Talend - Reserva
Integración de Big Data con Talend - Consulta
Integración de Big Data con Talend - Solicitud de consultoría
Testimonios (1)
Ejercicios prácticos. La clase debería haber durado 5 días, pero los 3 días fueron útiles para aclarar muchas de las preguntas que tenía al trabajar con NiFi.
James - BHG Financial
Curso - Apache NiFi for Administrators
Traducción Automática
Próximos cursos
Cursos Relacionados
Apache Iceberg Avanzado
21 HorasEsta formación en vivo con instructores en <ubicación> (en línea o presencial) está dirigida a profesionales de datos de nivel avanzado que desean optimizar los flujos de trabajo de procesamiento de datos, garantizar la integridad de los datos e implementar soluciones robustas de lakehouse que puedan manejar las complejidades de las aplicaciones modernas de big data.
Al finalizar esta formación, los participantes podrán:
- Comprender en profundidad la arquitectura de Iceberg, incluida la gestión de metadatos y el diseño de archivos.
- Configurar Iceberg para obtener un rendimiento óptimo en diversos entornos e integrarlo con múltiples motores de procesamiento de datos.
- Gestionar tablas Iceberg a gran escala, realizar cambios complejos de esquema y manejar la evolución de las particiones.
- Dominar técnicas para optimizar el rendimiento de las consultas y la eficiencia de la escaneo de datos en conjuntos de datos grandes.
- Implementar mecanismos para garantizar la consistencia de los datos, gestionar garantías transaccionales y manejar fallos en entornos distribuidos.
Fundamentos de Apache Iceberg
14 HorasEsta formación en vivo impartida por un instructor en Chile (en línea o presencial) está dirigida a profesionales de los datos de nivel principiante que desean adquirir los conocimientos y habilidades necesarios para utilizar eficazmente Apache Iceberg en la gestión de conjuntos de datos a gran escala, garantizar la integridad de los datos y optimizar los flujos de trabajo de procesamiento.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender a fondo la arquitectura, las características y los beneficios de Apache Iceberg.
- Conocer los formatos de tabla, la partición, la evolución del esquema y las capacidades de viaje en el tiempo (time travel).
- Instalar y configurar Apache Iceberg en diferentes entornos.
- Crear, gestionar y manipular tablas Iceberg.
- Comprender el proceso de migración de datos desde otros formatos de tabla hacia Iceberg.
Análisis de Big Data con Google Colab y Apache Spark
14 HorasEsta capacitación en vivo con instructor en <ubicación> (en línea o presencial) está dirigida a científicos e ingenieros de datos de nivel intermedio que desean utilizar Google Colab y Apache Spark para el procesamiento y análisis de big data.
Al finalizar esta capacitación, los participantes serán capaces de:
- Configurar un entorno de big data utilizando Google Colab y Spark.
- Procesar y analizar conjuntos grandes de datos eficientemente con Apache Spark.
- Visualizar big data en un entorno colaborativo.
- Integrar Apache Spark con herramientas basadas en la nube.
Apache NiFi para administradores
21 HorasApache NiFi es una plataforma de integración de datos basada en flujos y procesamiento de eventos, de código abierto. Permite el enrutamiento automático y en tiempo real de datos, su transformación y la mediación entre sistemas dispares, con una interfaz web (UI) y un control fino.
Esta formación en vivo con instructor presencial o remoto está dirigida a administradores e ingenieros de nivel intermedio que deseen desplegar, gestionar, asegurar y optimizar flujos de datos de NiFi en entornos de producción.
Al finalizar esta formación, los participantes serán capaces de:
- Instalar, configurar y mantener clústeres de Apache NiFi.
- Diseñar y gestionar flujos de datos desde diversas fuentes y destinos.
- Implementar lógica de automatización, enrutamiento y transformación de flujos.
- Optimizar el rendimiento, supervisar las operaciones y solucionar problemas.
Formato del curso
- Conferencia interactiva con discusión de arquitecturas del mundo real.
- Prácticas prácticas: creación, despliegue y gestión de flujos.
- Ejercicios basados en escenarios en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinarlo.
PySpark y Aprendizaje Automático
21 HorasEsta formación ofrece una introducción práctica para construir flujos de trabajo escalables de procesamiento de datos y Aprendizaje Automático utilizando PySpark. Los participantes aprenderán cómo opera Apache Spark dentro de los ecosistemas modernos de Big Data y cómo procesar eficientemente conjuntos de datos grandes aplicando principios de computación distribuida.
Fundamentos de Apache Spark
21 HorasEsta formación en vivo impartida por un instructor en Chile (en línea o presencial) está dirigida a ingenieros que desean configurar e implementar un sistema Apache Spark para procesar grandes volúmenes de datos.
Al finalizar esta formación, los participantes serán capaces de:
- Instalar y configurar Apache Spark.
- Procesar y analizar conjuntos de datos muy grandes con rapidez.
- Comprender las diferencias entre Apache Spark y Hadoop MapReduce, así como cuándo utilizar cada uno.
- Integrar Apache Spark con otras herramientas de aprendizaje automático.
Administración de Apache Spark
35 HorasEsta formación en vivo con instructor en <ubicación> (en línea o presencial) está dirigida a administradores de sistemas de nivel principiante a intermedio que deseen implementar, mantener y optimizar clústeres de Spark.
Al finalizar esta formación, los participantes podrán:
- Instalar y configurar Apache Spark en diversos entornos.
- Gestionar los recursos del clúster y monitorizar las aplicaciones de Spark.
- Optimizar el rendimiento de los clústeres de Spark.
- Implementar medidas de seguridad y garantizar alta disponibilidad.
- Depurar y solucionar problemas comunes de Spark.
Apache Spark en la Nube
21 HorasLa curva de aprendizaje de Apache Spark es inicialmente empinada; se requiere un esfuerzo considerable para obtener los primeros beneficios. Este curso tiene como objetivo facilitar el superamiento de esa fase inicial difícil. Al finalizar, los participantes comprenderán los fundamentos de Apache Spark, sabrán diferenciar claramente entre RDD y DataFrame, aprenderán a utilizar las API de Python y Scala, entenderán los conceptos de executores y tareas, entre otros. Además, siguiendo las mejores prácticas, este curso se centra fuertemente en el despliegue en la nube, Databricks y AWS. Los estudiantes también comprenderán las diferencias entre AWS EMR y AWS Glue, uno de los servicios más recientes de Spark ofrecidos por AWS.
PÚBLICO OBJETIVO:
Ingenieros de Datos, DevOps, Científicos de Datos
Python y Spark para Big Data (PySpark)
21 HorasEn esta capacitación en vivo y guiada por un instructor en Chile, los participantes aprenderán cómo utilizar Python y Spark en conjunto para analizar big data mientras realizan ejercicios prácticos.
Al finalizar esta formación, los participantes serán capaces de:
- Aprender a usar Spark con Python para analizar Big Data.
- Desarrollar ejercicios que imitan casos del mundo real.
- Utilizar diversas herramientas y técnicas para el análisis de big data mediante PySpark.
Python, Spark y Hadoop para Big Data
21 HorasEsta formación en vivo impartida por instructores en Chile (en línea o presencial) está dirigida a desarrolladores que desean utilizar e integrar Spark, Hadoop y Python para procesar, analizar y transformar conjuntos de datos grandes y complejos.
Al finalizar esta formación, los participantes podrán:
- Configurar el entorno necesario para comenzar a procesar big data con Spark, Hadoop y Python.
- Comprender las características, componentes principales y arquitectura de Spark y Hadoop.
- Aprender cómo integrar Spark, Hadoop y Python para el procesamiento de grandes datos.
- Explorar las herramientas del ecosistema de Spark (Spark MLlib, Spark Streaming, Kafka, Sqoop, Kafka y Flume).
- Construir sistemas de recomendación mediante filtrado colaborativo, similares a los utilizados por Netflix, YouTube, Amazon, Spotify y Google.
- Utilizar Apache Mahout para escalar algoritmos de aprendizaje automático.
Stratio: Módulos Rocket e Intelligence con PySpark
14 HorasStratio es una plataforma centrada en los datos que integra big data, IA y gobernanza en una única solución. Sus módulos Rocket e Intelligence permiten la exploración rápida de datos, transformación y análisis avanzado en entornos empresariales.
Esta formación presencial impartida por un instructor (en línea o in situ) está dirigida a profesionales de datos con nivel intermedio que deseen utilizar eficazmente los módulos Rocket e Intelligence de Stratio con PySpark, centrándose en estructuras de bucle, funciones definidas por el usuario y lógica avanzada de datos.
Al finalizar esta formación, los participantes serán capaces de:
- Navegar y trabajar dentro de la plataforma Stratio utilizando los módulos Rocket e Intelligence.
- Aplicar PySpark en el contexto de ingestión de datos, transformación y análisis.
- Utilizar bucles y lógica condicional para controlar flujos de datos y tareas de ingeniería de características.
- Crear y gestionar funciones definidas por el usuario (UDF) para operaciones de datos reutilizables en PySpark.
Formato del curso
- Ponencia interactiva y discusión.
- Muchas ejercicios y práctica.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinarlo.
Talend Administration Center (TAC)
14 HorasEsta formación en vivo con instructores en Chile (en línea o presencial) está dirigida a administradores de sistemas, científicos de datos y analistas de negocios que deseen configurar Talend Administration Center para desplegar y gestionar los roles y tareas de la organización.
Al finalizar esta capacitación, los participantes podrán:
- Instalar y configurar Talend Administration Center.
- Comprender e implementar los fundamentos de la gestión de Talend.
- Construir, desplegar y ejecutar proyectos empresariales o tareas en Talend.
- Monitorear la seguridad de los conjuntos de datos y desarrollar rutinas empresariales basadas en el marco de TAC.
- Obtener una comprensión más amplia de las aplicaciones de big data.
Talend Data Stewardship
14 HorasEsta capacitación en vivo impartida por un instructor en Chile (en línea o presencial) está dirigida a analistas de datos de nivel principiante e intermedio que desean profundizar su comprensión y habilidades en la gestión y mejora de la calidad de los datos utilizando Talend Data Stewardship.
Al finalizar esta capacitación, los participantes podrán:
- Obtener una comprensión integral del papel de la administración de datos para mantener la calidad de los datos.
- Utilizar Talend Data Stewardship para gestionar tareas de calidad de datos.
- Crear, asignar y gestionar tareas dentro de Talend Data Stewardship, incluida la personalización del flujo de trabajo.
- Utilizar las capacidades de informes y monitoreo de la herramienta para seguir los esfuerzos de calidad de datos y administración.
Talend Open Studio para ESB
21 HorasEn este taller práctico con instrucción directa en Chile, los participantes aprenderán a utilizar Talend Open Studio para ESB con el fin de crear, conectar, mediar y gestionar servicios así como sus interacciones.
Al finalizar esta formación, los participantes podrán
- Integrar, mejorar y desplegar tecnologías ESB como paquetes únicos en diversos entornos de despliegue.
- Comprender y utilizar los componentes más frecuentes de Talend Open Studio.
- Integrar cualquier aplicación, base de datos, API o servicios web.
- Integrar sin problemas sistemas heterogéneos y aplicaciones.
- Incrustar bibliotecas de código Java existentes para ampliar los proyectos.
- Aprovechar componentes y código comunitarios para extender los proyectos.
- Integrar rápidamente sistemas, aplicaciones y fuentes de datos en un entorno Eclipse basado en arrastrar y soltar.
- Reducir el tiempo de desarrollo y los costes de mantenimiento mediante la generación de código optimizado y reutilizable.