Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión dura 2 horas
Día 1: Sesión 1: Panorama Empresarial de Por Qué la Inteligencia de Negocios con Big Data en el Gobierno
- Casos de estudio de NIH, DoE
- Tasa de adaptación de Big Data en Agencias Gubernamentales y cómo están alineando sus operaciones futuras en torno al Análisis Predictivo de Big Data
- Áreas de aplicación a gran escala en DoD, NSA, IRS, USDA, etc.
- Interfaz de Big Data con datos legados
- Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
- Integración de datos y visualización de cuadros de mandos (Dashboards)
- Gestión de fraude
- Generación de reglas empresariales/ detección de fraude
- Detección de amenazas y perfilado
- Análisis costo-beneficio para la implementación de Big Data
Día 1: Sesión 2: Introducción a Big Data-1
- Características principales de Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
- Almacenes de datos (Data Warehouses) – esquema estático, conjunto de datos que evoluciona lentamente
- Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (procesamiento), recuperación desde HDFS
- Lote (Batch): adecuado para análisis/no interactivo
- Volumen: flujos de datos CEP
- Opciones típicas – productos CEP (por ejemplo, Infostreams, Apama, MarkLogic, etc.)
- Menos listos para producción – Storm/S4
- Bases de datos NoSQL – (columnares y clave-valor): más adecuadas como complemento analítico al almacén de datos/base de datos
Día 1: Sesión 3: Introducción a Big Data-2
Soluciones NoSQL
- Almacén KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB
- Almacén KV (Jerárquico) - GT.m, Cache
- Almacén KV (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracotta
- Almacén de tuplas - Gigaspaces, Coord, Apache River
- Base de datos de objetos - ZopeDB, DB40, Shoal
- Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Preserve, Riak-Basho, Scalaris
- Almacén columnar ancho (Wide Columnar) - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de Datos: Introducción al problema de limpieza de datos en Big Data
- RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
- NoSQL – semiestructurado, con suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento
- Problemas de limpieza de datos
Día 1: Sesión 4: Introducción a Big Data-3 : Hadoop
- Cuándo seleccionar Hadoop?
- Datos ESTRUCTURADOS - Los almacenes/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no bueno para exploración activa)
- Datos SEMIESTRUCTURADOS – difíciles de manejar con soluciones tradicionales (DW/DB)
- Almacenamiento de datos = ESFUERZO ENORME y estático incluso después de la implementación
- Para variedad y volumen de datos, procesados en hardware comercial – HADOOP
- Hardware comercial necesario para crear un clúster de Hadoop
Introducción a MapReduce /HDFS
- MapReduce – distribución del procesamiento entre múltiples servidores
- HDFS – hace los datos disponibles localmente para el proceso de cómputo (con redundancia)
- Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
- Responsabilidad del desarrollador dar sentido a los datos
- Programación MapReduce = trabajar con Java (pros/contras), carga manual de datos en HDFS
Día 2: Sesión 1: Ecosistema Big Data - Construyendo ETL para Big Data: universo de herramientas de Big Data - cuál usar y cuándo?
- Hadoop vs. Otras soluciones NoSQL
- Para acceso interactivo y aleatorio a los datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a los datos pero con restricciones impuestas (máx 1 PB)
- No bueno para análisis ad-hoc, bueno para registro (logging), conteo, series temporales
- Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume – Flujo de datos (por ejemplo, datos de registro) a HDFS
Día 2: Sesión 2: Sistema de Gestión de Big Data
- Componentes móviles, nodos de cómputo inician/fallan: ZooKeeper - Para servicios de configuración/coordinación/naming (nombrado)
- Pipeline/workflow complejo: Oozie – gestionar workflow, dependencias, cadena Daisy
- Despliegue, configuración, gestión de clústeres, actualización, etc. (admin sys): Ambari
- En la Nube : Whirr
Día 2: Sesión 3: Análisis predictivo en Inteligencia de Negocios -1: Técnicas Fundamentales y BI basado en aprendizaje automático:
- Introducción al aprendizaje automático
- Aprendizaje de técnicas de clasificación
- Predicción Bayesiana: preparación del archivo de entrenamiento
- Máquinas de Vector de Soporte (SVM)
- KNN p-Tree Algebra y minería vertical
- Red Neuronal
- Problema de grandes variables en Big Data - Bosque Aleatorio (RF)
- Problema de automatización en Big Data – RF de conjunto multmodelo
- Automatización a través de Soft10-M
- Herramienta de análisis de texto - Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a herramientas de código abierto para análisis predictivo: R, Rapidminer, Mahout
Día 2: Sesión 4 Ecosistema de análisis predictivo-2: Problemas comunes de análisis predictivo en el gobierno
- Análisis de insights (perspicacias)
- Análisis visualización
- Análisis predictivo estructurado
- Análisis predictivo no estructurado
- Perfilado de amenazas/fraudster/proveedores
- Motor de recomendación
- Detección de patrones
- Promoción de reglas/escenarios –falla, fraude, optimización
- Detección de la causa raíz
- Análisis de sentimiento
- Analítica CRM
- Analítica de redes
- Analítica de texto
- Revisión asistida por tecnología
- Analítica de fraude
- Analítica en Tiempo Real
Día 3: Sesión 1 : Análisis en Tiempo Real y Escalable sobre Hadoop
- Por qué los algoritmos de análisis comunes fallan en Hadoop/HDFS
- Apache Hama - para cómputo distribuido sincrónico por bloques (Bulk Synchronous)
- Apache SPARK - para cómputo en clúster para análisis en tiempo real
- CMU Graphics Lab2- Enfoque asíncrono basado en gráficos para cómputo distribuido
- Enfoque basado en álgebra KNN p de Treeminer para reducción del costo operativo de hardware
Día 3: Sesión 2: Herramientas para eDiscovery y Forense Digital
- eDiscovery sobre Big Data vs. datos legados – una comparación de costo y rendimiento
- Codificación predictiva y revisión asistida por tecnología (TAR)
- Demo en vivo de un producto TAR (vMiner) para comprender cómo funciona TAR para un descubrimiento más rápido
- Indexación más rápida a través de HDFS – velocidad de datos
- PAN o Procesamiento del Lenguaje Natural – varias técnicas y productos de código abierto
- eDiscovery en idiomas extranjeros: tecnología para procesamiento de idiomas extranjeros
Día 3: Sesión 3: Inteligencia de Negocios con Big Data para Ciberseguridad – Comprender la visión completa de 360 grados desde la rápida recopilación de datos hasta la identificación de amenazas
- Comprensión de los fundamentos del análisis de seguridad: superficie de ataque, mala configuración de seguridad, defensas de host
- Infraestructura de red/ gran canal de datos (datapipe) / Respuesta ETL para análisis en tiempo real
- Predictivo vs prescriptivo – reglas fijas basadas en reglas vs descubrimiento automático de reglas de amenaza a partir de metadatos
Día 3: Sesión 4: Big Data en USDA : Aplicación en Agricultura
- Introducción al IoT (Internet de las Cosas) para la agricultura: Big Data basado en sensores y control
- Introducción a la imagen satelital y su aplicación en la agricultura
- Integración de datos de sensores e imágenes para fertilidad del suelo, recomendaciones de cultivo y pronóstico
- Seguro agrícola y Big Data
- Pronóstico de pérdida de cultivos
Día 4: Sesión 1: Prevención de Fraude con BI de Big Data en el Gobierno-Análisis de fraude:
- Clasificación básica del análisis de fraude: basado en reglas vs análisis predictivo
- Aprendizaje supervisado vs no supervisado para la detección de patrones de fraude
- Fraude de proveedores/sobreprecio por proyectos
- Fraude en Medicare y Medicaid: técnicas de detección de fraude para el procesamiento de reclamaciones
- Fraudes de reembolso de viajes
- Fraudes de reembolso del IRS
- Se proporcionarán casos de estudio y demos en vivo siempre que haya datos disponibles.
Día 4: Sesión 2: Analítica de Redes Sociales - Recopilación e análisis de inteligencia
- API ETL de Big Data para extraer datos de redes sociales
- Texto, imagen, metadatos y video
- Análisis de sentimiento a partir del feed de redes sociales
- Filtrado contextual y no contextual del feed de redes sociales
- Dashboard (Cuadro de Mando) de Redes Sociales para integrar diversas redes sociales
- Perfilado automatizado de perfiles de redes sociales
- Se dará una demo en vivo de cada análisis a través de la herramienta Treeminer.
Día 4: Sesión 3: Análisis de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data: solución de almacenamiento para datos que exceden petabytes
- LTFS y LTO
- GPFS-LTFS (solución de almacenamiento en capas para datos de imagen grandes)
- Fundamentos del análisis de imágenes
- Reconocimiento de objetos
- Segmentación de imágenes
- Seguimiento de movimiento
- Reconstrucción de imágenes 3-D
Día 4: Sesión 4: Aplicaciones de Big Data en NIH:
- Áreas emergentes de la bioinformática
- Metagenómica y problemas de minería de Big Data
- Análisis predictivo de Big Data para farmacogenómica, metabolómica y proteómica
- Big Data en el proceso genómico posterior (downstream)
- Aplicación del análisis predictivo de Big Data en salud pública
Dashboard de Big Data para acceso rápido y visualización de datos diversos :
- Integración de la plataforma de aplicación existente con el Dashboard de Big Data
- Gestión de Big Data
- Caso de Estudio del Dashboard de Big Data: Tableau y Pentaho
- Uso de aplicaciones de Big Data para impulsar servicios basados en ubicación en el gobierno
- Sistema de seguimiento y gestión
Día 5: Sesión 1: Cómo justificar la implementación de BI con Big Data dentro de una organización:
- Definición del ROI para la implementación de Big Data
- Casos de estudio para el ahorro de tiempo del analista en la recopilación y preparación de datos – aumento en la ganancia de productividad
- Casos de estudio de ganancias por ahorro del costo de la base de datos licenciada
- Ganancia de ingresos de servicios basados en ubicación
- Ahorro de la prevención de fraude
- Enfoque de hoja de cálculo integrada para calcular el gasto aprox. vs. ganancia/ahorro de ingresos de la implementación de Big Data.
Día 5: Sesión 2: Procedimiento paso a paso para reemplazar sistemas de datos legados por sistemas de Big Data:
- Comprensión del mapa de ruta práctico de migración de Big Data
- ¿Qué información importante se necesita antes de diseñar una implementación de Big Data?
- ¿Cuáles son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos?
- Cómo estimar el crecimiento de datos
- Casos de estudio
Día 5: Sesión 4: Revisión de proveedores de Big Data y revisión de sus productos. Sesión de preguntas y respuestas:
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (parte de EMC)
Requerimientos
- Conocimiento básico del funcionamiento empresarial y los sistemas de datos gubernamentales en su dominio
- Comprensión básica de SQL/Oracle o base de datos relacional
- Comprensión básica de Estadística (a nivel de hojas de cálculo)
35 Horas
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática