Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
El panorama de la observabilidad con IA
- De los paneles a las conversaciones: el cambio hacia una observabilidad aumentada por IA.
- Capacidades de LLM relevantes para la observabilidad: resumen, razonamiento, coincidencia de patrones.
- Patrones de arquitectura: integración de IA en pilas de observabilidad existentes.
Consulta de telemetría por lenguaje natural
- Text-to-PromQL: traducción de lenguaje natural a consultas de monitoreo.
- Consultas en lenguaje natural para almacenes de logs de Elasticsearch, OpenSearch y Loki.
- Generación de SQL a partir de lenguaje natural para telemetría estructurada.
- Construcción de un agente asistente de consultas con uso de herramientas y conciencia del contexto.
Análisis de logs impulsado por LLM
- Parseo y estructuración automática de logs con LLM.
- Detección de anomalías en flujos de logs mediante similitud de embebidos.
- Agrupamiento de logs y descubrimiento de patrones a gran escala.
- Generación de explicaciones legibles para humanos a partir de secuencias de logs crudas.
Alertas inteligentes y enriquecimiento de incidentes
- Correlación y deduplicación de alertas con comprensión semántica.
- Recolección automática del contexto del incidente a partir de runbooks, incidentes previos y documentación.
- Ruteo inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo.
- Reducción del cansancio por alertas con reducción de ruido impulsada por IA.
Análisis de causa raíz asistido por IA
- Generación de hipótesis a partir de la correlación de telemetría multi-fuente.
- Cadenado de evidencias: conexión de síntomas entre métricas, logs y trazas.
- Troubleshooting guiado con sesiones interactivas de diagnóstico por IA.
- Construcción de un agente de análisis de causa raíz con investigación progresiva.
Respuesta automatizada a incidentes y comunicación
- Generación de resúmenes de incidentes y actualizaciones de estado a partir de telemetría.
- Borrado automático de post-mortem con reconstrucción de la línea de tiempo.
- Comunicación con partes interesadas adaptada a audiencias técnicas y ejecutivas.
- Sugerencia de runbooks y recomendaciones automatizadas de remediación.
Machine Learning para observabilidad
- Pronóstico de series temporales para planificación de capacidad y predicción de anomalías.
- Modelos fundamentales para detección de anomalías sin entrenamiento previo (zero-shot) en métricas.
- Mapeo de dependencias de servicios y descubrimiento de topología basado en embebidos.
- Entrenamiento y despliegue de modelos ML ligeros junto a los pipelines de observabilidad.
Despliegue en producción y ética
- Consideraciones de latencia y costo para la observabilidad en tiempo real con IA.
- Privacidad de datos: asegurar que los LLM no filtren telemetría sensible.
- Supervisión humana: cuándo el diagnóstico de la IA requiere validación por parte del operador.
- Medición del impacto: MTTD, MTTR y métricas de la experiencia de guardia (on-call).
Requerimientos
- Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog o OpenTelemetry.
- Familiaridad con conceptos de gestión de logs y métricas.
- Conocimientos básicos de programación en Python para procesamiento de datos.
Público objetivo
- Ingenieros SRE y de observabilidad que adoptan herramientas mejoradas con IA.
- Ingenieros de plataforma que construyen pipelines de monitoreo de próxima generación.
- Líderes de DevOps que evalúan la integración de LLM en flujos de trabajo de incidentes.
14 Horas