Contacta con nosotros

Temario del curso

Infraestructura como código para EXO

  • Descripción general de patrones de implementación de EXO: nodos individuales, multinode y clústeres RDMA.
  • Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) mediante gestión de configuraciones.
  • Uso de flakes de Nix para la construcción reproducible de EXO y entornos de desarrollo.
  • Redacción de playbooks de Ansible o scripts de shell para el aprovisionamiento no supervisado del clúster.

Compilaciones reproducibles e integración con CI

  • Fijación de dependencias y compilación del panel de control en pipelines de CI.
  • Ejecución de pruebas básicas de EXO en ejecutores de GitHub Actions o GitLab CI.
  • Creación de imágenes base y flujos de reversión basados en instantáneas para máquinas virtuales de macOS y Linux.
  • Versionado de tarjetas de modelos personalizados junto con el código de la aplicación.

Descubrimiento del clúster y automatización de red

  • Configuración de mDNS y DNS estático para un descubrimiento fiable de nodos libp2p.
  • Automatización de la creación de perfiles de red y gestión de puentes Thunderbolt en macOS.
  • Uso de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción.
  • Reglas de firewall y segmentación de red para entornos multitenant.

Gestión del ciclo de vida de almacenamiento y modelos

  • Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS.
  • Montaje de comparticiones NFS o SAN como repositorios de modelos de solo lectura para un aprovisionamiento rápido.
  • Recolección de elementos obsoletos (garbage collection) de cachés inactivas y políticas de retención de pesos versionados.
  • Automatización de la descarga previa de modelos y verificaciones de salud antes de actualizaciones en cadena.

Monitoreo y alertas

  • Envío de registros de EXO a un sistema de registro centralizado (ELK, Loki o Splunk).
  • Construcción de paneles de control de Grafana a partir de la salida de EXO_TRACING_ENABLED.
  • Alertas ante cambios en la membresía del clúster, eventos de OOM y picos de latencia de inferencia.
  • Correlación de telemetría de hardware macmon con regresiones en el rendimiento de los modelos.

Actualización, reversión y recuperación ante desastres

  • Pruebas de actualizaciones de binarios de EXO en un nodo canario antes del despliegue generalizado.
  • Reversión a nivel de modelo: cambio entre versiones cuantizadas sin necesidad de re-descargar.
  • Copia de seguridad y restauración del estado del clúster, espacios de nombres personalizados y pesos en caché.
  • Documentación de libros de procedimientos para la recuperación en escenarios de reconstrucción total del clúster.

Endurecimiento de seguridad y cumplimiento

  • Aplicación de TLS en la capa de proxy inverso (nginx, traefik) para el panel de control y la API.
  • Implementación de limitación de tasa de API y listas blancas de IP para los extremos de EXO.
  • Aislamiento de clústeres mediante VLANs y políticas de red de confianza cero (zero-trust).
  • Auditoría de accesos y mantenimiento de un inventario de modelos desplegados y sus versiones.

Requerimientos

  • Experiencia con prácticas de DevOps (CI/CD, IaC, orquestación de contenedores).
  • Familiaridad con la administración del sistema y gestión de paquetes en macOS o Linux.
  • Comprensión de conceptos de red, DNS y almacenamiento.

Público objetivo

  • Ingenieros de DevOps.
  • Arquitectos de infraestructura.
  • SREs responsables de cargas de trabajo de IA on-premise.
 21 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas