Contacta con nosotros

Temario del curso

Introducción a EXO y agrupamiento local de IA

  • Visión general del framework EXO y el ecosistema exo-explore
  • Comparación entre inferencia centralizada en la nube e inferencia local distribuida
  • Arquitectura: descubrimiento de dispositivos libp2p, backend MLX, tablero de control y capas de API
  • Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, almacenamiento compartido

Instalación de EXO en macOS

  • Configuración de Xcode, Metal ToolChain y prerequisitos de macOS
  • Instalación de uv, Node.js y toolchain Rust nightly
  • Instalación de la bifurcación específica (fork) de macmon para monitoreo en Apple Silicon
  • Clonar el repositorio y construir el tablero con npm
  • Ejecutar EXO desde código fuente y verificar el tablero en localhost:52415

Instalación de EXO en Linux

  • Instalación de dependencias mediante apt o Homebrew en Linux
  • Configuración de uv, Node.js 18+ y Rust nightly
  • Construcción del tablero y ejecución de EXO en modo solo CPU
  • Estructura de directorios: rutas XDG Base Directory para configuración, datos, caché y logs

Descubrimiento automático de dispositivos y formación del clúster

  • Comprensión del descubrimiento automático basado en libp2p a través de redes locales
  • Configuración de namespaces personalizados con EXO_LIBP2P_NAMESPACE para aislamiento del clúster
  • Verificación de la membresía de nodos en la vista de clúster del tablero
  • Gestión de fallos de descubrimiento y problemas de segmentación de red

Habilitación de RDMA sobre Thunderbolt 5

  • Arquitectura de RDMA y la afirmación de reducción del 99% en latencia
  • Habilitación de RDMA en modo Recovery de macOS con rdma_ctl
  • Requisitos de cables y restricciones de topología de puertos en Mac Studio
  • Sincronización de versiones de macOS en todos los nodos del clúster
  • Solución de problemas de descubrimiento RDMA y configuración DHCP

Despliegue de modelos avanzados

  • Uso del tablero para cargar y particionar (shard) modelos DeepSeek v3.1, Qwen3-235B y familia Llama
  • Vista previa de la ubicación de instancias con el endpoint de API /instance/previews
  • Creación de instancias de modelo con particionamiento por pipeline o paralelismo tensorial
  • Configuración de tarjetas (cards) de modelo personalizadas desde el hub de HuggingFace

Monitoreo y solución de problemas

  • Lectura de logs de EXO y comprensión del rastro distribuido (distributed tracing)
  • Interpretación de la salud del clúster en la vista de clúster del tablero
  • Diagnóstico de fallos de nodos trabajadores y comportamiento de reconexión
  • Uso de EXO_TRACING_ENABLED para análisis de cuellos de botella de rendimiento

Mantenimiento y actualizaciones del clúster

  • Actualización de binarios de EXO y procedimientos de reconstrucción del tablero
  • Migración de cachés de modelos y gestión de modelos previamente descargados sobre NFS
  • Eliminación ordenada de nodos y reequilibrio de cargas de trabajo

Requerimientos

  • Comprensión de los fundamentos de redes (IP, subnetting, firewalls)
  • Experiencia con administración de línea de comandos en macOS o Linux
  • Conocimiento de gestión de paquetes Python (pip/uv) y herramientas Node.js

Audiencia

  • Administradores de sistemas
  • Ingenieros de DevOps
  • Arquitectos de infraestructura IA responsables del despliegue de LLMs on-premise
 21 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas