Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a EXO y agrupamiento local de IA
- Visión general del framework EXO y el ecosistema exo-explore
- Comparación entre inferencia centralizada en la nube e inferencia local distribuida
- Arquitectura: descubrimiento de dispositivos libp2p, backend MLX, tablero de control y capas de API
- Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, almacenamiento compartido
Instalación de EXO en macOS
- Configuración de Xcode, Metal ToolChain y prerequisitos de macOS
- Instalación de uv, Node.js y toolchain Rust nightly
- Instalación de la bifurcación específica (fork) de macmon para monitoreo en Apple Silicon
- Clonar el repositorio y construir el tablero con npm
- Ejecutar EXO desde código fuente y verificar el tablero en localhost:52415
Instalación de EXO en Linux
- Instalación de dependencias mediante apt o Homebrew en Linux
- Configuración de uv, Node.js 18+ y Rust nightly
- Construcción del tablero y ejecución de EXO en modo solo CPU
- Estructura de directorios: rutas XDG Base Directory para configuración, datos, caché y logs
Descubrimiento automático de dispositivos y formación del clúster
- Comprensión del descubrimiento automático basado en libp2p a través de redes locales
- Configuración de namespaces personalizados con EXO_LIBP2P_NAMESPACE para aislamiento del clúster
- Verificación de la membresía de nodos en la vista de clúster del tablero
- Gestión de fallos de descubrimiento y problemas de segmentación de red
Habilitación de RDMA sobre Thunderbolt 5
- Arquitectura de RDMA y la afirmación de reducción del 99% en latencia
- Habilitación de RDMA en modo Recovery de macOS con rdma_ctl
- Requisitos de cables y restricciones de topología de puertos en Mac Studio
- Sincronización de versiones de macOS en todos los nodos del clúster
- Solución de problemas de descubrimiento RDMA y configuración DHCP
Despliegue de modelos avanzados
- Uso del tablero para cargar y particionar (shard) modelos DeepSeek v3.1, Qwen3-235B y familia Llama
- Vista previa de la ubicación de instancias con el endpoint de API /instance/previews
- Creación de instancias de modelo con particionamiento por pipeline o paralelismo tensorial
- Configuración de tarjetas (cards) de modelo personalizadas desde el hub de HuggingFace
Monitoreo y solución de problemas
- Lectura de logs de EXO y comprensión del rastro distribuido (distributed tracing)
- Interpretación de la salud del clúster en la vista de clúster del tablero
- Diagnóstico de fallos de nodos trabajadores y comportamiento de reconexión
- Uso de EXO_TRACING_ENABLED para análisis de cuellos de botella de rendimiento
Mantenimiento y actualizaciones del clúster
- Actualización de binarios de EXO y procedimientos de reconstrucción del tablero
- Migración de cachés de modelos y gestión de modelos previamente descargados sobre NFS
- Eliminación ordenada de nodos y reequilibrio de cargas de trabajo
Requerimientos
- Comprensión de los fundamentos de redes (IP, subnetting, firewalls)
- Experiencia con administración de línea de comandos en macOS o Linux
- Conocimiento de gestión de paquetes Python (pip/uv) y herramientas Node.js
Audiencia
- Administradores de sistemas
- Ingenieros de DevOps
- Arquitectos de infraestructura IA responsables del despliegue de LLMs on-premise
21 Horas