Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas
Temario del curso
Fundamentos de Producción con Tencent Hunyuan
- Visión general de los escenarios de servicio de modelos Tencent Hunyuan.
- Características de producción de modelos grandes y MoE.
- Cuellos de botela comunes en latencia, capacidad de procesamiento (throughput) y costos.
- Definición de objetivos de nivel de servicio (SLO) para cargas de trabajo de inferencia.
Arquitectura de Despliegue y Flujo de Servicio
- Componentes principales de una pila de inferencia en producción.
- Elegir entre modelos de despliegue con contenedores, on-premise y en la nube.
- Fundamentos de carga de modelo, enrutamiento de solicitudes y asignación de GPU.
- Diseño para confiabilidad y simplicidad operativa.
Optimización de Latencia en la Práctica
- Uso de motores de inferencia optimizados como TensorRT cuando corresponda.
- Conceptos de KV-cache y ajuste práctico del caché.
- Reducción de la sobrecarga de inicio, calentamiento (warmup) y respuesta.
- Medición del tiempo hasta el primer token y velocidad de generación de tokens.
Capacidad de Procesamiento (Throughput), Agrupamiento y Eficiencia de la GPU
- Estrategias de agrupamiento continuo y agrupamiento por solicitudes.
- Gestión de concurrencia y comportamiento de colas.
- Mejora de la utilización de la GPU sin perjudicar la experiencia del usuario.
- Gestión de solicitudes de contexto largo y cargas de trabajo mixtas.
Cuantización y Control de Costos
- Por qué la cuantización es importante para el servicio en producción.
- Compensaciones prácticas entre FP16, INT8 y otras opciones de precisión comunes.
- Equilibrio entre calidad del modelo, latencia y costo de infraestructura.
- Construcción de una lista de verificación simple para optimización de costos.
Operaciones, Monitoreo y Revisión de Preparación
- Disparadores de escalado automático para servicios de inferencia.
- Monitoreo de latencia, capacidad de procesamiento (throughput), uso del caché y salud de la GPU.
- Fundamentos de registro de eventos (logging), alertas y respuesta a incidentes.
- Revisión de una implementación de referencia y creación de un plan de mejora.
Requerimientos
- Comprensión básica de despliegue de modelos de lenguaje grande (LLM) y flujos de trabajo de inferencia.
- Experiencia con contenedores, infraestructura en la nube o on-premise, y servicios basados en API.
- Conocimiento operativo de Python o tareas de ingeniería de sistemas.
Público Objetivo
- Ingenieros de ML que despliegan LLMs en producción.
- Ingenieros de plataforma responsables de servicios de inferencia basados en GPU.
- Arquitectos de soluciones diseñando plataformas de servicio de IA escalables.