Temario del curso
1. Introducción al Aprendizaje Profundo por Refuerzo
- ¿Qué es el Aprendizaje por Refuerzo?
- Diferencias entre Aprendizaje Supervisado, No Supervisado y por Refuerzo.
- Aplicaciones de DRL en 2025 (robótica, salud, finanzas, logística).
- Comprensión del bucle de interacción agente-entorno.
2. Fundamentos del Aprendizaje por Refuerzo
- Procesos de Decisión de Markov (MDP).
- Estado, Acción, Recompensa, Política y funciones de Valor.
- Compromiso entre Exploración y Explotación.
- Métodos Monte Carlo y aprendizaje Temporal-Difference (TD).
3. Implementación de Algoritmos Básicos de RL
- Métodos tabulares: Programación Dinámica, Evaluación de Política e Iteración.
- Q-Learning y SARSA.
- Exploración Epsilon-greedy y estrategias de decaimiento.
- Implementación de entornos de RL con OpenAI Gymnasium.
4. Transición al Aprendizaje Profundo por Refuerzo
- Limitaciones de los métodos tabulares.
- Uso de redes neuronales para aproximación de funciones.
- Arquitectura y flujo de trabajo de Deep Q-Network (DQN).
- Reproductor de experiencia (experience replay) y redes objetivo.
5. Algoritmos Avanzados de DRL
- Double DQN, Dueling DQN y Prioritized Experience Replay.
- Métodos de Policy Gradient: algoritmo REINFORCE.
- Arquitecturas Actor-Critic (A2C, A3C).
- Proximal Policy Optimization (PPO).
- Soft Actor-Critic (SAC).
6. Trabajo con Espacios de Acción Continuos
- Desafíos en el control continuo.
- Uso de DDPG (Deep Deterministic Policy Gradient).
- Twin Delayed DDPG (TD3).
7. Herramientas y Marcos de Trabajo Prácticos
- Uso de Stable-Baselines3 y Ray RLlib.
- Registro y monitoreo con TensorBoard.
- Ajuste de hiperparámetros para modelos DRL.
8. Ingeniería de Recompensas y Diseño de Entornos
- Formulación de recompensas (reward shaping) y balanceo de penalizaciones.
- Conceptos de transferencia de aprendizaje sim-to-real.
- Creación de entornos personalizados en Gymnasium.
9. Entornos Parcialmente Observables y Generalización
- Manejo de información de estado incompleta (POMDPs).
- Enfoques basados en memoria usando LSTMs y RNNs.
- Mejora de la robustez y generalización de los agentes.
10. Teoría de Juegos y Aprendizaje por Refuerzo Multi-Agente
- Introducción a entornos multi-agente.
- Cooperación vs. Competencia.
- Aplicaciones en entrenamiento adversarial y optimización de estrategias.
11. Estudios de Caso y Aplicaciones del Mundo Real
- Simulaciones de conducción autónoma.
- Fijación de precios dinámica y estrategias de trading financiero.
- Robótica y automatización industrial.
12. Solución de Problemas y Optimización
- Diagnóstico de entrenamientos inestables.
- Gestión de la escasez de recompensas y sobreajuste (overfitting).
- Escalamiento de modelos DRL en GPUs y sistemas distribuidos.
13. Resumen y Próximos Pasos
- Repaso de la arquitectura de DRL y los algoritmos clave.
- Tendencias de la industria y direcciones de investigación (p. ej., RLHF, modelos híbridos).
- Recursos adicionales y materiales de lectura.
Requerimientos
- Dominio de la programación en Python.
- Conocimiento de Cálculo y Álgebra Lineal.
- Conocimientos básicos de Probabilidad y Estadística.
- Experiencia construyendo modelos de aprendizaje automático usando Python y NumPy o TensorFlow/PyTorch.
Audiencia
- Desarrolladores interesados en IA y sistemas inteligentes.
- Científicos de datos explorando marcos de aprendizaje por refuerzo.
- Ingenieros de Machine Learning que trabajan con sistemas autónomos.
Reseñas (2)
Fomentar la repetición en la construcción de indicaciones (prompts) entre quienes nunca han utilizado la IA, y animar a los usuarios experimentados a considerar métodos alternativos para su uso.
Matthew Gay - Tarsus Pharmaceuticals
Curso - Artificial Intelligence (AI) Overview
Traducción Automática
Trabajando desde principios fundamentales de manera enfocada y pasando a aplicar estudios de caso en el mismo día
Maggie Webb - Department of Jobs, Regions, and Precincts
Curso - Artificial Neural Networks, Machine Learning, Deep Thinking
Traducción Automática