Ponte en Contacto
 Duración 21 horas

Temario del curso

1. Introducción al Aprendizaje Profundo por Refuerzo

  • ¿Qué es el Aprendizaje por Refuerzo?
  • Diferencias entre Aprendizaje Supervisado, No Supervisado y por Refuerzo.
  • Aplicaciones de DRL en 2025 (robótica, salud, finanzas, logística).
  • Comprensión del bucle de interacción agente-entorno.

2. Fundamentos del Aprendizaje por Refuerzo

  • Procesos de Decisión de Markov (MDP).
  • Estado, Acción, Recompensa, Política y funciones de Valor.
  • Compromiso entre Exploración y Explotación.
  • Métodos Monte Carlo y aprendizaje Temporal-Difference (TD).

3. Implementación de Algoritmos Básicos de RL

  • Métodos tabulares: Programación Dinámica, Evaluación de Política e Iteración.
  • Q-Learning y SARSA.
  • Exploración Epsilon-greedy y estrategias de decaimiento.
  • Implementación de entornos de RL con OpenAI Gymnasium.

4. Transición al Aprendizaje Profundo por Refuerzo

  • Limitaciones de los métodos tabulares.
  • Uso de redes neuronales para aproximación de funciones.
  • Arquitectura y flujo de trabajo de Deep Q-Network (DQN).
  • Reproductor de experiencia (experience replay) y redes objetivo.

5. Algoritmos Avanzados de DRL

  • Double DQN, Dueling DQN y Prioritized Experience Replay.
  • Métodos de Policy Gradient: algoritmo REINFORCE.
  • Arquitecturas Actor-Critic (A2C, A3C).
  • Proximal Policy Optimization (PPO).
  • Soft Actor-Critic (SAC).

6. Trabajo con Espacios de Acción Continuos

  • Desafíos en el control continuo.
  • Uso de DDPG (Deep Deterministic Policy Gradient).
  • Twin Delayed DDPG (TD3).

7. Herramientas y Marcos de Trabajo Prácticos

  • Uso de Stable-Baselines3 y Ray RLlib.
  • Registro y monitoreo con TensorBoard.
  • Ajuste de hiperparámetros para modelos DRL.

8. Ingeniería de Recompensas y Diseño de Entornos

  • Formulación de recompensas (reward shaping) y balanceo de penalizaciones.
  • Conceptos de transferencia de aprendizaje sim-to-real.
  • Creación de entornos personalizados en Gymnasium.

9. Entornos Parcialmente Observables y Generalización

  • Manejo de información de estado incompleta (POMDPs).
  • Enfoques basados en memoria usando LSTMs y RNNs.
  • Mejora de la robustez y generalización de los agentes.

10. Teoría de Juegos y Aprendizaje por Refuerzo Multi-Agente

  • Introducción a entornos multi-agente.
  • Cooperación vs. Competencia.
  • Aplicaciones en entrenamiento adversarial y optimización de estrategias.

11. Estudios de Caso y Aplicaciones del Mundo Real

  • Simulaciones de conducción autónoma.
  • Fijación de precios dinámica y estrategias de trading financiero.
  • Robótica y automatización industrial.

12. Solución de Problemas y Optimización

  • Diagnóstico de entrenamientos inestables.
  • Gestión de la escasez de recompensas y sobreajuste (overfitting).
  • Escalamiento de modelos DRL en GPUs y sistemas distribuidos.

13. Resumen y Próximos Pasos

  • Repaso de la arquitectura de DRL y los algoritmos clave.
  • Tendencias de la industria y direcciones de investigación (p. ej., RLHF, modelos híbridos).
  • Recursos adicionales y materiales de lectura.

Requerimientos

  • Dominio de la programación en Python.
  • Conocimiento de Cálculo y Álgebra Lineal.
  • Conocimientos básicos de Probabilidad y Estadística.
  • Experiencia construyendo modelos de aprendizaje automático usando Python y NumPy o TensorFlow/PyTorch.

Audiencia

  • Desarrolladores interesados en IA y sistemas inteligentes.
  • Científicos de datos explorando marcos de aprendizaje por refuerzo.
  • Ingenieros de Machine Learning que trabajan con sistemas autónomos.

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas