Contacta con nosotros
Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.

Temario del curso

1. Introducción al Aprendizaje por Refuerzo Profundo

  • ¿Qué es el Aprendizaje por Refuerzo?
  • Diferencias entre Aprendizaje Supervisado, No supervisado y por Refuerzo
  • Aplicaciones del DRL en 2025 (robótica, atención médica, finanzas, logística)
  • Comprensión del ciclo de interacción entre agente y entorno

2. Fundamentos del Aprendizaje por Refuerzo

  • Procesos de Decisión de Markov (MDP)
  • Funciones de estado, acción, recompensa, política y valor
  • Compromiso entre exploración y explotación
  • Métodos Monte Carlo y aprendizaje por diferencia temporal (TD)

3. Implementación de algoritmos básicos de RL

  • Métodos tabulares: Programación dinámica, evaluación y iteración de políticas
  • Q-Learning y SARSA
  • Exploración epsilon-greedy y estrategias de decrecimiento
  • Implementación de entornos RL con OpenAI Gymnasium

4. Transición al Aprendizaje por Refuerzo Profundo

  • Limitaciones de los métodos tabulares
  • Uso de redes neuronales para aproximación de funciones
  • Arquitectura y flujo de trabajo de la Red Neuronal Q Profunda (DQN)
  • Rejilla de experiencias y redes objetivo

5. Algoritmos avanzados de DRL

  • Double DQN, Dueling DQN y Rejilla de Experiencias Priorizada
  • Métodos de Gradiente de Política: algoritmo REINFORCE
  • Arquitecturas Actor-Crítico (A2C, A3C)
  • Optimización por Política Proxima (PPO)
  • Actor-Crítico Suave (SAC)

6. Trabajo con espacios de acción continuos

  • Desafíos en el control continuo
  • Uso de DDPG (Gradiente de Política Determinista Profunda)
  • DDPG Gemelo Retrasado (TD3)

7. Herramientas y marcos de trabajo prácticos

  • Uso de Stable-Baselines3 y Ray RLlib
  • Registro y monitoreo con TensorBoard
  • Ajuste de hiperparámetros para modelos DRL

8. Ingeniería de recompensas y diseño del entorno

  • Moldeado de recompensas y balanceo de penalizaciones
  • Conceptos de aprendizaje por transferencia de simulación a la realidad
  • Creación de entornos personalizados en Gymnasium

9. Entornos parcialmente observables y generalización

  • Manejo de información incompleta del estado (POMDP)
  • Enfoques basados en memoria utilizando LSTMs y RNNs
  • Mejora de la robustez y generalización del agente

10. Teoría de juegos y Aprendizaje por Refuerzo Multiagente

  • Introducción a entornos multiagente
  • Cooperación vs. competencia
  • Aplicaciones en entrenamiento adversarial y optimización de estrategias

11. Estudios de caso y aplicaciones del mundo real

  • Simulaciones de conducción autónoma
  • Precios dinámicos y estrategias de trading financiero
  • Robótica y automatización industrial

12. Diagnóstico y optimización

  • Diagnóstico de entrenamiento inestable
  • Gestión de la escasez de recompensas y sobreajuste
  • Escalado de modelos DRL en GPUs y sistemas distribuidos

13. Resumen y próximos pasos

  • Recapitulación de la arquitectura DRL y algoritmos clave
  • Tendencias industriales y direcciones de investigación (por ejemplo, RLHF, modelos híbridos)
  • Recursos adicionales y material de lectura

Requerimientos

  • Proficiencia en programación con Python
  • Comprensión de Cálculo y Álgebra Lineal
  • Conocimientos básicos de Probabilidad y Estadística
  • Experiencia construyendo modelos de aprendizaje automático utilizando Python y NumPy o TensorFlow/PyTorch

Público objetivo

  • Desarrolladores interesados en IA y sistemas inteligentes
  • Científicos de datos que exploran marcos de trabajo de aprendizaje por refuerzo
  • Ingenieros de Aprendizaje Automático trabajando con sistemas autónomos
 21 Horas

Número de participantes


Precio por participante

Reseñas (3)

Próximos cursos

Categorías Relacionadas

Morty Proxy This is a proxified and sanitized view of the page, visit original site.