Afinamiento con Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF)
El Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF, por sus siglas en inglés) es un método de vanguardia utilizado para el afinamiento de modelos como ChatGPT y otros sistemas de inteligencia artificial de alto nivel.
Esta formación en vivo con instructor (en línea o presencial) está dirigida a ingenieros de aprendizaje automático e investigadores de IA de nivel avanzado que deseen aplicar RLHF para afinar grandes modelos de IA, logrando un rendimiento superior, mayor seguridad y una mejor alineación.
Al finalizar esta formación, los participantes podrán:
- Comprender los fundamentos teóricos del RLHF y entender por qué es esencial en el desarrollo moderno de IA.
- Implementar modelos de recompensa basados en retroalimentación humana para guiar los procesos de aprendizaje por refuerzo.
- Afinar grandes modelos de lenguaje utilizando técnicas de RLHF para alinear las salidas con las preferencias humanas.
- Aplicar las mejores prácticas para escalar flujos de trabajo de RLHF en sistemas de IA listos para producción.
Formato del curso
- Clase magistral interactiva y discusión.
- Muchos ejercicios y práctica.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, por favor contáctenos para organizarlo.
Temario del curso
Introducción al Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF)
- ¿Qué es el RLHF y por qué importa?
- Comparación con métodos de afinamiento supervisado.
- Aplicaciones del RLHF en sistemas de IA modernos.
Modelado de recompensas con retroalimentación humana
- Recopilación y estructuración de la retroalimentación humana.
- Construcción y entrenamiento de modelos de recompensa.
- Evaluación de la eficacia de los modelos de recompensa.
Entrenamiento con Optimización de Política Cercana (PPO)
- Visión general de los algoritmos PPO para RLHF.
- Implementación de PPO con modelos de recompensa.
- Afinamiento iterativo y seguro de modelos.
Afinamiento práctico de modelos de lenguaje
- Preparación de conjuntos de datos para flujos de trabajo de RLHF.
- Afinamiento práctico de un LLM pequeño utilizando RLHF.
- Desafíos y estrategias de mitigación.
Escalado del RLHF a sistemas de producción
- Consideraciones de infraestructura y potencia de cálculo.
- Aseguramiento de calidad y bucles de retroalimentación continua.
- Mejores prácticas para el despliegue y mantenimiento.
Consideraciones éticas y mitigación del sesgo
- Abordaje de riesgos éticos en la retroalimentación humana.
- Estrategias de detección y corrección de sesgos.
- Aseguramiento de alineación y salidas seguras.
Casos de estudio y ejemplos del mundo real
- Caso de estudio: Afinamiento de ChatGPT con RLHF.
- Otras implementaciones exitosas de RLHF.
- Lecciones aprendidas e información del sector.
Resumen y próximos pasos
Requerimientos
- Comprensión de los fundamentos del aprendizaje supervisado y el aprendizaje por refuerzo.
- Experiencia con afinamiento de modelos y arquitecturas de redes neuronales.
- Familiaridad con la programación en Python y marcos de aprendizaje profundo (por ejemplo, TensorFlow, PyTorch).
Audiencia
- Ingenieros de aprendizaje automático.
- Investigadores de IA.
Los cursos públicos requieren más de 5 participantes.
Afinamiento con Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF) - Reserva
Afinamiento con Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF) - Consulta
Afinamiento con Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF) - Solicitud de consultoría
Próximos cursos
Cursos Relacionados
Ajuste Fino Avanzado y Gestión de Prompts en Vertex AI
14 HorasVertex AI ofrece herramientas avanzadas para el ajuste fino de modelos grandes y la gestión de prompts, lo que permite a los desarrolladores y equipos de datos optimizar la precisión de los modelos, agilizar los flujos de trabajo iterativos y garantizar un rigor evaluativo mediante bibliotecas y servicios integrados.
Esta capacitación en vivo, impartida por un instructor (en línea o presencial), está dirigida a profesionales de nivel intermedio a avanzado que deseen mejorar el rendimiento y la confiabilidad de las aplicaciones de IA generativa utilizando el ajuste fino supervisado, el versionamiento de prompts y los servicios de evaluación en Vertex AI.
Al finalizar esta capacitación, los participantes podrán:
- Aplicar técnicas de ajuste fino supervisado a los modelos Gemini en Vertex AI.
- Implementar flujos de trabajo de gestión de prompts, incluidos el versionamiento y las pruebas.
- Utilizar bibliotecas de evaluación para realizar análisis comparativos y optimizar el rendimiento de la IA.
- Desplegar y monitorear modelos mejorados en entornos de producción.
Formato del Curso
- Clase interactiva y discusión.
- Talleres prácticos con herramientas de ajuste fino y prompts de Vertex AI.
- Estudios de caso sobre la optimización de modelos empresariales.
Opciones de Personalización del Curso
- Para solicitar una capacitación personalizada para este curso, contáctenos para coordinarlo.
Técnicas Avanzadas en Transferencia de Aprendizaje
14 HorasEsta formación en vivo con instructor en Chile (en línea o presencial) está dirigida a profesionales avanzados de aprendizaje automático que desean dominar técnicas de vanguardia de transferencia de aprendizaje y aplicarlas a problemas complejos del mundo real.
Al finalizar esta formación, los participantes podrán:
- Comprender conceptos y metodologías avanzadas en transferencia de aprendizaje.
- Implementar técnicas de adaptación específica del dominio para modelos preentrenados.
- Aplicar el aprendizaje continuo para gestionar tareas y conjuntos de datos en evolución.
- Dominar el ajuste fino multitaereo para mejorar el rendimiento del modelo a través de diversas tareas.
Estrategias de Aprendizaje Continuo y Actualización de Modelos para Modelos Ajustados
14 HorasEsta capacitación en vivo impartida por un instructor en Chile (en línea o presencial) está dirigida a ingenieros de mantenimiento de IA y profesionales de MLOps de nivel avanzado que deseen implementar tuberías robustas de aprendizaje continuo y estrategias de actualización efectivas para modelos desplegados y ajustados.
Al finalizar esta capacitación, los participantes podrán:
- Diseñar e implementar flujos de trabajo de aprendizaje continuo para modelos desplegados.
- Mitigar el olvido catastrófico mediante una gestión adecuada del entrenamiento y la memoria.
- Automatizar el monitoreo y los activadores de actualización basados en la deriva del modelo o cambios en los datos.
- Integrar estrategias de actualización de modelos en las tuberías de CI/CD y MLOps existentes.
Despliegue de Modelos Ajustados en Entornos de Producción
21 HorasEsta formación impartida por un instructor en Chile (en línea o presencial) está dirigida a profesionales de nivel avanzado que deseen desplegar modelos ajustados de manera confiable y eficiente.
Al finalizar esta capacitación, los participantes serán capaces de:
- Comprender los desafíos asociados al despliegue de modelos ajustados en producción.
- Contenerizar y desplegar modelos utilizando herramientas como Docker y Kubernetes.
- Implementar sistemas de monitoreo y registro (logging) para los modelos desplegables.
- Optimizar los modelos frente a la latencia y la escalabilidad en escenarios del mundo real.
Ajuste Fino Específico del Dominio para Finanzas
21 HorasEsta formación en vivo y guiada por un instructor en Chile (en línea o presencial) está dirigida a profesionales de nivel intermedio que desean adquirir habilidades prácticas para personalizar modelos de IA destinados a tareas financieras críticas.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender los fundamentos del ajuste fino para aplicaciones financieras.
- Aprovechar modelos preentrenados para tareas específicas del dominio en finanzas.
- Aplicar técnicas para la detección de fraude, evaluación de riesgos y generación de consejos financieros.
- Garantizar el cumplimiento con regulaciones financieras como GDPR y SOX.
- Implementar prácticas de seguridad de datos e IA ética en aplicaciones financieras.
Ajuste fino de modelos y Modelos de Lenguaje Grande (LLM)
14 HorasEsta formación en vivo impartida por un instructor en Chile (en línea o presencial) está dirigida a profesionales de nivel intermedio a avanzado que deseen personalizar modelos preentrenados para tareas y conjuntos de datos específicos.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender los principios del ajuste fino y sus aplicaciones.
- Preparar conjuntos de datos para el ajuste fino de modelos preentrenados.
- Ajustar finamente Modelos de Lenguaje Grande (LLM) para tareas de PNL.
- Optimizar el rendimiento del modelo y abordar desafíos comunes.
Fine-tuning eficiente con Adaptación de Bajo Rango (LoRA)
14 HorasEsta formación en vivo dirigida por un instructor en Chile (en línea o presencial) está dirigida a desarrolladores y profesionales de IA de nivel intermedio que deseen implementar estrategias de fine-tuning para modelos grandes sin necesidad de recursos computacionales extensivos.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender los principios de la Adaptación de Bajo Rango (LoRA).
- Implementar LoRA para un fine-tuning eficiente de modelos grandes.
- Optimizar el fine-tuning en entornos con recursos limitados.
- Evaluar e implementar modelos ajustados con LoRA para aplicaciones prácticas.
Afinamiento de Modelos Multimodales
28 HorasEste entrenamiento en vivo impartido por un instructor en Chile (en línea o presencial) está dirigido a profesionales de nivel avanzado que desean dominar el afinamiento de modelos multimodales para desarrollar soluciones innovadoras de IA.
Al finalizar este entrenamiento, los participantes serán capaces de:
- Comprender la arquitectura de modelos multimodales como CLIP y Flamingo.
- Preparar y preprocesar eficazmente conjuntos de datos multimodales.
- Afinar modelos multimodales para tareas específicas.
- Optimizar los modelos para aplicaciones reales y mejorar su rendimiento.
Ajuste fino para Procesamiento del Lenguaje Natural (NLP)
21 HorasEsta formación en vivo con instructor en Chile (en línea o presencial) está dirigida a profesionales de nivel intermedio que deseen mejorar sus proyectos de PLN mediante el ajuste fino efectivo de modelos lingüísticos preentrenados.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender los fundamentos del ajuste fino para tareas de PLN.
- Realizar el ajuste fino de modelos preentrenados como GPT, BERT y T5 para aplicaciones específicas de PLN.
- Optimizar los hiperparámetros para mejorar el rendimiento del modelo.
- Evaluar e implementar modelos ajustados en escenarios del mundo real.
Ajuste fino de IA para Servicios Financieros: Predicción de Riesgos y Detección de Fraude
14 HorasEsta formación en vivo impartida por un instructor en <ubicación> (en línea o presencial) está dirigida a científicos de datos e ingenieros de IA de nivel avanzado del sector financiero que desean ajustar modelos para aplicaciones como la puntuación de crédito, la detección de fraude y la modelización de riesgos utilizando datos financieros específicos del dominio.
Al final de esta formación, los participantes serán capaces de:
- Ajustar modelos de IA en conjuntos de datos financieros para mejorar la predicción de fraudes y riesgos.
- Aplicar técnicas como el aprendizaje por transferencia, LoRA y regularización para mejorar la eficiencia del modelo.
- Integrar consideraciones de cumplimiento financiero en el flujo de trabajo de modelización de IA.
- Desplegar modelos ajustados para su uso en producción en plataformas de servicios financieros.
Ajuste Fino de IA para la Atención Médica: Diagnóstico Clínico y Análisis Predictivo
14 HorasEsta formación en vivo con instructor en Chile (en línea o presencial) está dirigida a desarrolladores de IA médica y científicos de datos de nivel intermedio a avanzado que deseen realizar ajustes finos en modelos para diagnóstico clínico, predicción de enfermedades y pronóstico de resultados en pacientes, utilizando datos médicos estructurados y no estructurados.
Al finalizar esta formación, los participantes podrán:
- Realizar ajustes finos en modelos de IA con conjuntos de datos de atención médica, que incluyen Registros Electrónicos de Salud (EMR), imágenes médicas y datos de series temporales.
- Aplicar aprendizaje por transferencia, adaptación de dominio y compresión de modelos en contextos médicos.
- Abordar la privacidad, los sesgos y el cumplimiento normativo en el desarrollo de modelos.
- Implementar y monitorear modelos ajustados en entornos reales de atención médica.
Ajuste fino de DeepSeek LLM para modelos de IA personalizados
21 HorasEsta formación impartida por un instructor, disponible Chile (en línea o presencial), está dirigida a investigadores de IA avanzados, ingenieros de aprendizaje automático y desarrolladores que deseen realizar ajuste fino a modelos DeepSeek LLM para crear aplicaciones de IA especializadas adaptadas a industrias, dominios específicos o necesidades comerciales particulares.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender la arquitectura y las capacidades de los modelos DeepSeek, incluyendo DeepSeek-R1 y DeepSeek-V3.
- Preparar conjuntos de datos y preprocesar la información para el ajuste fino.
- Realizar ajuste fino a DeepSeek LLM para aplicaciones específicas del dominio.
- Optimizar e implementar los modelos ajustados de manera eficiente.
Afinamiento de modelos de IA de defensa para sistemas autónomos y vigilancia
14 HorasEsta formación en vivo impartida por un instructor en Chile (en línea o presencial) está dirigida a ingenieros avanzados de IA para defensa y desarrolladores de tecnología militar que deseen afinar modelos de aprendizaje profundo para su uso en vehículos autónomos, drones y sistemas de vigilancia, cumpliendo con estrictos estándares de seguridad y confiabilidad.
Al finalizar esta formación, los participantes podrán:
- Afinar modelos de visión por computador y fusión de sensores para tareas de vigilancia y puntería.
- Adaptar sistemas autónomos de IA a entornos cambiantes y perfiles de misión.
- Implementar mecanismos robustos de validación y seguridad (fail-safe) en los flujos de trabajo de los modelos.
- Garantizar el cumplimiento de los estándares específicos de defensa en materia de conformidad, seguridad y protección.
Afinamiento de Modelos de IA Legal: Revisión Contractual e Investigación Jurídica
14 HorasEsta formación en vivo con instructores en Chile (en línea o presencial) está dirigida a ingenieros de tecnología jurídica y desarrolladores de IA de nivel intermedio que desean afinar modelos de lenguaje para tareas como el análisis de contratos, la extracción de cláusulas y la investigación jurídica automatizada en entornos de servicios legales.
Al final de esta formación, los participantes podrán:
- Preparar y limpiar documentos legales para el afinamiento de modelos NLP.
- Aplicar estrategias de afinamiento para mejorar la precisión del modelo en tareas legales.
- Desplegar modelos que asistan en la revisión, clasificación e investigación de contratos.
- Garantizar el cumplimiento, la auditabilidad y la trazabilidad de los resultados de IA en contextos legales.
Ajuste fino de modelos de lenguaje grandes utilizando QLoRA
14 HorasEsta capacitación en vivo con instructor en Chile (en línea o presencial) está dirigida a ingenieros de aprendizaje automático, desarrolladores de IA y científicos de datos de nivel intermedio a avanzado que desean aprender a utilizar QLoRA para ajustar eficientemente modelos grandes para tareas específicas y personalizaciones.
Al finalizar esta capacitación, los participantes serán capaces de:
- Comprender la teoría detrás de QLoRA y las técnicas de cuantificación para LLM.
- Implementar QLoRA en el ajuste fino de modelos de lenguaje grandes para aplicaciones específicas del dominio.
- Optimizar el rendimiento del ajuste fino con recursos computacionales limitados mediante cuantificación.
- Desplegar y evaluar los modelos ajustados de manera eficiente en aplicaciones del mundo real.