Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a los modelos multimodales Mistral
- Visión general de Mistral Medium y capacidades multimodales.
- Modelos OCR/documento y casos de uso.
- Integración con ecosistemas de código abierto.
Pipelines de OCR y visión
- Fundamentos de OCR con modelos Mistral.
- Preprocesamiento de imágenes y documentos escaneados.
- Extracción de texto estructurado a partir de imágenes.
Comprensión documental
- Diseño de pipelines de PLN para documentos.
- Reconocimiento de entidades, resumen y clasificación.
- Conexión multimodal entre datos de texto y visión.
Búsqueda y aplicaciones de conocimiento
- Sistemas de búsqueda visual-textual.
- Desarrollo de búsqueda semántica con salidas de OCR.
- Repositorios documentales empresariales.
Aplicaciones asistivas e interactivas
- Diseño de interfaces para asistentes multimodales.
- Aplicaciones de accesibilidad (por ejemplo, conversión de visión a texto).
- Herramientas de productividad del mundo real.
Rendimiento y optimización
- Escalado de pipelines multimodales.
- Ajuste del rendimiento de inferencia.
- Evaluación de los intercambios entre precisión y eficiencia.
Casos de estudio y perspectivas futuras
- Aplicaciones industriales de IA multimodal.
- Tendencias de investigación en OCR e IA documental.
- Consideraciones de IA responsable en tareas de visión-texto.
Resumen y próximos pasos
Requerimientos
- Comprensión de los conceptos de procesamiento de lenguaje natural (PLN).
- Experiencia con Python y frameworks de ML.
- Familiaridad con los fundamentos de visión por computador.
Público objetivo
- Equipos de producto.
- Investigadores de ML.
- Ingenieros aplicados de ML.
14 Horas