Investigador de IA centrado en aprendizaje por refuerzo multimodal para optimizar la toma de decisiones entre modalidades (texto, imágenes y audio). Desarrollar modelos y técnicas para lograr mayor rendimiento y robustez en entornos reales.
- Diseñar y construir infraestructuras de RL para entrenamiento distribuido y escalable en sistemas multimodales.
- Desarrollar estrategias de modelado de recompensas que mejoren la estabilidad del entrenamiento y reduzcan el hacking de recompensas.
- Crear y curar entornos de simulación y conjuntos de datos multimodales para evaluación y benchmarking.