Rol técnico centrado en construir y mantener la infraestructura de cómputo para IA en un entorno de producción, con énfasis en rendimiento, confiabilidad y escalabilidad.
- Diseñar y mantener clústeres GPU y de aceleradores para entrenamiento, inferencia y evaluación de modelos de IA.
- Diseñar y mejorar pipelines de inferencia, orquestación y balance de carga para cumplir requisitos de latencia y rendimiento.
- Implementar observabilidad, monitorización de utilización y costos, y gestionar incidentes para garantizar disponibilidad.