Diseñar, implementar y mantener clústeres HPC/AI a gran escala con monitoreo, registro y alertas.
- Diseñar, implementar y mantener clústeres HPC/AI a gran escala con monitoreo, registro y alertas.
- Gestionar colas de trabajos y herramientas de orquestación como Slurm y Kubernetes.
- Desarrollar herramientas para automatizar despliegue, operación y auto-servicio de recursos de infraestructura a gran escala.