Desarrollar y mantener plataformas de observabilidad basadas en Prometheus y Grafana, con especial énfasis en tecnologías GPU y entornos cloud-native. Asegurar el alineamiento entre métricas, capacidad de infraestructuras y metas de negocio.
- Monitorear y analizar el uso de GPUs en clusters mediante dashboards de Prometheus y Grafana.
- Diseñar y evolucionar plataformas de observabilidad y monitorización, definiendo estrategias de escalado y fiabilidad.
- Definir modelos de capacidad e infraestructuras y elaborar informes para dirección con métricas de demanda, inversión y tendencias.