Rol técnico para liderar la dirección de inferencia de IA a gran escala, optimizar pipelines y mejorar rendimiento y fiabilidad de la pila de inferencia.
- Guiar a clientes de EMEA en la implementación y optimización de cargas de inferencia a gran escala en clústeres multi-GPU.
- Diseñar pipelines de inferencia eficientes para modelos densos y moe distribuidos entre miles de GPUs.
- Colaborar con equipos de producto (Dynamo, TensorRT-LLM, NixL) para acelerar el éxito del cliente.