Rol de nivel senior centrado en la arquitectura de inferencia de IA a escala para clientes en EMEA. Enfocado en optimización de rendimiento y coste de pipelines de inferencia.
- Guiar la estrategia de inferencia para un portafolio de clientes en EMEA desde concepto hasta despliegue en producción
- Identificar retos de inferencia (latencia, eficiencia, coste por token, memoria, red de baja latencia) en implementaciones de clientes
- Diseñar y optimizar pipelines de inferencia de alto rendimiento usando Nvidia Dynamo, TensorRT-LLM, VLLM, SG Lang y otros backends, para mejorar utilización de GPUs y eficiencia del clúster