Senior ML Engineer: Inference & Latency Optimization

Company: Nebius Group
Apply for the Senior ML Engineer: Inference & Latency Optimization
Location: London
Job Description:

Nebius is seeking a Senior Machine Learning Engineer to own model and endpoint optimization from artifacts to production deployment on our Applied AI team. You will improve latency, throughput, memory efficiency, GPU utilization, and cost per token while maintaining model quality.

This hands-on role involves diagnosing complex serving problems, evaluating configurations, and delivering measurable production improvements in collaboration with kernel and platform engineers.

#J-18808-Ljbffr…

Posted: September 27th, 2026