Jobs / engineering
Senior Machine Learning Engineer – LLMs
Prosus · Amsterdam
What you will do
Analyze model performance and training data, formulate hypotheses, design and execute rigorous experiments to systematically improve model quality, training and inference efficiency, and downstream task performance
Drive technical decision-making for model architecture, training strategies, and infrastructure choices
Provide technical leadership and mentorship to ML engineers and interns, conducting code reviews, sharing best practices, and accelerating team growth
Train large language models through continued pre-training and full parameter fine-tuning on proprietary datasets
Build and optimize distributed training infrastructure across multi-node GPU clusters using frameworks like DeepSpeed, FSDP, Megatron-LM, or Axolotl
Own large-scale data preparation: filtering, quality assessment, deduplication, and data mixture strategies for training corpora at 100B+ token scale
Generate and curate high-quality synthetic data for instruction fine-tuning and capability enhancement
Debug training stability issues, optimize training and inference throughput (quantization, distillation, serving optimization), and monitor model performance throughout long-running distributed jobs
Build robust evaluation frameworks and establish metrics to measure model quality and guide decisions
Write production-grade, well-tested code and set engineering standards for the team
What they look for
7+ years of ML engineering experience
Technical leadership experience: mentoring engineers, conducting code reviews, making architecture decisions, and delivering projects with measurable business impact
Proven experience training and deploying language models to production (embedding models, encoder models, or large language models) including pre-training, continued pre-training, or fine-tuning with rigorous evaluation and inference optimization
Experience preparing large-scale training datasets: data filtering, quality assessment, deduplication strategies, and data mixture design
Hands-on experience with distributed training frameworks (DeepSpeed, FSDP, Megatron-LM, or Axolotl) including orchestrating multi-node jobs, debugging failures, and optimizing throughput
Strong understanding of training dynamics at scale: debugging loss instabilities, tuning learning rate schedules, managing training stability across long-running multi-node jobs
Expert Python and PyTorch with production experience using training libraries (Transformers, DeepSpeed, Accelerate)