Задачи:
— Возглавить техническое развитие NLP в AI-продукте с большими языковыми моделями в production.
— Оптимизировать скорость, стоимость и стабильность inference больших LLM.
— Работать с distributed inference на multi-GPU / multi-node инфраструктуре (32×H200 + AWS).
— Заниматься training и post-training LLM, развитием agent architectures.
— Оказывать техническое лидерство NLP/CV-команде с перспективой роста до Head of ML.
Требования:
— Production-опыт оптимизации LLM inference: SGLang / vLLM / TensorRT-LLM.
— Опыт работы с distributed inference/training больших моделей: MoE, tensor/expert/pipeline parallelism, multi-node GPU.
— Знания KV cache, attention kernels, batching, quantization, GPU profiling.
— Опыт training/fine-tuning и post-training: RLHF, DPO или аналоги.
— Уверенное владение PyTorch и Transformers.
— Английский язык на уровне B2 и выше.
Условия:
— Около 70% времени hands-on engineering, без Project/People Management.
— Работа удалённая.
— Сильная команда и высокое вознаграждение.
Контакты работодателя доступны по кнопке «Откликнуться» после входа.