💎 Создание и развитие собственных базовых языковых моделей Авито: проверка гипотез в области претрейна, continual pre-training, post-training, RL и синтетических данных, масштабирование обучения и оптимизация инференса (квантование, speculative decoding), построение процедур оценки качества моделей, написание продакшен-кода на Python и PyTorch.
Требуется ML Ops-инженер, который возьмёт на себя задачи автоматизации полного жизненного цикла машинного обучения. В обязанности входит организация процессов разработки, тестирования, развертывания моделей, а также их мониторинг и поддержка в рабочей среде.
разработка PoC и MVP AI-агентов с использованием фреймворков для работы с LLM. адаптация и дообучение LLM на внутренних и внешних данных (SFT, LoRA, DPO, GRPO).
разработка, тестирование и внедрение ИИ-агентов (в том числе LLM-as-a-Judge) и классических ML-моделей для оценки качества, детекции аномалий, прогнозирования деградации и автоматической локализации причин сбоев. исследование и внедрение новых подходов в области настройки LLM, LLM-as-a-Judge и RAG, чтобы сделать мониторинг точнее, стабильнее и понятнее.
работать с таргетами, полученными из анкет и интервью с помощью экспертной и LLM-разметки. подбирать постановку задачи в зависимости от объема и качества данных: supervised learning, weak supervision, few-shot и другие подходы.
проектировать и реализовывать end-to-end LLM-пайплайны, включая продвинутые RAG-системы (индексация, ретривал, ранжирование, генерация). разрабатывать автономных AI-агентов с использованием планирования, вызова инструментов (function calling) и мультиагентной оркестрации.
Сопровождение ML-решений (мониторинг сервисов и моделей, отслеживание дрейфа данных, работа над развитием); Оценка влияния на бизнес предложенных решений;
• Разработка моделей эластичности для различных групп клиентов, кластеризации клиентов по их поведенческим характеристикам. • Разработка поведенческих моделей для прогнозирования динамики объемов различных сегментов розничного портфеля Банка в множестве сценариев на периоде жизни портфеля.
Требования:
— Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
— Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
— Оптимизация SQL для highload (партиционирование, индексы, explain plans)
— Oracle (PL/SQL) и PostgreSQL
— Greenplum и/или Clickhouse
— Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
— Hadoop (HDFS) и Hive
— Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
— Опыт работы с биллинговыми системами (желательно телеком-домен)
Преимущества:
— Потоковая обработка: Kafka Streams / Spark Streaming
— Informatica PowerCenter (понимание мигрируемой системы)
— Бинарные форматы хранения в Hadoop
— Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
— Patroni для кластеризации PostgreSQL/Greenplum
— S3-хранилища
— КриптоПро или защищенные каналы передачи данных
Задачи:
— Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
— Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
— Написание и оптимизация SQL для витрин данных и ETL-процессов
— Разработка DAG-ов в Airflow
— Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
— Разработка Spark-джобов (PySpark) для больших объемов
— Интеграция с Kafka для потоковой передачи
— Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
— Разбор инцидентов по качеству данных и ошибкам загрузки
— Code review
-Подготовкой математического ядра для сервисов, связанных с поиском на Фарпосте. -Помогать улучшать инфраструктуру и внедрять современные инженерные практики для наших сервисов.
О нас за минуту
DV Group — это eRetail маркетинг. У нас две собственные платформы:
CDP (DV Platform) — сегментирует покупателей по чековым данным, MAID, строит Sales Lift.
DSP (DV Programmatic) — закупает трафик в RTB с таргетингом на реальных онлайн-покупателей (не на интересы). Уникальная интеграция с ПБД.
Что предстоит делать
Разработка и внедрение ML-моделей
Анализ больших объемов данных
Построение recommendation / prediction моделей
Подготовка и очистка данных
Проведение A/B тестов
Написание сложных запросов ClickHouse и их оптимизация
Взаимодействие с frontend-разработчиками, backend-разработчиками, аналитиками, product-менеджером и DevOps
Кто нам нужен
Python, SQL, Spark, ClickHouse
pandas, numpy, scikit-learn
Опыт работы с ML-моделями
Работа с оркестраторами (Dagster, Airflow) и Kubernetes
Понимание статистики и теории вероятностей
Способность разрабатывать надежные ETL пайплайны
Что предлагаем
Зарплата:
200 000 – 220 000 ₽ оклад net + годовая премия
Формат:
гибрид или полная удалёнка, но ты проживаешь в РФ
График:
10:00–19:00
ДМС
со стоматологией после испытательного срока, локация Москва
Свой
бариста
в офисе и правда классный
Экспертная среда
— никакой скуки, только реальные AdTech-задачи и возможность влиять на продукт
Продукт в
реестре отечественного ПО
— это важно для нас и для клиентов.
Booking — сервис интернет-бронирования отелей по всему миру.
Вакансия Data Scientist II (Finance Payments) в компании Booking, расположенной в Амстердаме.
Требования к опыту и навыкам: применение методов GenAI, знание SQL, владение Python или R.
Размер команды компании — более 10 тысяч человек.
CEO компании — Glenn Fogel, ранее вице-президент Morgan Stanley.
В компании работает много русскоязычных сотрудников.