Задачи:
– проектирование и разработка слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин);
– разработка и внедрение кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python;
– формализация бизнес-правил качества данных в код, настройка уровней доверия к источникам и правил выживания (survivorship rules);
– внедрение Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора;
– настройка автоматизированного тестирования данных (Data Quality checks) в пайплайнах.
Требования:
– Продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных;
– уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга;
– практический опыт применения библиотек нечёткого поиска и связывания записей (Splink, recordlinkage, dedupe, theFuzz);
– понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах);
– глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных;
– опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги);
– опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов.
Контакты работодателя доступны по кнопке «Откликнуться» после входа.