Quantori разрабатывает программное обеспечение для биотехнологических и фармацевтических компаний. Среди клиентов компании Pfizer, LGC, The Jackson Laboratory. В компании работает более 500 человек, инвестиции составляют 15 миллионов долларов.
Требования:
— Опыт работы не менее 6 лет
— Знание Python, R, SQL, Spark, dbt
— Уровень английского языка не ниже B2
Формат работы: удалённо.
Задачи:
– проектирование и разработка слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин);
– разработка и внедрение кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python;
– формализация бизнес-правил качества данных в код, настройка уровней доверия к источникам и правил выживания (survivorship rules);
– внедрение Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора;
– настройка автоматизированного тестирования данных (Data Quality checks) в пайплайнах.
Требования:
– Продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных;
– уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга;
– практический опыт применения библиотек нечёткого поиска и связывания записей (Splink, recordlinkage, dedupe, theFuzz);
– понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах);
– глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных;
– опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги);
– опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов.
Требования:
- Опыт TeamLead (управление командой) не менее 4 лет;
- Опыт разработки ETL/ELT-процессов, в которых значительная часть логики реализована на стороне СУБД;
- Опыт разработки и сопровождения хранимых процедур / функций в СУБД;
- Практический опыт использования SQL/PLSQL или аналогичных процедурных расширений SQL для реализации загрузок и трансформаций данных;
- Опыт участия в проектах миграции ETL-систем (Apache стек);
- Опыт разработки на Python (написание ETL-скриптов, работа с pandas, интеграция с API);
- Опыт написания и отладки DAG'ов в Apache Airflow (не только проектирование, но и разработка);
- Опыт работы с PySpark (трансформации, оптимизация, партиционирование);
- Опыт миграции ETL-процессов с Informatica PowerCenter на открытый стек (Airflow + Greenplum);
- Глубокое практическое знание NiFi и Airflow: проектирование потоков, подключение источников, обработка ошибок, мониторинг, отладка;
- Опыт работы с качеством данных: разработка правил валидации, анализ влияния на бизнес-процессы;
- Понимание архитектурных подходов к проектированию хранилищ, различие ETL и ELT;
- Опыт работы с Hive metastore (устройство, хранение на PostgreSQL) и форматами файлов (Parquet, ORC);
- Опыт работы с Оracle;
- Опыт применения сложных SQL-запросов (оконные функции, джоины);
- Умение оптимизировать запросы для highload-среды;
- Опыт проектирования интеграций Apache-стека с Kafka и BI-системами;
- Опыт настройки потоковой обработки данных;
- Опыт работы с Hadoop и Hive (знание версий, источников данных);
- Опыт работы с PostgreSQL, Greenplum, Clickhouse;
- Опыт работы с Grafana/Prometheus для отслеживания ETL-процессов;
- Опыт работы с биллингом;
- Опыт автоматической валидации и контроля качества данных после миграции (сравнение результатов, метрики);
Обязанности:
- Миграция ETL-процессов с Informatica PowerCenter на целевой стек: NiFi + Airflow + Greenplum + SQL/хранимые процедуры.
- Подготовка документации AS IS и TO BE;
- Написание SQL кода;
- Отслеживание метрик.
Удалённоsenior
280 000 – 300 000 ₽
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Задачи:
- Проводить проектную коммуникацию с представителями бизнес-заказчика с целью уточнения бизнес-требований
- Выявлять и проводить анализ бизнес-требований, потребностей и проблем бизнес-заказчика
- Формировать спецификации требований, описание логических моделей, структур данных и проектных решений (хранилища и витрины данных)
- Согласовывать проектные решения с архитекторами, разработчиками и аналитиками смежных команд
- Проектировать и разрабатывать ETL/ELT процессы, слои хранилища и витрины данных
- Разрабатывать и оптимизировать SQL-запросы
- Проводить внутреннее тестирование и контроль качества информационных продуктов, реализованных разработчиками
- Принимать участие в приёмочных испытаниях информационных продуктов и документации с заказчиками
- Обеспечивать контроль качества данных и их целостность
Требования:
- Высшее образование: техническое, математическое или финансовое
- Опыт работы не менее 5 лет
- Уверенные знания Python, GIT, Airflow (DAG с декомпозицией задач, зависимостями, сенсорами)
- Глубокое знание SQL: оконные функции, процедуры, функции, вложенные запросы, опыт оптимизации запросов
- Понимание индексов, партиций, ключей, нормальных форм, SCD
- Понимание моделирования данных, построения хранилища, репликации и консистентности данных
- Умение рефакторить код и проводить миграцию из одной системы в другую
- Знание принципов CI/CD
- Знание PL/SQL для Oracle, Postgres, Greenplum или знание иной MPP СУБД (будет плюсом)
- Опыт работы с API (будет плюсом)
- Знание ООП, DBT, Kafka, Bash, SAS (будет плюсом)
Задачи:
— Определить, что считается качеством модели: метрика, горизонт, baseline, калибровка, и довести предикт до этого уровня
— Интегрировать A/B-тесты пейволлов с предиктом, учитывая, что тест измеряет краткосрочный эффект, а раскатывать нужно по долгосрочной выручке
— Развить аналитику, выявить и устранить узкие места в данных, запросах или интерфейсе
— Принять решение по накопленным ML-наработкам: что доводить до продукта, что закрывать
— Руководить командой из двух ML-инженеров
Требования:
— Глубокие знания классического ML и математической статистики, способность вести предметный спор о метриках и горизонтах прогнозирования
— Владение SQL и Python для самостоятельного извлечения и проверки данных
— Умение самостоятельно вести широкое направление и доводить его до результата без необходимости постановки задач
— Продуктовый опыт является плюсом, но не обязателен
Плюсы:
— Опыт с подписками, мобильными приложениями или финтехом (LTV, churn, когортная экономика)
— Знания в области экспериментального дизайна: мощность теста, MDE, множественные сравнения
— Опыт работы с ClickHouse
— Участие в олимпиадах, Kaggle, наличие публичных проектов
О компании:
Adapty — платформа монетизации подписок для мобильных приложений, через которую проходит более $3 млрд подписочной выручки в год, используется более 20 000 приложений. В компании формируется новое направление аналитики и ML под одного владельца, с целью улучшения точности предсказания LTV для оптимизации расходов на привлечение пользователей.
Требования:
- sql, базы данных, python, аналитический склад ума
Обязанности:
- построение ETL-процессов
- работа с современным стеком трансформации
- оркестрация данных
- управление хранилищами
- визуализация смыслов
- оптимизация выборок
Условия:
Срочный трудовой договор на 3 месяца, удаленно/офис/гибрид.
Стажировка для студентов из любых ВУЗов.
Задачи:
– Разработка и оптимизация ETL-процессов с использованием Python и SQL.
– Разработка и внедрение масштабируемых конвейеров обработки данных для обработки различных источников данных.
– Работа с реляционными базами данных (например, PostgreSQL, Oracle) для обеспечения эффективного хранения и извлечения данных.
– Оптимизация SQL-запросов и скриптов Python для повышения производительности и удобства сопровождения.
– Внедрение надежной обработки ошибок, ведение журналов и мониторинг для конвейеров обработки данных.
– Взаимодействие с межфункциональными командами для интеграции и управления источниками данных.
Требования:
– Более 5 лет опыта в области проектирования данных.
– Навыки работы с Python и SQL на экспертном уровне – умение писать эффективный, масштабируемый и поддерживаемый код.
– Обширный опыт в проектировании ETL-процессов и работе с большими массивами данных.
– Глубокое понимание оптимизации производительности баз данных и оптимизации запросов.
– Опыт работы с моделированием данных и проектированием схем.
– Знание решений для облачного хранения данных (Azure, AWS или GCP).
– Высокие навыки решения проблем и способность работать самостоятельно.
– Желательно: опыт работы с PySpark, оркестраторами и знание CI/CD для автоматизации процесса развертывания.
Условия:
– Полностью удаленная позиция с гибкими условиями работы.
Ищем сильного специалиста по табличным данным в команду, которая моделирует спрос и поведение розничного портфеля крупного Банка: оцениваем, как меняется спрос на продукт при изменении его параметров, и переводим это в решения по портфелю.
О нас:
Наш клиент — аутстафф-компания, подбирающая инженеров на длительные проекты. Сейчас ищем Data Scientist / AI Engineer.
Про проект:
Заказчик развивает ИИ-направление и выводит решения на базе LLM в промышленную эксплуатацию. Нужны специалисты, которые доводили AI-агентов до продакшена и понимают практические аспекты. Команда распределённая, работа полностью удалённая.
Кого ищем:
Data Scientist / AI Engineer с коммерческим опытом от 3 лет, реализовавший и выведший в продакшн решения на базе ИИ, включая AI-агентов на базе LLM. Уверенный в классическом ML, глубоком обучении и инфраструктуре.
Задачи:
— Разрабатывать и выводить в промышленную эксплуатацию решения на базе ИИ, включая AI-агентов на базе LLM.
— Проектировать архитектуру AI-агентов и подходы к их построению.
— Работать с Deep Learning в части NLP, включая архитектуру Transformer.
— Делать fine-tuning языковых моделей (GPT-like, BERT-like и др.).
— Разрабатывать интеграции с ИТ-системами.
— Работать с промышленным Kubernetes.
Требования:
— Коммерческий опыт работы от 3 лет.
— Опыт реализации и вывода в промышленную эксплуатацию решений на базе ИИ, включая AI-агентов на базе LLM, в роли Data Scientist / AI Engineer.
— Знание основ классического машинного обучения.
— Хорошее знание Deep Learning (NLP).
— Глубокое понимание архитектуры Transformer.
— Глубокое понимание подходов и методов проектирования AI-агентов.
— Практический опыт fine-tuning языковых моделей (GPT-like, BERT-like и др.).
— Уверенная работа со стеком Python — Torch, Transformers.
— Опыт разработки интеграций с ИТ-системами.
— Опыт промышленной работы с Kubernetes.
Обязательные технологии и инструменты: Python, Torch, Transformers, Kubernetes.
Отбор:
Техническое собеседование по каждому пункту требований.
Условия:
— Полная удалёнка.
— Зарплата от 200 000 до 230 000 ₽ на руки.
— Выплата раз в месяц.
— Оформление по ИП, налоги покрывают.
Как откликнуться:
В отклике кратко рассказать о своём опыте с LLM и AI-агентами, роли, стеке, кейсах с fine-tuning и промышленным Kubernetes.
Требования к кандидату:
- 6+ years commercial Data Engineering
- Enterprise-scale data pipelines & platforms
- Microsoft Azure data services
- Azure Databricks + Apache Spark
- Azure Data Factory
- Microsoft Fabric + modern cloud analytics
- Azure Data Lake (ADLS) or equivalent
- Strong SQL + ETL/ELT
- Medallion architecture + reusable frameworks
- CI/CD & DevOps (Azure DevOps preferred)
Banco Plata, a technology-driven platform utilizing AI to transform financial services in Mexico, is seeking a Risk Data Scientist at the Middle+ level. The role involves managing the entire machine learning model lifecycle, including development, deployment, and monitoring. Candidates should have over three years of practical experience in Data Science, preferably within banking or financial sectors. A solid understanding of machine learning algorithms and feature engineering is essential. Proficiency in Python, SQL, Airflow, Git, and BI tools such as Streamlit is required. Educational background should be in Mathematics, Physics, Computer Science, or related STEM fields. Effective communication skills in English at a B1 level or higher are necessary. The position is based in Colombia, with relocation assistance provided.
Компания Tabby ищет опытного инженера данных для работы в команде Data Services. В обязанности входит разработка внутренних решений, включая Feature Store, а также выполнение операционных задач. Ключевые задачи включают создание хранилищ данных и других сервисов обработки, разработку конвейеров EL/ELT/ETL, а также интеграцию новых инструментов для обработки и хранения данных. Требуется опыт от 3 до 5 лет в роли инженера данных, инженера машинного обучения или бэкенд-инженера, умение создавать высокопроизводительные и масштабируемые системы обработки и хранения данных, а также знание систем управления событиями и потоковых конвейеров. Необходимы навыки программирования на Python с применением лучших практик, владение SQL и его эффективным использованием, а также понимание современных методов проектирования систем. Технологический стек включает Airflow, Debezium, BigQuery или Clickhouse, PostgreSQL или CockroachDB, Docker, GitLab (CI/CD), GCP. Также важен опыт работы с REST API, GRPC API, брокерами сообщений и очередями.
About LawnStarter
LawnStarter is the nation's leading on-demand marketplace for lawn care and outdoor services, with over $100M in annual bookings. The company is expanding beyond lawn care to become a one-stop shop for all home services, operating across three brands (LawnStarter, Lawn Love, Home Gnome) on a single shared platform.
About Analytics at LawnStarter
The analytics team supports the entire company including product, marketing, operations, and finance. The data platform includes a centralized Redshift data warehouse, modeled in dbt and orchestrated by Airflow, with Segment feeding event data. The team is mid-migration to Lightdash as the single BI platform, replacing Tableau and Metabase. Currently, data quality, tracking standards, and platform hygiene are side tasks handled by analysts.
The Role
The Analytics Engineering Manager will be the first dedicated person for data governance, responsible for data trustworthiness and the roadmap to improve it quarterly. Responsibilities include ensuring quality and freshness of source data, pipelines, reports, metric definitions, Segment event tracking standards, Lightdash workspace health, data feeding ML models, and data security. The role involves collaborating with product, marketing, ops, and finance to prioritize platform work. It is a hands-on role starting solo, building automation, checks, fixing issues, and establishing scalable processes. Eventually, the manager will hire a Lead Analytics Engineer and grow the function as needed.
Key differentiators of the role:
- First dedicated governance role, reshaping existing standards.
- Owns the data roadmap, discovering business needs and prioritizing work.
- Whole-stack ownership from source data to ML models.
- Leading the migration to Lightdash, setting up permissions and norms.
Responsibilities:
- Develop and manage the data roadmap balancing business needs and platform health.
- Automate monitoring of data quality and freshness, resolve incidents.
- Maintain data lineage and impact analysis to assess downstream effects of changes.
- Administer Lightdash workspace, permissions, and rollout.
- Extend and guard the semantic layer with governed metric definitions.
- Govern Segment event tracking catalog, standards, and drift detection.
- Ensure AI data readiness for internal AI tools querying the warehouse.
- Manage data security, privacy, access controls, and compliance with US state laws.
- Maintain governance documentation, ownership models, and review processes.
Challenges to solve:
- Convert business requests into a prioritized data roadmap.
- Ensure Lightdash migration improves platform usability without dashboard sprawl.
- Complete and maintain a trustworthy semantic layer.
- Manage event-tracking standards and prevent entropy.
- Proactively detect and prevent data pipeline breakages with automation and lineage.
Success metrics for year 1:
- Zero pipeline incidents from unannounced data changes.
- Zero freshness incidents; stakeholders never see stale dashboards.
- All business areas use official, well-maintained metrics and dashboards.
- Every Segment event has an owner and meets standards.
- Governance operates as a documented, sustainable system.
Requirements:
- Passion for data governance as a craft.
- Daily use of AI tools for automation, anomaly triage, and documentation.
- Hands-on manager who codes, debugs, and configures personally.
- Product-minded, able to translate vague requests into prioritized plans.
- Automation-first approach to quality checks.
- Ability to enforce standards with clear rules and good tooling.
Role exclusions:
- Not a large-team leadership role; starts solo with potential to hire one lead.
- Not a policy or committee role; hands-on fixing with code and conversations.
- Not a BI analyst role; focuses on platform and guardrails, not dashboard building.
- Not a mature system babysitting role; involves building and evolving the platform.
Technologies involved:
- Warehouse & pipelines: Redshift, dbt, Airflow
- Ingestion: Fivetran, custom Airflow pipelines
- Event tracking: Segment
- BI tools: Lightdash (primary), Tableau and Metabase (sunsetting)
- AI tooling: Claude Code, Codex, Brain (internal AI toolkit)
- Observability: AI-powered Analytics Engineer agent for monitoring and anomaly detection
Benefits:
- Base salary $75k-$120k/year
- Fully remote with asynchronous collaboration
- Flexible PTO
Equal employment opportunity statement included.
Задачи:
— Владение дорожной картой данных: выявление потребностей продукта, маркетинга, операций и финансов в данных, приоритизация задач с учетом состояния платформы и последовательное планирование инвестиций.
— Обеспечение качества и актуальности данных: автоматический мониторинг источников данных, конвейеров и отчетов, выявление изменений в схемах и источниках до возникновения проблем, управление инцидентами.
— Анализ происхождения данных и влияния изменений: создание живой карты от источника до отчетов, оценка влияния изменений на downstream компоненты до их внедрения, внедрение контрактов данных с инженерией.
— Администрирование Lightdash: настройка структуры рабочего пространства, прав доступа, обучение пользователей, поддержание порядка и производительности.
— Управление семантическим слоем: расширение и поддержка единого определения метрик, предотвращение неконтролируемого роста.
— Управление каталогом событий Segment: проверка новых событий на соответствие стандартам, поддержание соответствия с продакшеном, развитие правил и обнаружение отклонений.
— Обеспечение готовности данных для AI: контроль доступа AI-инструментов к данным, поддержание документации, консистентности и безопасности.
— Обеспечение безопасности и конфиденциальности данных: контроль доступа, обработка персональных данных в соответствии с законами штатов США, регулярные проверки.
— Поддержка системы управления: документация, модели владения и циклы обзора для устойчивой работы процессов.
Требования:
— Профессиональное отношение к управлению данными, стремление к поддержанию чистоты и надежности систем.
— Активное использование AI-инструментов для автоматизации проверок, обработки аномалий и документации.
— Практический опыт управления командой и самостоятельной работы с SQL, Airflow, настройкой прав доступа.
— Ориентация на продукт, умение превращать запросы бизнеса в приоритетный план.
— Стремление к автоматизации повторяющихся проверок.
— Умение устанавливать стандарты и добиваться их соблюдения с помощью инструментов и коммуникации.
Условия:
— Базовая зарплата $75,000-$120,000 в год.
— Полностью удаленная работа с асинхронным взаимодействием.
— Гибкий отпуск по результатам работы.
Описание роли:
— Первая позиция, посвященная управлению данными и их качеством в компании.
— Роль с полным владением цепочкой данных от источника до отчетов и моделей машинного обучения.
— Роль с практической деятельностью и последующим расширением команды.
— Не руководящая большая команда, а построение и развитие функции.
— Не роль BI-аналитика или политика, а инженерно-управленческая позиция.
Технологии:
— Хранилище и конвейеры: Redshift, dbt, Airflow.
— Интеграция данных: Fivetran, кастомные Airflow конвейеры.
— Отслеживание событий: Segment.
— BI-платформы: Lightdash (основная), Tableau и Metabase (выводятся).
— AI-инструменты: Claude Code, Codex, Brain (внутренний AI-инструмент).
— Наблюдение: AI-агент для мониторинга свежести, обнаружения аномалий и lineage dbt.
Стажировка для иностранных студентов, желающих поработать в области анализа и разработки данных.
Требования:
— знание английского
— высокая академическая успеваемость
— хорошие организаторские способности
Дедлайн: как можно скорее.
Оплата: стажировка предусматривает стипендию.
Nitka Technologies is an international IT company specializing in custom software development and IT consulting.
The position is for a Senior Data Engineer working with Delphix technology.
The work format is remote.
Задачи:
– Разработка и рефакторинг ETL/ELT пайплайнов на pyspark;
– Разработка и поддержка OLAP движков Starrocks/Clickhouse;
– Поддержка текущих пайплайнов на Greenplum и Hadoop;
– Миграция с HDFS на S3;
– Оптимизация spark-приложений.
Требования:
– Опыт работы с Python от 3 лет;
– Глубокое знание SQL и опыт работы с большими данными;
– Опыт работы с Apache Airflow;
– Опыт проектирования и разработки ETL/ELT процессов;
– Опыт работы с колоночными БД (ClickHouse);
– Знание принципов построения Data Warehouse и Data Lake;
– Понимание разницы между OLTP/OLAP системами;
– Уверенная работа c linux и git;
– Понимание процессов ci/cd.
Удалённо
Зарплата не указана
Удалённо
75 000 – 120 000 $
Удалённо
75 000 – 120 000 $
Данные и ML вакансии — удалённо — страница 3 · Job Hunters