ASOS.com — британский онлайн‑ритейлер модной одежды, обуви, аксессуаров и косметики. В компании работают русскоговорящие ребята.
Технологии и инструменты: SQL, Databricks, Spark, DBT, Python, Mixpanel, Adobe и другие.
Компания основана фаундерами Nick Robertson, Andrew Regan, Quentin Griffiths, Deborah Thorpe.
Размер команды: 1k-5k человек. Инвестиции: £587.5M.
Write and adapt SQL queries against well-defined requests, using Claude to refine logic and troubleshoot errors. Look up existing metrics in Looker or Omni to understand how they're already built, and reuse that logic where it applies.
– Развивать корпоративную платформу данных и DWH; – Переводить существующие ETL-процессы с SSIS на Apache Airflow 3 и внутренний YAML-driven Python-фреймворк;
Quantori разрабатывает программное обеспечение для биотехнологических и фармацевтических компаний. Среди клиентов компании Pfizer, LGC, The Jackson Laboratory. В компании работает более 500 человек, инвестиции составляют 15 миллионов долларов.
Требования:
— Опыт работы не менее 6 лет
— Знание Python, R, SQL, Spark, dbt
— Уровень английского языка не ниже B2
Формат работы: удалённо.
Задачи:
- Сбор требований с бизнес-заказчиков и анализ источников данных
- Разработка, реализация и поддержка типовых потоковых интеграционных решений на стеке технологий: Trino, Iceberg, S3, Spark, Apache Airflow, Kafka, Cosmos, Flink
- Оперативное реагирование на информацию о проблемах в зоне ответственности, выполнение типовых задач в установленный срок
- Поддержание в актуальном состоянии документации типовых интеграционных решений платформы больших данных, предоставление отчетности руководителю
Требования:
- Общее представление о стеке технологий Lakehouse
- Понимание различия работы между BigData/Lakehouse и с данными обычного размера
- Знание SQL (индексы, функции, оптимизация, профилирование производительности)
- Опыт работы с любой реляционной БД (Oracle, Postgres, MySQL, MsSQL, DB2 и т.п.)
- Умение работать с Git (знание команд git pull/commit/push)
- Опыт работы с DBT, Cosmos
- Представление о работе с Trino
- Понимание устройства Iceberg, форматов данных
- Понимание работы с minio или любого другого хранилища на основе S3
- Опыт использования систем ведения проектов и документации
- Знания основ программирования (JAVA, Python)
О проекте:
Мы строим Customer Intelligence & Personalization Platform для экосистемы бизнесов в Армении. В основе — Golden Record: единый профиль клиента, объединяющий данные банка, продуктов экосистемы и внешних источников. Поверх него строятся Customer 360, сегментация, scoring и персонализированные предложения.
Задачи роли:
Предстоит спроектировать слой между сырыми данными core banking системы и витринами платформы. Источник слабо документирован: часть значений закодирована, часть бизнес-логики реализована в коде и хранимых процедурах, две внешне одинаковые записи могут быть собраны разными алгоритмами из разных таблиц.
Нужен человек, который разберёт этот источник и превратит его в осознанную модель данных: что откуда берётся, что на что влияет, какое поле что означает.
Что предстоит делать:
— Исследовать core banking систему, legacy- и внешние источники, восстанавливать их семантику.
— Идти от целевой витрины к источнику: определять, из каких таблиц и по какой логике собирается каждый атрибут.
— Разделять случаи, когда одинаковые по виду данные получены разными путями, и фиксировать правила выбора.
— Описывать модель данных и метаданные: сущности, связи, grain, ключи, историчность.
— Формировать требования к витринам для сегментации, scoring и рекомендаций.
— Писать SQL-исследования и прототипы трансформаций, проверять гипотезы на данных.
— Выяснять смысл данных напрямую у сотрудников банка — это постоянная часть работы.
О бэкграунде:
Важно, какие задачи вы решали — приходили в незнакомую недокументированную систему и разбирались сами, восстанавливали бизнес-смысл данных, строили модель с нуля и доводили исследование до работающей витрины.
Если вы работали дата-инженером и значительную часть времени тратили на то, чтобы понять, что лежит в источнике, — это наш профиль. Если получали готовые чистые витрины — скорее нет.
AI-native подход:
Мы используем AI-native подход и ожидаем того же от кандидата: AI-инструменты применяются для разбора legacy, анализа схем, написания SQL и документирования.
Требования:
— Сильный SQL: оконные функции, сложные join-цепочки, анализ качества и распределений.
— Опыт реверс-инжиниринга плохо документированных источников.
— Понимание data modelling: сущности, grain, ключи, историчность, master entities.
— Опыт работы с банковскими или fintech-данными (Core banking (особенно ArmSoft) / legacy banking systems, Customer 360) или опыт разбора сырых банковских данных о клиентах и продуктах из плохо документированных систем с целью производства маркетинговой и финансовой аналитики.
— Python на уровне исследования данных.
— Способность самостоятельно довести задачу «вот сырьё, вот целевая витрина» до результата.
— Проактивность: готовность выяснять смысл данных у людей, а не ждать документации.
— Git, Linux, опыт работы в закрытых Dev/UAT-контурах.
Будет плюсом:
— Знание армянского языка
— Методологии матчинга и дедупликации
— Опыт с Data Vault 2.0
— Опыт с DBT или аналоги
— PII, маскирование, RBAC
— Опыт в регулируемом on-premise контуре
— Экспертиза в ML, ML Ops
Условия:
— Взаимодействие по ИП
— Локация - Армения
— Формат работы - гибрид, готовность работать из офиса банка до 3 раз в неделю.
Задачи:
– проектирование и разработка слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин);
– разработка и внедрение кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python;
– формализация бизнес-правил качества данных в код, настройка уровней доверия к источникам и правил выживания (survivorship rules);
– внедрение Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора;
– настройка автоматизированного тестирования данных (Data Quality checks) в пайплайнах.
Требования:
– Продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных;
– уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга;
– практический опыт применения библиотек нечёткого поиска и связывания записей (Splink, recordlinkage, dedupe, theFuzz);
– понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах);
– глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных;
– опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги);
– опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов.
We’re looking for a DevOps Engineer (Data Focus) to strengthen our Data Engineering team. This role is all about building and maintaining reliable, scalable, and observable data infrastructure that powers our trading research and production systems.
Задачи:
- Проводить проектную коммуникацию с представителями бизнес-заказчика с целью уточнения бизнес-требований
- Выявлять и проводить анализ бизнес-требований, потребностей и проблем бизнес-заказчика
- Формировать спецификации требований, описание логических моделей, структур данных и проектных решений (хранилища и витрины данных)
- Согласовывать проектные решения с архитекторами, разработчиками и аналитиками смежных команд
- Проектировать и разрабатывать ETL/ELT процессы, слои хранилища и витрины данных
- Разрабатывать и оптимизировать SQL-запросы
- Проводить внутреннее тестирование и контроль качества информационных продуктов, реализованных разработчиками
- Принимать участие в приёмочных испытаниях информационных продуктов и документации с заказчиками
- Обеспечивать контроль качества данных и их целостность
Требования:
- Высшее образование: техническое, математическое или финансовое
- Опыт работы не менее 5 лет
- Уверенные знания Python, GIT, Airflow (DAG с декомпозицией задач, зависимостями, сенсорами)
- Глубокое знание SQL: оконные функции, процедуры, функции, вложенные запросы, опыт оптимизации запросов
- Понимание индексов, партиций, ключей, нормальных форм, SCD
- Понимание моделирования данных, построения хранилища, репликации и консистентности данных
- Умение рефакторить код и проводить миграцию из одной системы в другую
- Знание принципов CI/CD
- Знание PL/SQL для Oracle, Postgres, Greenplum или знание иной MPP СУБД (будет плюсом)
- Опыт работы с API (будет плюсом)
- Знание ООП, DBT, Kafka, Bash, SAS (будет плюсом)
О проекте:
Мы строим Customer Intelligence & Personalization Platform для зарубежной экосистемы бизнесов.
Задачи:
— Принимать технические решения и самостоятельно реализовывать ключевые части платформы.
— Владеть архитектурой и развитием Data Core.
— Проектировать слои Bronze / Silver / Gold и модели данных.
— Исследовать банковские, legacy- и внешние источники, восстанавливать их семантику.
— Строить pipelines от raw-данных до подготовленных data products.
— Разрабатывать трансформации на SQL / dbt / Python.
— Определять инженерные стандарты для ELT, data modelling, metadata, lineage и data quality.
— Развивать data catalog и metadata-as-code подход.
— Проектировать data contracts и интеграции Data Core с другими компонентами.
— Переводить исследовательские решения и ручные процессы в production.
— Работать с Git, CI/CD, Docker, Linux и закрытыми Dev/UAT-контурами.
— Взаимодействовать с инженерами и data scientist в команде.
Требования:
— Опыт работы Lead / Staff / Principal Data Engineer или сильного Senior с архитектурным ownership.
— Опыт проектирования и самостоятельной реализации data platform / DWH / Lakehouse.
— Знания Core banking / legacy banking systems.
— Опыт с Customer 360 / Golden Record / MDM.
— Сильный SQL и уверенный Python.
— Опыт работы с dbt или аналогичными transformation frameworks.
— Опыт работы с Airflow / Dagster / Prefect или аналогами.
— Хорошее понимание data modelling, historization, grain и master entities.
— Практический опыт data quality, lineage и metadata management.
— Знание Data Vault 2.0.
— Опыт работы с OpenMetadata или другими data catalog solutions.
— Умение самостоятельно принимать технические решения и отвечать за результат.
— Опыт работы с плохо документированными источниками.
— Навыки работы с Git, CI/CD, Docker, Linux.
— Практический AI-native способ разработки.
Условия:
— Оформление: ИП.
— Формат работы: полная занятость.
— Локация: Ереван либо готовность к регулярным командировкам (до 2 раз в месяц на несколько дней) в Ереван для работы с данными и специалистами заказчика.
— Уровень дохода обсуждается индивидуально.
About LawnStarter
LawnStarter is the nation's leading on-demand marketplace for lawn care and outdoor services, with over $100M in annual bookings. The company is expanding beyond lawn care to become a one-stop shop for all home services, operating across three brands (LawnStarter, Lawn Love, Home Gnome) on a single shared platform.
About Analytics at LawnStarter
The analytics team supports the entire company including product, marketing, operations, and finance. The data platform includes a centralized Redshift data warehouse, modeled in dbt and orchestrated by Airflow, with Segment feeding event data. The team is mid-migration to Lightdash as the single BI platform, replacing Tableau and Metabase. Currently, data quality, tracking standards, and platform hygiene are side tasks handled by analysts.
The Role
The Analytics Engineering Manager will be the first dedicated person for data governance, responsible for data trustworthiness and the roadmap to improve it quarterly. Responsibilities include ensuring quality and freshness of source data, pipelines, reports, metric definitions, Segment event tracking standards, Lightdash workspace health, data feeding ML models, and data security. The role involves collaborating with product, marketing, ops, and finance to prioritize platform work. It is a hands-on role starting solo, building automation, checks, fixing issues, and establishing scalable processes. Eventually, the manager will hire a Lead Analytics Engineer and grow the function as needed.
Key differentiators of the role:
- First dedicated governance role, reshaping existing standards.
- Owns the data roadmap, discovering business needs and prioritizing work.
- Whole-stack ownership from source data to ML models.
- Leading the migration to Lightdash, setting up permissions and norms.
Responsibilities:
- Develop and manage the data roadmap balancing business needs and platform health.
- Automate monitoring of data quality and freshness, resolve incidents.
- Maintain data lineage and impact analysis to assess downstream effects of changes.
- Administer Lightdash workspace, permissions, and rollout.
- Extend and guard the semantic layer with governed metric definitions.
- Govern Segment event tracking catalog, standards, and drift detection.
- Ensure AI data readiness for internal AI tools querying the warehouse.
- Manage data security, privacy, access controls, and compliance with US state laws.
- Maintain governance documentation, ownership models, and review processes.
Challenges to solve:
- Convert business requests into a prioritized data roadmap.
- Ensure Lightdash migration improves platform usability without dashboard sprawl.
- Complete and maintain a trustworthy semantic layer.
- Manage event-tracking standards and prevent entropy.
- Proactively detect and prevent data pipeline breakages with automation and lineage.
Success metrics for year 1:
- Zero pipeline incidents from unannounced data changes.
- Zero freshness incidents; stakeholders never see stale dashboards.
- All business areas use official, well-maintained metrics and dashboards.
- Every Segment event has an owner and meets standards.
- Governance operates as a documented, sustainable system.
Requirements:
- Passion for data governance as a craft.
- Daily use of AI tools for automation, anomaly triage, and documentation.
- Hands-on manager who codes, debugs, and configures personally.
- Product-minded, able to translate vague requests into prioritized plans.
- Automation-first approach to quality checks.
- Ability to enforce standards with clear rules and good tooling.
Role exclusions:
- Not a large-team leadership role; starts solo with potential to hire one lead.
- Not a policy or committee role; hands-on fixing with code and conversations.
- Not a BI analyst role; focuses on platform and guardrails, not dashboard building.
- Not a mature system babysitting role; involves building and evolving the platform.
Technologies involved:
- Warehouse & pipelines: Redshift, dbt, Airflow
- Ingestion: Fivetran, custom Airflow pipelines
- Event tracking: Segment
- BI tools: Lightdash (primary), Tableau and Metabase (sunsetting)
- AI tooling: Claude Code, Codex, Brain (internal AI toolkit)
- Observability: AI-powered Analytics Engineer agent for monitoring and anomaly detection
Benefits:
- Base salary $75k-$120k/year
- Fully remote with asynchronous collaboration
- Flexible PTO
Equal employment opportunity statement included.
Задачи:
— Владение дорожной картой данных: выявление потребностей продукта, маркетинга, операций и финансов в данных, приоритизация задач с учетом состояния платформы и последовательное планирование инвестиций.
— Обеспечение качества и актуальности данных: автоматический мониторинг источников данных, конвейеров и отчетов, выявление изменений в схемах и источниках до возникновения проблем, управление инцидентами.
— Анализ происхождения данных и влияния изменений: создание живой карты от источника до отчетов, оценка влияния изменений на downstream компоненты до их внедрения, внедрение контрактов данных с инженерией.
— Администрирование Lightdash: настройка структуры рабочего пространства, прав доступа, обучение пользователей, поддержание порядка и производительности.
— Управление семантическим слоем: расширение и поддержка единого определения метрик, предотвращение неконтролируемого роста.
— Управление каталогом событий Segment: проверка новых событий на соответствие стандартам, поддержание соответствия с продакшеном, развитие правил и обнаружение отклонений.
— Обеспечение готовности данных для AI: контроль доступа AI-инструментов к данным, поддержание документации, консистентности и безопасности.
— Обеспечение безопасности и конфиденциальности данных: контроль доступа, обработка персональных данных в соответствии с законами штатов США, регулярные проверки.
— Поддержка системы управления: документация, модели владения и циклы обзора для устойчивой работы процессов.
Требования:
— Профессиональное отношение к управлению данными, стремление к поддержанию чистоты и надежности систем.
— Активное использование AI-инструментов для автоматизации проверок, обработки аномалий и документации.
— Практический опыт управления командой и самостоятельной работы с SQL, Airflow, настройкой прав доступа.
— Ориентация на продукт, умение превращать запросы бизнеса в приоритетный план.
— Стремление к автоматизации повторяющихся проверок.
— Умение устанавливать стандарты и добиваться их соблюдения с помощью инструментов и коммуникации.
Условия:
— Базовая зарплата $75,000-$120,000 в год.
— Полностью удаленная работа с асинхронным взаимодействием.
— Гибкий отпуск по результатам работы.
Описание роли:
— Первая позиция, посвященная управлению данными и их качеством в компании.
— Роль с полным владением цепочкой данных от источника до отчетов и моделей машинного обучения.
— Роль с практической деятельностью и последующим расширением команды.
— Не руководящая большая команда, а построение и развитие функции.
— Не роль BI-аналитика или политика, а инженерно-управленческая позиция.
Технологии:
— Хранилище и конвейеры: Redshift, dbt, Airflow.
— Интеграция данных: Fivetran, кастомные Airflow конвейеры.
— Отслеживание событий: Segment.
— BI-платформы: Lightdash (основная), Tableau и Metabase (выводятся).
— AI-инструменты: Claude Code, Codex, Brain (внутренний AI-инструмент).
— Наблюдение: AI-агент для мониторинга свежести, обнаружения аномалий и lineage dbt.
Задачи:
— Проектирование, внедрение и поддержка DevOps-инструментов для дата-пайплайнов и платформ.
— Поддержка и автоматизация ETL-воркфлоу (например, Spark, Airflow).
— Создание и управление мониторингом и наблюдаемостью качества данных (DBT), дата-пайплайнов и систем хранения.
— Внедрение и поддержка инфраструктуры хранения данных на AWS (S3, EC2, сеть).
— Интеграция и поддержка Project Nessie как транзакционного каталога для Data Lakes с семантикой, похожей на Git.
— Тесное взаимодействие с Data Engineers для обеспечения плавного деплоя, версионирования и масштабирования дата-задач и пайплайнов.
— Автоматизация деплоя и CI/CD процессов с использованием GitLab CI/CD.
— Обеспечение лучших практик безопасности при работе с чувствительными данными.
— Написание автоматизации инфраструктуры на Python, Bash, Ansible.
— Документирование систем, пайплайнов и DevOps-процессов.
Требования:
— Опыт 5+ лет в DevOps / IT Ops / DataOps с практическим опытом работы с инфраструктурой, связанной с данными.
— Глубокие знания Linux (сеть, настройка ядра, оптимизация производительности).
— Практический опыт работы с Airflow, ClickHouse, DBT, Spark и Project Nessie.
— Солидные знания AWS (S3, EC2, IAM, сеть).
— Владение скриптингом и автоматизацией (Python, Bash, Ansible).
— Опыт работы с CI/CD пайплайнами (GitLab).
— Опыт с мониторинговыми стеками (Prometheus, Grafana, ELK).
— Знакомство с контейнеризацией и оркестрацией (Docker, Kubernetes).
— Понимание концепций управления данными.
— Сильные коммуникативные навыки и проактивный подход.
Желательно:
— Опыт работы с потоковой обработкой данных в реальном времени.
— Знание инфраструктуры как кода (Terraform).
— Знакомство с безопасностью в дата-инжиниринге (IAM, шифрование, контроль доступа).
— Опыт работы с высокопроизводительными системами или в торговой среде.
Задачи:
— разбираться с данными из разных источников: проверять их качество, искать причины расхождений, создавать агрегаты данных и помогать подключать новые источники;
— развивать и поддерживать аналитическую инфраструктуру: работать с dbt-моделями, настраивать тесты и алерты, следить за корректностью ключевых данных и метрик.
Задачи:
— Участие в построении автоматизированной системы контроля качества данных (DQ): развитие проверок, покрытие ключевых потоков, автоматизация.
— Обработка запросов внутренних заказчиков: выгрузки, сверки, проверка данных.
— Контроль корректности отчётности: следить за загрузками, разбирать расхождения, проверять цифры до публикации.
— Поддержка и развитие отчётов и дашбордов в Power BI.
— Работа с данными: подготовка, трансформация, визуализация, контроль качества.
— Документирование процессов, поддержка актуальности описаний.
Требования:
— SQL на уровне оконных функций, умение разобраться в незнакомой витрине.
— Уверенное владение Power BI.
— Опыт работы с реальными данными, а не только учебными примерами.
— Честность, открытость, ответственность.
— Умение самостоятельно разбираться в задачах и доводить до результата.
— Готовность работать в офисе полный день.
— Будет плюсом: опыт построения проверок качества данных (DQ, Great Expectations, dbt tests), Python для выгрузок и работы с API, понимание Airflow и dbt, опыт в ритейле или e-commerce.
Условия:
— График работы: 5/2 с 9:00 до 18:00. Офисный формат работы. После испытательного срока готовы предоставить гибридный формат.
— Скидка на ДМС.
— Ювелирные подарки сотрудникам в честь возрастания стажа работы в команде.
— Скидки на покупку ювелирных изделий.
— Спортивные мероприятия: баскетбол, футбол, настольный теннис, беговые марафоны, плавание и танцы.
— Стабильную выплату заработной платы два раза в месяц без задержек.
— Подарки в честь значимых событий в жизни сотрудников: День Рождения, подарки детям на Новый год.
— Оборудованная кухня внутри офиса с кофемашиной.
— Просторный и комфортный офис в шаговой доступности от метро Марьина Роща.