Задачи:
— сопровождение ADB (Greenplum) и ADQM (Clickhouse): настройка, обновление, диагностика;
— резервное копирование и восстановление данных;
— решение инцидентов, возникающих при эксплуатации;
— восстановление работоспособности СУБД;
— экспертное взаимодействие с вендорами и заказчиками;
— ведение базы знаний.
Требования:
— знание и понимание принципов работы реляционных СУБД;
— 2+ года работы на позиции DBA реляционной СУБД;
— опыт и понимание принципов организации резервного копирования и восстановления;
— опыт в настройке и оптимизации производительности СУБД;
— знание SQL на уровне написания запросов.
Желательно:
— опыт работы с продуктами Arenadata;
— опыт администрирования MPP СУБД;
— опыт анализа и оптимизации производительности SQL-запросов.
Условия:
— уютный, комфортный и современный офис в пешей доступности от м. Алексеевская;
— стабильный и «белый» конкурентный доход;
— удобный график — гибрид или офис (в зависимости от подразделения);
— работа в аккредитованной ИТ-компании из реестра Минцифры (отсрочка от мобилизации);
— профессиональный рост, обучение и развитие, участие в проекте «Лекторий Rubytech»;
— развитые спортивные комьюнити: футбол, волейбол, баскетбол и шахматы;
— ДМС для вас и вашей семьи на особых условиях;
— тимбилдинги, митапы и другие корпоративные мероприятия;
— скидки у 500+ партнеров (платформы BestBenefits и Lerna).
О проекте:
Платформа разработки, валидации, транспорта и развёртывания DWH-объектов между ландшафтами (DEV → TEST → PROD).
Целевые СУБД: ADB (Greenplum) и ADQM (ClickHouse).
В продуктиве — CLI-конвейер Linter → Builder → Deployer.
В работе — интегрированный сценарий: Backend (Repository / Transport / Deploy Orchestration / Load / Admin), Execution Service, Deployment Worker, peer Transport API и Web UI поверх CLI.
Задачи:
— Разработка и развитие модулей toolchain на Python: mors-linter, mors-builder, mors-deployer (CLI на Typer, packaging через uv/Hatchling).
— Доработка и реализация интегрированного сценария на FastAPI: Web API (M-API), модули Repository, Transport, Deployment Orchestrator, Load, Administration; единый error-contract (ApiError), health-checks, OpenAPI.
— Реализация peer Transport API между ландшафтами: multipart/form-data (metadata + artifacts), status poll, маршруты DEV/TEST/PROD; интеграция с Deployment Worker (BUILD_PACKAGE / DEPLOY_PACKAGE) над CLI.
— Проектирование и работа с PostgreSQL: Metadata DB и Operational DB (раздельные инстансы), typed JSONB definitions, dependency index, locks (EDIT/IMPORT), транзакции, FOR UPDATE / очереди на БД (SKIP LOCKED).
— Статический анализ SQL/YAML/конфигов DWH-проектов (sqlglot, sqlparse, networkx); правила именования, namespaces, циклические зависимости, диалекты Greenplum/ClickHouse.
— Логика сборки транспортных артефактов и деплоя: стратегии миграций (create / alter / skip / drop / recreate / shadow), DB locks, логирование в deployer_metadata.
— Интеграции: S3-compatible ArtifactStore (boto3; MVP — BYTEA, S3 — эволюция), Artifactory / private PyPI, GitLab CI.
— Покрытие Unit- и Integration-тестами (pytest), Code Review, рефакторинг, отладка сквозных сценариев Activate / Import / Transport / Deploy.
— Участие в Spec-Driven Development (specs, C4/Structurizr, ADR); стыковка с frontend по JSON/OpenAPI (Repository tree, OBJREQ/OBJTRAN, RUNMON, Admin).
Требования:
— Уверенный Python 3.10+ (желательно 3.11–3.13);
— Опыт FastAPI (routing, Depends, Pydantic-модели, OpenAPI, middleware, multipart upload);
— Опыт CLI (Typer / Click / argparse);
— Понимание asyncio; клиенты httpx / aiohttp для peer-вызовов; uvicorn/gunicorn для сервисов;
— Отличное знание PostgreSQL (транзакции, JSONB, индексы, advisory/FOR UPDATE locks, миграции схем — Alembic или аналог);
— Опыт работы с Greenplum/PostgreSQL DDL через драйвер (psycopg2 / psycopg3);
— Прямой SQL + понимание ORM (SQLAlchemy — плюс);
— Знание SQL / DWH-домена: схемы, таблицы, views, functions, roles, external/FDW, transforms; жизненный цикл объектов склада; чтение и составление сложных SQL;
— Парсинг и графы: sqlglot/sqlparse (или аналоги), графы зависимостей (networkx), топологический порядок выполнения;
— Валидация и конфиги: Pydantic / pydantic-settings, PyYAML, TOML; env-based конфигурация (environs / dotenv);
— Работа с артефактами и файлами: ZIP/архивы, файловая структура проектов, S3 API (boto3);
— Принципы разработки: SOLID, DRY, KISS, YAGNI; модульный дизайн; понимание Clean Architecture / hexagonal на уровне сервисов;
— Инструменты: Git, uv, packaging (Hatchling/wheel), pre-commit (black, isort, mypy), GitLab CI;
— Тестирование: pytest (+ pytest-cov, pytest-mock), Unit и Integration; умение писать тесты на API (TestClient / httpx ASGI);
— Базовые знания фронтенда: JavaScript/TypeScript, HTML/CSS, JSON/AJAX для работы с UI-командой и OpenAPI;
— Адекватная оценка сроков, ответственность за изменения, работа по Agile (Scrum/Kanban), Jira.
-Проектирование и сопровождение БД: разработка и поддержка объектов базы данных (таблицы, представления, индексы, хранимые процедуры) в среде Greenplum. -Разработка витрин данных: проектирование и расчет показателей для витрин данных под бизнес-задачи с использованием SQL.
ОфисjuniorНижний Новгород
30 000 – 40 800 ₽
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Компания Aston приглашает на позицию Дата инженер (ученик) с последующим трудоустройством.
Задачи:
— пройти онлайн-интенсив длительностью 1 месяц, изучая теорию и выполняя практические задания;
— совмещать обучение с работой;
— после успешного окончания интенсива зачисление на стажировку в Лабораторию ASTON;
— обучение на стажировке 3-4 месяца, 5 дней в неделю с 9:00 до 18:00 с перерывом на обед;
— изучение теории с еженедельными проверками;
— практика на учебных проектах под руководством опытного технического руководителя;
— подготовка к собеседованию и самопрезентации;
— посещение офиса обязательно для кандидатов, где есть офис компании;
— для кандидатов из городов без офиса обучение возможно удаленно;
— после старта на коммерческом проекте формат работы гибридный (3 дня в офисе ASTON, 2 дня удаленно) до уровня М2, затем полное посещение офиса заказчика;
— возможны командировки в Санкт-Петербург или Москву.
Требования:
— законченное высшее или среднее специальное профильное образование;
— готовность пройти стажировку в компании ASTON.
Условия:
— выплата стипендии во время обучения;
— официальное трудоустройство;
— доступ к корпоративной программе обучения;
— регулярный пересмотр и повышение зарплаты после выхода на проект;
— гарантированный финансовый бонус при старте на коммерческом проекте;
— офис в центре города, корпоративные мероприятия, частичная компенсация спортивных абонементов.
Требуемые навыки: визуализация, математическая статистика, NoSQL, Apache Hadoop, Greenplum, базы данных, Agile, Python, SQL.
Требования:
— Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
— Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
— Оптимизация SQL для highload (партиционирование, индексы, explain plans)
— Oracle (PL/SQL) и PostgreSQL
— Greenplum и/или Clickhouse
— Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
— Hadoop (HDFS) и Hive
— Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
— Опыт работы с биллинговыми системами (желательно телеком-домен)
Преимущества:
— Потоковая обработка: Kafka Streams / Spark Streaming
— Informatica PowerCenter (понимание мигрируемой системы)
— Бинарные форматы хранения в Hadoop
— Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
— Patroni для кластеризации PostgreSQL/Greenplum
— S3-хранилища
— КриптоПро или защищенные каналы передачи данных
Задачи:
— Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
— Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
— Написание и оптимизация SQL для витрин данных и ETL-процессов
— Разработка DAG-ов в Airflow
— Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
— Разработка Spark-джобов (PySpark) для больших объемов
— Интеграция с Kafka для потоковой передачи
— Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
— Разбор инцидентов по качеству данных и ошибкам загрузки
— Code review
• Администрировать и поддерживать Linux-инфраструктуру: 2 000+ виртуальных машин и 500+ физических серверов. • Работать с PostgreSQL и Greenplum, включая troubleshooting производительности и надёжности.
-Самостоятельно отвечать за аналитическую проработку домена или направления, управлять требованиями, рисками качества данных и ожиданиями заказчиков. -Декомпозировать сложные инициативы, формировать подходы к реализации.
Обязанности: Проводить самостоятельные исследования, искать точки роста и формировать рекомендации для продукта и бизнеса Анализировать влияние ассортимента на конверсию и выручку. Декомпозировать изменения ключевых метрик и находить причины.
– выполнять задачи полного жизненного цикла: от сбора требований до выкатки на установку в прод; – разрабатывать и дорабатывать витрины и решения, автоматизировать их через оркестраторы;
Проект: команда развивает аналитические продукты и сервисы для внутренних пользователей и внешних клиентов Экосистемы банка. В рамках направления участвуют в развитии внутреннего продукта – Корпоративное хранилище данных на платформах Hadoop и Greenplum. Данные используются аналитиками банка для управленческой отчетности, моделирования, data science и автоматизированных процессов. Используются данные внутренних систем банка и внешних источников (Единый государственный реестр ЮЛ/ИП, база арбитражных дел, портал госзакупок и др.).
Используемые инструменты: Hadoop, Greenplum, Oozie, Airflow, Nifi, Bash, Scala, Spark, Hive, Git, Jenkins, SonarQube.
Требования: опыт работы со Scala и sbt, стеком технологий Hadoop (HDFS, Hive, Spark версии 2 и выше, spark SQL).
Задачи:
— разработка ETL потоков на платформе Hadoop (Scala + Spark SQL);
— поиск возможностей оптимизации, повышение скорости расчёта и эффективности использования вычислительных ресурсов;
— повышение стабильности работы приложений, анализ типовых ошибок и рисков, развитие системы логирования для промышленной эксплуатации, участие в решении инцидентов;
— развитие системы контроля качества и автотестов.
Условия:
— возможность участия в интересном проекте;
— профессиональный и карьерный рост в компании;
— опыт работы в команде профессионалов;
— уровень заработной платы обсуждается индивидуально;
— формат работы офисный/гибридный в Москве;
— перспективы профессионального развития в России и зарубежных представительствах.
Задачи:
– Разрабатывать и дорабатывать ETL-процессы в Airflow
– Подключать новые источники данных
– Создавать и дорабатывать витрины
– Оптимизировать SQL-запросы в GreenPlum и PostgreSQL
– Работать с большими объемами данных
– Развивать процессы контроля качества данных
Требования:
– От 1 года опыта работы с данными
– Отличное знание SQL: JOIN, оконные функции, процедуры
– Умение профилировать и оптимизировать запросы, понимать план выполнения
– Понимание принципов работы реляционных БД и архитектуры DWH: ODS, DDS, DM
– Практический опыт работы с Airflow и ETL-процессами
– Python на базовом уровне
– Знание Linux и умение работать с командной строкой
– Опыт работы с Git
– Понимание принципов работы Docker
Требования
Опыт и роль:
- Опыт работы в роли аналитика данных не менее 3 лет в финансовых проектах с промышленным хранилищем данных.
- Самостоятельно ведет аналитический контур: от сбора и уточнения требований до постановки задач, приемки результата и сопровождения внедрения.
- Способен работать с несколькими источниками данных, выявлять противоречия в требованиях и данных, фиксировать решения в проектной документации.
- Имеет практический опыт именно в аналитике данных, а не только в системном анализе, и понимает специфику аналитических решений на базе КХД.
- Понимает банковские продукты, основные банковские операции и бизнес-процессы;
- опыт работы с финансовой отчетностью является преимуществом.
Данные и SQL:
- Уверенно работает с Greenplum или другими MPP-СУБД: сложные SQL-запросы, оконные функции, агрегаты, CTE, анализ планов выполнения на прикладном уровне.
- Понимает распределение данных, партиционирование, особенности работы с большими объемами и ограничения DWH-архитектуры.
- Участвует в проектировании витрин, моделей данных, метрик и правил расчета, понимает схемы звезда, снежинка и базовые принципы Data Vault 2.0.
- Исследует системы-источники, описывает маппинги загрузки данных в хранилище, фиксирует правила трансформации и контрольные сверки.
- Работает с большими объемами транзакционных данных, умеет выявлять аномалии, несогласованность справочников и расхождения между источниками.
BI и бизнес-анализ:
- Самостоятельно формирует требования к BI-отчетам и дашбордам, согласует метрики с заказчиком, проверяет корректность визуализаций и фильтров.
- Уверенно работает с Power BI или аналогичными BI-системами, понимает DAX, ролевые модели доступа, производительность отчетов и ограничения источников данных.
- Переводит бизнес-потребности в измеримые показатели, описывает правила расчета и критерии приемки.
- Умеет объяснять бизнес-ценность аналитического решения: сокращение ручного труда, повышение прозрачности, ускорение принятия решений.
- Участвует в переводе Excel-отчетности и ручных процессов в промышленные BI-дашборды и витрины.
Качество и взаимодействие:
- Участвует в проверке данных от начала до конца по цепочке источник - DWH - витрина - BI, формирует сценарии сверки совместно с тестировщиками и инженерами данных.
- Ведет коммуникацию с бизнес-заказчиками, разработчиками и тестировщиками, аргументированно защищает аналитические решения.
- Готовит и поддерживает аналитическую документацию в базе знаний.
- Готовит тест-кейсы и приемочные критерии для проверки метрик, витрин и отчетов; участвует во внутреннем и пользовательском тестировании.
Задачи:
— Возглавлять команду Data Scientists, участвовать в найме, онбординге и развитии сотрудников;
— Обеспечивать операционную деятельность: дейли-митинги, спринт-планирование, ретроспективы, демо;
— Формировать и развивать бэклог задач, определять приоритетные бизнес-задачи и оценивать ценность решений;
— Выстраивать кросс-функциональное взаимодействие с Data Engineering, MLOps и бизнес-подразделениями, договариваться о приоритетах и ресурсах;
— Отвечать за полный жизненный цикл моделей: сбор данных, разметка, обучение, валидация, деплой, мониторинг;
— Руководить проектированием и внедрением решений;
— Обеспечивать разработку, валидацию и мониторинг моделей, включая стандарты, политики и документооборот;
— Проводить архитектурные ревью, задавать стандарты качества кода и документации;
— Принимать участие в написании production-кода;
— Контролировать соблюдение сроков и качества результатов;
— Переводить бизнес-проблемы в технические задачи, формулировать гипотезы, определять метрики успеха и критерии приемки;
— Презентовать результаты и влияние моделей бизнес-заказчикам, защищать метрики качества;
— Отвечать за разработку и согласование единых стандартов разработки моделей внутри подразделения.
Требования:
— Высшее техническое образование в области прикладной математики, информатики, компьютерных наук или смежных дисциплин;
— Совокупный опыт в Data Science и машинном обучении от 5 лет;
— Управленческий стаж минимум 2 года на позиции тимлида или руководителя ML-подразделения с прямым подчинением инженеров и дата-сайентистов;
— Успешная реализация комплексных проектов полного цикла с выводом в промышленную эксплуатацию;
— Опыт внедрения моделей в production и построения системы мониторинга их качества;
— Глубокое владение Python и SQL;
— Практика работы с пайплайнами оркестрации (Airflow), распределённой обработкой данных (Spark), контейнеризацией (Docker) и системами контроля версий (Git);
— Опыт работы с большими данными в среде S3/Hadoop и аналитическими СУБД ClickHouse, Greenplum;
— Уверенное знание классического ML-стека: градиентный бустинг, линейные алгоритмы, а также специализированные подходы — uplift-моделирование и антифрод-системы;
— Навыки декомпозиции сложных задач, распределения нагрузки, контроля сроков и качества delivery;
— Навыки эффективного взаимодействия с бизнес-заказчиками и смежными командами (Data Engineering, MLOps, Product);
— Владение инструментами командной работы Jira и Confluence.
Условия:
— Конкурентоспособная заработная плата, ориентированная на ожидания и квалификацию кандидатов;
— ДМС со стоматологией, корпоративное обучение;
— Офис/гибридный формат работы в Москве (Москва-Сити);
— Современные технологии и подходы к ведению проектов;
— Работа в аккредитованной IT-компании.
Задачи:
— выполнять функции по автоматизации расчетов драйверных моделей
— анализ текущего процесса, который в основном реализован в Excel и SQL скриптах, разбирать логику и формулы
— поиск источников данных, анализ и репликация источников в DWH, согласование с владельцами систем
— разработка меппингов для работы с большими хранилищами и системами с более чем 500 параметрами
— создание витрин данных, проектирование и наполнение агрегированных слоев для бизнес-планирования
— внедрение автоматизированного процесса поддержки, обучение бизнес-пользователей новому формату
— прототипирование во внутренней системе (собственная разработка), создание модели планирования и запуск расчетов
Требования:
— опыт от 3+ лет в аналитике данных, бизнес-аналитике, клиентской аналитике физических лиц
— опыт работы с большими данными (Spark, Hadoop, GreenPlum, ClickHouse), знание SQL и Python
— умение визуализировать данные, писать качественные бизнес-требования на разработку дашбордов
— понимание метрик и драйверов для процессов бизнес-планирования, управления продуктом, клиентской аналитики
— опыт финансового моделирования продуктов, проектов, пилотов, инициатив
— базовые знания статистики
Будет плюсом:
— опыт работы в Banking, Retail, FinTech, E-commerce, Telecom
— знания методов cohort analysis, uplift modeling
— опыт работы с ML-моделями
Условия:
— комфортный современный офис рядом с м. Кутузовская
— ежегодный пересмотр зарплаты, годовая премия
— корпоративный спортзал и зоны отдыха
— уникальная система обучения Сбера для профессионального и карьерного развития
— расширенный ДМС и льготное страхование для семьи
— гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
— подписка Прайм с возможностью совместного использования на трёх близких
— вознаграждение за рекомендацию друзей в команду Сбера
— корпоративная пенсионная программа
Задачи:
— Валидация процессов загрузки данных
— Проверка корректности скачивания данных из внешних источников (БКИ, ЦБ, ФНС и др.)
— Контроль раскладки данных по целевым таблицам в S3/Iceberg
— Подтверждение обработки 100% входящего объёма данных
— Верификация атрибутного состава (например, отсутствие даты рождения в поле "ФИО")
— Тестирование механизмов обновления: отсутствие дубликатов при повторной загрузке
— Блокировка записей с аномалиями (ошибки источника, некорректные форматы)
— Анализ документации (ТЗ, маппинги) для проектирования тест-кейсов
— Профилирование данных: выявление шаблонов, аномалий и граничных значений
— Документирование расхождений между источниками и хранилищем
— Мониторинг задач в Airflow на предмет сбоев
— Составление отчётов о дефектах и качестве данных
Требования:
— Практическое знание SQL: продвинутый уровень, включая сложные JOIN, подзапросы, агрегатные функции, написание проверочных запросов, анализ трансформаций, выявление расхождений
— Понимание архитектуры Lakehouse (S3, Iceberg) и слоёв хранения (RAW/ODS/DDS)
— Опыт работы с БД и хранилищами: Oracle, Greenplum, PostgreSQL, S3, Airflow (мониторинг задач), Spark (понимание логики обработки)
— Опыт тестирования хранилищ данных
— Работа с форматами данных: XML, JSON, XSD/JSON-схемы
— Опыт интеграции внешних источников (БКИ, ФНС, ЦБ, API-партнёров)
— Понимание REST/SOAP API и протоколов передачи
— Стек автоматизации: Python, pandas, numpy, psycopg2, pytest, Allure, PySpark
Условия:
— Оформление в штат аккредитованной ИТ-компании по ТК РФ: полностью белая заработная плата, оплачиваемые отпускные и больничные
— Индексация заработной платы
— Расширенная программа ДМС
— Скидки на фитнес, кино и уроки английского
— Техника по требованиям проекта