Задачи:
– Разработка, создание и поддержка масштабируемых конвейеров обработки данных с использованием Apache Spark и современных платформ обработки данных.
– Разработка и оптимизация архитектур хранилищ данных для поддержки рабочих процессов анализа данных и машинного обучения.
– Внедрение моделей и структур данных, обеспечивающих качество, согласованность и доступность данных.
– Сотрудничество со специалистами по анализу данных и аналитиками для понимания потребностей в данных и предложения решений.
– Обеспечение безопасности данных и соответствия нормативным требованиям.
– Мониторинг и устранение неполадок, связанных с производительностью и надежностью конвейера обработки данных.
– Постоянное совершенствование процессов и передовых методов обработки данных.
– Взаимодействие с межфункциональными командами и участие в технических дискуссиях.
– На руководящей должности оказание технической поддержки и наставничество младших инженеров.
Требования:
– Опыт работы с Python или Scala/Java.
– Углубленные знания SQL.
– Практический опыт работы с Apache Spark, Databricks, Snowflake или Microsoft Fabric.
– Понимание концепции и архитектуры хранилища данных (data lakehouse).
– Понимание основ распределенных систем.
– Навыки моделирования данных и создания хранилищ данных.
– Опыт работы с облачными архитектурами данных на платформах AWS, Azure или GCP.
– Готовность к обучению и экспериментам с разными решениями.
– Ценить баланс между работой и личной жизнью, избегать сверхурочной работы.
– Умение просить о помощи и работать в команде.
Контакты работодателя доступны по кнопке «Откликнуться» после входа.