Задачи:
— развитие и тюнинг моделей ранжирования и рекомендаций
— разработка новых ML-решений и feature engineering
— прототипирование и внедрение моделей в production на Python
— работа с обучающими выборками и анализ результатов A/B-тестов
— улучшение продуктовых метрик
Требования:
— опыт внедрения ML-моделей в production
— знание основных методов и алгоритмов ML
— понимание нейросетевых моделей для обработки текста
— уверенный Python (NumPy, SciPy, PyTorch, scikit-learn)
— знание алгоритмов и структур данных
— опыт с A/B-тестами
Условия:
— работа в команде экспертов
— широкий технологический стек, сотни проектов
— гибкий график работы
— льготы и меры господдержки, предусмотренные для IT-компаний (аккредитованы Минцифры)
— возможность разрабатывать IT-решения для разных отраслей, пробовать новые технологии
— процессы удаленной работы и просторные офисы с зонами коворкинга
— возможность профессионального роста: стать тимлидом, архитектором, разработчиком full-stack
— развитая система наставничества, сертификация за счёт компании, участие в конференциях, изучение английского языка
— активный обмен опытом, митапы, хакатоны, доклады по развитию hard и soft skills
— 50+ клубов по интересам и профессиональных сообществ внутри компании
— уютный мерч
— полный соцпакет и «белая» зарплата
— корпоративная база знаний и социальная сеть для общения с 1500+ сотрудниками
Описание вакансии Общие обязанности: Руководство распределенной командой Постановка задач, распределение ролей и контроль выполнения работ в соответствии с установленными сроками. Проведение ревью кода и архитектурных решений, обеспечение высокого качества разрабатываемых решений.
Удалённоlead
Зарплата не указана
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Компания TWINBY разрабатывает современное мобильное приложение для знакомств, которое соединяет пользователей, ориентируясь не на внешность или случайные фотографии, а на их психологическую совместимость. Вакансия предполагает удалённую работу в роли Data Engineer, где специалист будет заниматься обработкой и анализом данных, необходимым для функционирования сервиса.
– Разработка, создание и поддержка надежных конвейеров обработки данных и процессов ETL/ELT для поддержки различных источников данных, включая структурированные и неструктурированные данные, с обеспечением высокого качества и целостности данных. Хороший опыт работы с Databricks.
• Разработка моделей эластичности для различных групп клиентов, кластеризации клиентов по их поведенческим характеристикам. • Разработка поведенческих моделей для прогнозирования динамики объемов различных сегментов розничного портфеля Банка в множестве сценариев на периоде жизни портфеля.
Требования:
— Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
— Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
— Оптимизация SQL для highload (партиционирование, индексы, explain plans)
— Oracle (PL/SQL) и PostgreSQL
— Greenplum и/или Clickhouse
— Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
— Hadoop (HDFS) и Hive
— Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
— Опыт работы с биллинговыми системами (желательно телеком-домен)
Преимущества:
— Потоковая обработка: Kafka Streams / Spark Streaming
— Informatica PowerCenter (понимание мигрируемой системы)
— Бинарные форматы хранения в Hadoop
— Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
— Patroni для кластеризации PostgreSQL/Greenplum
— S3-хранилища
— КриптоПро или защищенные каналы передачи данных
Задачи:
— Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
— Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
— Написание и оптимизация SQL для витрин данных и ETL-процессов
— Разработка DAG-ов в Airflow
— Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
— Разработка Spark-джобов (PySpark) для больших объемов
— Интеграция с Kafka для потоковой передачи
— Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
— Разбор инцидентов по качеству данных и ошибкам загрузки
— Code review
-Разработка генеративных ИИ-моделей для синтеза визуального и проектного контента на основе структурированных данных товарного каталога в рамках проверки гипотез (PoC) внутри корпоративной платформы по оценке ИИ-инициатив. -Построение системы метрик: разработка офлайн- и онлайн-показателей, кросс-валидация, прямая оценка бизнес-эффекта.
Ищем сильного Data-инженера для прототипирования корпоративных AI-ассистентов. Это роль на стыке классического DE и AI: нужно не просто строить пайплайны, но и готовить контекст для LLM, оценивать качество RAG и бороться с галлюцинациями.
-Design, build, and maintain data infrastructure and pipelines spanning both batch and real-time / streaming workloads, contributing to architectural decisions along the way. -Build and maintain scalable, efficient, and reliable ETL/ELT pipelines using languages and frameworks such as Python, SQL, Spark, Flink, Beam, or equivalents.
– выполнять задачи полного жизненного цикла: от сбора требований до выкатки на установку в прод; – разрабатывать и дорабатывать витрины и решения, автоматизировать их через оркестраторы;
Компания Dandelion, специализирующаяся на разработке продуктов в области клинического искусственного интеллекта, ищет специалиста по обработке естественного языка и большим языковым моделям (NLP / LLM Data Scientist). В рамках работы необходимо использовать возможности медицинских данных для создания инновационных решений, которые принесут пользу пациентам и сообществам. Работа предполагает удалённый формат для сотрудников из США с гибким графиком. Кандидат должен обладать навыками в области анализа и обработки данных, связанных с NLP и большими языковыми моделями, а также иметь опыт работы с медицинскими данными и соответствующими технологиями.