Задачи:
— Проектировать и запускать пакетные и потоковые конвейеры данных на Databricks и Apache Spark в AWS, включая загрузку из баз данных, API и потоков событий.
— Формировать архитектуру lakehouse на S3 и Delta Lake с использованием медальонного слоя (Bronze / Silver / Gold) и оптимизацией хранения.
— Работать напрямую с аналитиками, инженерами и продуктовыми командами для преобразования сырых данных в надежные и полезные бизнес-данные.
— Вести проекты от согласования с заинтересованными сторонами и обзора дизайна до реализации, запуска и поддержки.
— Создавать решения для самостоятельного доступа к данным для других команд, масштабируемые и расширяемые.
— Строить и поддерживать масштабируемые ETL/ELT конвейеры с отказоустойчивостью и оптимизацией затрат.
— Оптимизировать Spark задачи по размеру кластера, кэшированию, соединениям, шифлам, партиционированию и форматам хранения (Parquet, Delta).
— Управлять рабочими процессами Databricks, заданиями, конфигурациями кластеров и инфраструктурой, включая политики безопасности и доступ.
— Внедрять управление данными и контроль доступа с Unity Catalog, включая обработку персональных данных.
Требования:
— Практический опыт работы с Databricks и глубокое владение Apache Spark (PySpark и/или Scala).
— Сильные навыки Python для обработки данных, а также SQL и Spark SQL для трансформаций и аналитики.
— Опыт работы с Delta Lake и архитектурами lakehouse, включая оптимизацию производительности.
— Подтвержденный опыт владения проектами, умение выявлять слабые места, собирать обратную связь и создавать масштабируемые решения.
— Опыт написания чистого, тестируемого и поддерживаемого кода с использованием контроля версий на Git.
— Опыт работы с инфраструктурой как кодом (Terraform или Ansible) является плюсом, но не обязателен.
Условия:
— Возможность создавать инновационные решения в финтехе Юго-Восточной Азии.
— Опционы на акции с четырехлетним вестингом и 25% клиффом после первого года.
— Гибридный формат работы с возможностью полностью удаленной работы для подходящих ролей, основные часы с 12:00 до 19:00 по манильскому времени (UTC+8).
— Предоставление инструментов и оборудования компанией.
— Офис в Bonifacio Global City, Манила.
— Медицинская страховка с поддержкой для сотрудника и семьи.
— Доступ к внутреннему специалисту по психическому здоровью.
— 22 дня отпуска, государственные праздники Филиппин и 15 дней больничных.
— 105 дней оплачиваемого декретного отпуска и до 14 дней оплачиваемого отпуска по уходу за ребенком для сотрудников, переезжающих в Манилу.
— Поддержка при релокации для сотрудника и семьи, включая перелеты, проживание, визы, оформление документов и логистику.
— Возмещение расходов на перевозку домашних животных.
— Ежегодно до 2500 долларов США на перелеты домой.
— Ежемесячные выплаты на детей для сотрудников, переезжающих в Манилу: 1000 долларов на ребенка до 2 лет и 500 долларов на ребенка от 2 до 18 лет.
— Возможности для профессионального роста через внутренние встречи, внешние конференции, выступления и публикации.
— Спонсируемые компанией поездки в Манилу для личных встреч с командой.
— Регулярные командные выезды, спортивные мероприятия и события.
— Возможность для высокоэффективных команд получить неделю отдыха на пляже в Юго-Восточной Азии.
Дивизион "Моделирование и исследование данных" отвечает за компетенцию Data Science в Блоке Сеть Продаж. Мы разрабатываем и внедряем end-to-end решения на основе AI в бизнес-процессы Сети Продаж Банка. Ищем человека, вместе с которым мы будем строить топовые AI решения, на основе архитектуры Claw-like & Ouroboros, которые будут в действительности приводить к Disrupt в реальных процессах.
Задачи:
• разрабатывать с нуля AI-агентов и микросервисы для AI-продуктов
• исследовать и внедрять новейшие технологические решения в ИИ - Claw-like & Ouroboros
• разрабатывать и дообучать модели машинного обучения (Classic ML, Deep Learning)
• разрабатывать алгоритмы взаимодействия ML-моделей и сервисных модулей
• принимать участие в разработке архитектуры и дизайна агентов и AI-сервисов
• проектировать и разрабатывать backend-части AI-сервиса
• принимать участие в оптимизации скорости работы AI-агентов и ML-моделей.
Мы ожидаем:
• законченное высшее образование
• компетенции: Python, Classic ML, Deep Learning, LLM/Agents, MLOps
• понимание принципов разработки, внедрения и сопровождения AI-решений
• уметь писать хороший и понятный production-ready код на Python, хорошее знание алгоритмов, структур данных
• опыт работы с реляционными и нереляционными базами данных
• навыки работы с генеративными AI-моделями, опыт создания AI-агентов и использование их в работе будет преимуществом
• опыт использования GigaChat, Kandinsky и аналогов в продуктах
• инструментальное владение Ai для анализа, генерации и автоматизации
• опыт построения отказоустойчивых высоконагруженных распределенных ML систем.
Мы готовы предлагать:
• график 5/2, офис на м. Кутузовская;
• режим работы на выбор - офис или гибрид
• достойный уровень вознаграждения (оклад + годовая премия)
• возможность стать частью команды, реализующей программы цифровой трансформации банка - на основе передового опыта и инновационных идей
• широкие возможности для профессионального развития: корпоративный университет и множество онлайн-программ обучения. Корпоративное обучение за счет компании
• бесплатная подписка СберПрайм+, многочисленные скидки и бонусы от партнеров: СберМаркет, МегаМаркет, Самокат, Еаптека и др.
Senior Data Engineer (ML-направление) в Ozon Банк — онлайн-банк группы Ozon, предоставляющий финансовые услуги и сервисы для покупателей и продавцов маркетплейса.
ГибридseniorМосква
Зарплата не указана
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Задачи:
— Полное владение датасетами безопасности: сбор, очистка, разметка, контроль качества, версионирование и подготовка к обучению и оценке моделей.
— Перевод требований политики безопасности в четкие и последовательные критерии разметки и оценки, в тесном сотрудничестве со специалистами по политике.
— Проектирование и управление процессами разметки, включая поиск, адаптацию и контроль внешних участников для обеспечения высокого качества.
— Создание рабочих процессов оценки моделей в продакшене с использованием реальных данных для отслеживания производительности и выявления проблем.
— Разработка легковесных пайплайнов и инструментов на Python и SQL для ускорения и воспроизводимости работы с данными, в партнерстве с ML-инженерами по требованиям к "готовности к обучению".
Требования:
— Опыт работы Data Scientist или аналогичной роли с реальными датасетами и ML-моделями.
— Глубокое понимание качественного датасета: сбор, очистка, выборка, разметка, контроль качества, оценка.
— Уверенное владение Python и SQL для анализа и практических рабочих процессов с данными.
— Сильное критическое мышление и способность принимать решения в условиях неоднозначности, умение превращать сложные руководства в последовательные и масштабируемые решения.
— Автономность и хорошие коммуникативные навыки, способность работать в междисциплинарной команде (политика, инженерия, исследования) в быстро меняющейся среде.
Преимущества:
— Опыт в AI safety, trust & safety, модерации контента или обнаружении мошенничества/злоупотреблений.
— Опыт создания датасетов или фреймворков оценки, опыт с adversarial/safety-ориентированным ML.
— Опыт управления процессами разметки с участием человека, версионирования датасетов или инструментов ML-пайплайнов.
— Опыт внедрения руководств совместно с командами политики или юридическими отделами.
Условия:
— Работа в гибридном формате в Лондоне, тесное взаимодействие с командами AI Safety и Policy.
— Равные возможности для всех кандидатов без дискриминации по различным признакам.
Mycar Digital — цифровой проект для автомобилистов: маркетплейс по продаже и покупке авто, автоматизация бизнес-процессов, автокредитование и дилерские центры.
Формат работы: гибрид (Алматы, Казахстан).
Задачи:
- Развивать корпоративное хранилище данных: проектировать слои, схемы, таблицы и представления, оптимизировать структуру хранения;
- Разрабатывать и сопровождать витрины данных для аналитики;
- Проектировать и разрабатывать процессы загрузки данных из разнородных источников;
- Настраивать потоки передачи данных между системами: интеграции, синхронизация, обработка ошибок;
- Строить дашборды, алертинг и мониторинг;
- Обеспечивать наблюдаемость пайплайнов: контроль качества данных, отслеживание задержек и сбоев загрузок;
- Проводить аудит текущих решений, выявлять точки роста;
- Собирать и уточнять требования к данным вместе с аналитиками и бизнес-заказчиками;
- Участвовать в анализе данных: выявление зависимостей, построение логических связей, подготовка данных для аналитики.
Требования:
- 4+ года коммерческого опыта в роли Data Engineer;
- Понимание принципов построения DWH (Kimball / Inmon, star schema, ETL/ELT);
- Опыт построения систем мастер-данных;
- Умение самостоятельно превратить размытую бизнес-задачу в модель данных и план работ.
Будет плюсом:
- Опыт ответственности за архитектуру хранилища или крупного домена целиком;
- Внимание к качеству данных как отдельной задаче: проверки, SLA, договорённости с владельцами источников;
- Опыт с ML и Computer Vision.
Условия:
- Комфортный офис в Mega Alma-Ata с паркингом и видом на горы;
- Гибридный формат работы;
- Официальное трудоустройство, медстраховка для вас и близких, компенсация фитнеса.
Задачи:
— Проектировать и реализовывать end-to-end LLM-пайплайны, включая продвинутые RAG-системы и автономных AI-агентов (планирование, function calling, мультиагентная оркестрация)
— Дообучение и адаптация: SFT/RLHF/DPO, LoRA/QLoRA под бизнес-задачи; решать, когда нужно дообучение, а когда достаточно промпт-инжиниринга или RAG
— Поддерживать культуру качества: внедрять продуктовые и ML-метрики (RAGAS, DeepEval, LLM-as-a-Judge), автоматизировать регрессионное тестирование
— Писать чистый, документированный и тестируемый python-код, проектировать API-контракты для ML-компонент
— Участвовать в код-ревью, формировать технические стандарты команды, работать напрямую с продуктом и стейкхолдерами
Требования:
— Опыт в DL/NLP от 4 лет, включая обучение и дообучение моделей на PyTorch, из них не менее года практического опыта с LLM
— Практический опыт построения AI-агентов и LLM-пайплайнов с использованием LangChain/LangGraph
— Глубокое понимание архитектуры современных LLM: attention, MoE, RoPE, KV-cache, методы alignment (RLHF/DPO), принципы эффективного инференса
— Сильная инженерная культура: Python (asyncio, pydantic, fastapi), чистый тестируемый код (pytest), асинхронные микросервисы; понимание Docker/K8s, CI/CD для ML
— Оценка и мониторинг: уверенное владение инструментами LLMOps (Arize, LangSmith, W&B, Phoenix), опыт создания кастомных eval-пайплайнов
— Работа с данными: опыт предобработки сложных данных для датасетов, знание SQL