Описание вакансии
Задачи:
— развёртывать, настраивать и сопровождать Langfuse в защищённых контурах Банка, включая настройку зависимых компонентов: PostgreSQL, ClickHouse, Redis и объектного хранилища;
— организовывать интеграцию с Apache Kafka: создавать и сопровождать топики, настраивать ACL, consumer groups, retention, репликацию, DLQ/retry-механизмы, мониторить Kafka lag;
— поддерживать потоки телеметрии моделей: результаты работы классических ML-моделей, LLM traces, события RAG-пайплайнов, метрики качества, технические логи и алерты;
— развёртывать и эксплуатировать сервисы в Kubernetes/OpenShift: namespaces, RBAC, Secrets, ConfigMaps, Ingress, resource limits/requests, autoscaling и сетевые политики;
— разрабатывать и сопровождать Helm-чарты, Kubernetes-манифесты и шаблоны конфигурации для dev/test/preprod/prod-контуров;
— строить и поддерживать CI/CD- и GitOps-конвейеры: сборка, тестирование, сканирование, публикация артефактов, деплой и rollback;
— автоматизировать инфраструктуру и конфигурации с использованием Ansible, Terraform или аналогичных средств;
— настраивать мониторинг, централизованное логирование и алертинг: Prometheus, Grafana, Alertmanager, ELK/Opensearch или аналоги;
— сопровождать и проводить первичную оптимизацию PostgreSQL, ClickHouse, Redis, Kafka, Nginx/Ingress и смежных инфраструктурных компонентов;
— обеспечивать отказоустойчивость, резервное копирование, восстановление и планирование ресурсов платформы;
— участвовать в разборе инцидентов, готовить RCA, runbook’и и мероприятия по предотвращению повторных сбоев;
— обеспечивать требования ИБ: управление доступами, секретами, сертификатами, сетевой сегментацией, аудитом и устранением уязвимостей;
— вести эксплуатационную и техническую документацию по сервисам, интеграциям и процедурам сопровождения.
Требования:
— опыт работы DevOps/SRE-инженером от 5-ти лет;
— практический опыт эксплуатации Kubernetes или OpenShift в production-среде: Helm, RBAC, networking, autoscaling, диагностика и настройка ресурсов;
— уверенное знание Linux, Docker, Git, Bash и основ сетевого взаимодействия: TCP/IP, DNS, HTTP(S), TLS, reverse proxy;
— практический опыт работы с Apache Kafka: топики, партиции, репликация, consumer groups, ACL, retention, мониторинг и устранение инцидентов;
— опыт построения и сопровождения CI/CD-пайплайнов на Jenkins, GitLab CI, TeamCity, Argo CD или аналогичных инструментах;
— знание и практическое применение Ansible, Terraform либо других IaC-инструментов;
— опыт настройки мониторинга и observability: Prometheus, Grafana, Alertmanager, централизованное логирование, трассировка;
— опыт эксплуатации PostgreSQL; понимание принципов работы ClickHouse и Redis;
— умение автоматизировать рутинные операции с помощью Python и Bash;
— понимание принципов высоконагруженных и распределенных систем;
— знание подходов к безопасной эксплуатации: управление секретами, сертификатами, доступами, уязвимостями и журналированием действий;
— навыки технической коммуникации: взаимодействие с командами разработки, архитекторами, ИБ, администраторами платформы и владельцами интеграций.
Будет плюсом:
— опыт работы в крупных FinTech-компаниях;
— знание Groovy.
Условия:
— уровень зарплаты обсуждается индивидуально, есть доплаты за менторство и профактивности;
— долгосрочные проекты от российских заказчиков, возможность менять направления, прозрачная система Performance Review;
— релокейт между офисами, выбор формата работы (удалённо, офис, гибрид), адаптация для новых сотрудников;
— доступ к корпоративному порталу, митапам, конференциям (и как гость, и как спикер);
— ДМС со стоматологией, частичная компенсация спорта, бесплатный английский, оплачиваемый отпуск и больничные;
— тимбилдинги, детские праздники, внутренние мероприятия;
— офисы в Москве, Санкт-Петербурге, Казани, Нижнем Новгороде, Самаре.