Задачи: — развёртывать, настраивать и сопровождать Langfuse в защищённых контурах Банка, включая настройку зависимых компонентов: PostgreSQL, ClickHouse, Redis и объектного хранилища; — организовывать интеграцию с Apache Kafka: создавать и сопровождать топики, настраивать ACL, consumer groups, retention, репликацию, DLQ/retry-механизмы, мониторить Kafka lag; — поддерживать потоки телеметрии моделей: результаты работы классических ML-моделей, LLM traces, события RAG-пайплайнов, метрики качества, технические логи и алерты; — развёртывать и эксплуатировать сервисы в Kubernetes/OpenShift: namespaces, RBAC, Secrets, ConfigMaps, Ingress, resource limits/requests, autoscaling и сетевые политики; — разрабатывать и сопровождать Helm-чарты, Kubernetes-манифесты и шаблоны конфигурации для dev/test/preprod/prod-контуров; — строить и поддерживать CI/CD- и GitOps-конвейеры: сборка, тестирование, сканирование, публикация артефактов, деплой и rollback; — автоматизировать инфраструктуру и конфигурации с использованием Ansible, Terraform или аналогичных средств; — настраивать мониторинг, централизованное логирование и алертинг: Prometheus, Grafana, Alertmanager, ELK/Opensearch или аналоги; — сопровождать и проводить первичную оптимизацию PostgreSQL, ClickHouse, Redis, Kafka, Nginx/Ingress и смежных инфраструктурных компонентов; — обеспечивать отказоустойчивость, резервное копирование, восстановление и планирование ресурсов платформы; — участвовать в разборе инцидентов, готовить RCA, runbook’и и мероприятия по предотвращению повторных сбоев; — обеспечивать требования ИБ: управление доступами, секретами, сертификатами, сетевой сегментацией, аудитом и устранением уязвимостей; — вести эксплуатационную и техническую документацию по сервисам, интеграциям и процедурам сопровождения. Требования: — опыт работы DevOps/SRE-инженером от 5-ти лет; — практический опыт эксплуатации Kubernetes или OpenShift в production-среде: Helm, RBAC, networking, autoscaling, диагностика и настройка ресурсов; — уверенное знание Linux, Docker, Git, Bash и основ сетевого взаимодействия: TCP/IP, DNS, HTTP(S), TLS, reverse proxy; — практический опыт работы с Apache Kafka: топики, партиции, репликация, consumer groups, ACL, retention, мониторинг и устранение инцидентов; — опыт построения и сопровождения CI/CD-пайплайнов на Jenkins, GitLab CI, TeamCity, Argo CD или аналогичных инструментах; — знание и практическое применение Ansible, Terraform либо других IaC-инструментов; — опыт настройки мониторинга и observability: Prometheus, Grafana, Alertmanager, централизованное логирование, трассировка; — опыт эксплуатации PostgreSQL; понимание принципов работы ClickHouse и Redis; — умение автоматизировать рутинные операции с помощью Python и Bash; — понимание принципов высоконагруженных и распределенных систем; — знание подходов к безопасной эксплуатации: управление секретами, сертификатами, доступами, уязвимостями и журналированием действий; — навыки технической коммуникации: взаимодействие с командами разработки, архитекторами, ИБ, администраторами платформы и владельцами интеграций. Будет плюсом: — опыт работы в крупных FinTech-компаниях; — знание Groovy. Условия: — уровень зарплаты обсуждается индивидуально, есть доплаты за менторство и профактивности; — долгосрочные проекты от российских заказчиков, возможность менять направления, прозрачная система Performance Review; — релокейт между офисами, выбор формата работы (удалённо, офис, гибрид), адаптация для новых сотрудников; — доступ к корпоративному порталу, митапам, конференциям (и как гость, и как спикер); — ДМС со стоматологией, частичная компенсация спорта, бесплатный английский, оплачиваемый отпуск и больничные; — тимбилдинги, детские праздники, внутренние мероприятия; — офисы в Москве, Санкт-Петербурге, Казани, Нижнем Новгороде, Самаре.
Зарплата не указана