Задачи:
– Полностью контролировать платформу Proxmox и Ceph — управление мощностью, обновлениями, производительностью и реагированием на инциденты.
– Запускать инфраструктуру на платформах OVH, Hetzner и физических серверах, а также рабочие нагрузки в AWS и GCP.
– Оптимизировать ресурсы: выявлять случаи переплаты, определять оптимальные параметры и доказывать экономию на счетах.
– Обеспечивать разделение рабочих нагрузок разработки на выделенный кластер без простоев в производственной среде.
– Всё делать в виде кода — Terraform, Ansible, ArgoCD и GitLab CI, без ручных изменений в продакшене.
– Обеспечивать собственную надежность: дежурство, реагирование на инциденты, анализ первопричин и следование инструкциям по действиям.
– Поддерживать уровень данных, на котором работает продукт — PostgreSQL, ClickHouse, Aerospike.
Требования:
– Более 10 лет опыта работы с инфраструктурой и физическим оборудованием, не только в сфере управляемых облачных решений.
– Более 5 лет опыта работы с Kubernetes и облачными платформами в производственной среде.
– Практический опыт работы с физическими серверами и провайдерами OVH и Hetzner, а также с AWS и/или GCP.
– Уверенное владение Terraform, Ansible, ArgoCD и GitLab CI — инфраструктура описывается в коде.
– Реальный опыт работы в сфере финансовых операций: способность назвать стоимость инфраструктуры до и после изменений.
– Способность доводить проблемы до первопричины и находить пути решения, включая за пределами формальной компетенции.
– Открытость в коммуникации: риски и плохие новости сообщаются на ранних этапах, а не после инцидента.
Контакты работодателя доступны по кнопке «Откликнуться» после входа.