Задачи:
- Определять и поддерживать SLO, SLI и error budgets, а также обеспечивать наблюдаемость (метрики, логи, трассировки, оповещения) для своевременного обнаружения регрессий.
- Создавать повторяемую, самообслуживаемую инфраструктуру с помощью инфраструктуры как кода, CI/CD и золотых путей.
- Полностью управлять процессом развертывания: прогрессивная доставка, канареечные релизы, безопасные миграции и откаты.
- Эксплуатировать системы, обеспечивающие работу узлов, валидаторов, RPC и индексирования Somnia, оптимизируя производительность и затраты в разных регионах.
- Руководить реагированием на инциденты и дежурствами, проводить безвиновные постмортемы, постоянно укреплять платформу.
- Сотрудничать с командами продукта и протокола для проектирования и эксплуатации готовых к производству сервисов.
Требования:
- Опыт эксплуатации производственной инфраструктуры в масштабе (облако и/или bare metal) с глубокими знаниями Linux.
- Опыт работы с инфраструктурой как кодом, например Terraform или Pulumi, а также с системами управления конфигурациями.
- Опыт эксплуатации контейнеров и оркестрационных платформ (Docker, Kubernetes) в продакшене.
- Сильные навыки программирования, желательно на Go и/или TypeScript, для создания автоматизации и внутренних инструментов.
- Опыт работы с системами наблюдаемости (Prometheus, Grafana, OpenTelemetry или аналогами).
- Опыт эксплуатации и мониторинга распределённых систем, включая планирование ёмкости и оптимизацию производительности.
- Искренний интерес к криптовалютам и on-chain системам.
Будет плюсом: опыт эксплуатации инфраструктуры блокчейн-узлов (валидаторы, RPC, архивные узлы); опыт высокопроизводительных сетей или балансировки нагрузки в масштабе; мульти-региональные развертывания с отказоустойчивостью; безопасность и управление ключами (HSM, управление секретами).
Контакты работодателя доступны по кнопке «Откликнуться» после входа.