Описание вакансии
Задачи:
— Быть Incident Commander при крупных инцидентах: координировать кросс-функциональные команды, вести расследование, принимать решения об эскалации, обеспечивать разрешение инцидентов в рамках SLA.
— Вести все коммуникации по инцидентам: готовить и отправлять своевременные обновления старшему руководству, Customer Success и партнёрам/клиентам, управлять обновлениями на статусной странице (status.xsolla.com).
— Проводить безвиноватые Post-Incident Reviews (PIR) для крупных инцидентов: выявлять коренные причины, назначать корректирующие действия с ответственными и сроками, отслеживать их выполнение.
— В периоды без инцидентов анализировать тренды инцидентов, повторяющиеся проблемы и баги, выявлять закономерности, создавать Problem tickets, регулярно предоставлять выводы и рекомендации продуктовым и инженерным командам.
— Обеспечивать соблюдение фреймворка управления инцидентами в организации: модель серьёзности, матрицу приоритетов, SLA, процедуры эскалации, готовность к деплою.
— Курировать и наставлять Operations Engineer на смене: обучать триажу, расследованию, выполнению runbook, качеству документации, проводить регулярные сессии передачи знаний.
— Готовить отчёты по сменам и регулярные операционные отчёты: тренды инцидентов, KPI (MTTD, MTTA, MTTR), соблюдение SLA, уровень проактивного обнаружения, анализ повторных инцидентов.
— Проводить аудит полноты каталога сервисов и управлять рабочими процессами JIRA Service Management для инцидентов, PIR и проблем.
— Замещать Operations Engineer во время отсутствия, перерывов или пиковых инцидентов.
— Участвовать в ротации дежурств по выходным для крупных инцидентов.
Требования:
— Опыт работы в игровой компании обязателен: понимание темпа, ожиданий игроков, динамики live-операций и операционных требований игровой индустрии.
— 6+ лет опыта в управлении инцидентами, SRE, руководстве NOC или технических операциях в продуктивной среде с высокодоступными и высоконагруженными системами.
— Подтверждённый опыт управления инцидентами: координация мультикомандного реагирования, принятие решений об эскалации в реальном времени, коммуникация с руководством под давлением.
— Отличные письменные и устные навыки английского языка: умение готовить чёткие обновления для руководства в любое время, проводить безвиноватые PIR, представлять операционные метрики, профессионально информировать клиентов и партнёров.
— Глубокое понимание ITIL: жизненные циклы инцидентов, проблем и изменений, практический опыт внедрения или эксплуатации ITIL-ориентированных процессов.
— Техническая экспертиза в области наблюдаемости: умение читать и интерпретировать логи, трассировки и метрики в Datadog или аналогах (Grafana, Splunk, New Relic).
— Знание APM, SLO, error budgets, burn-rate alerting, synthetic monitoring.
— Практический опыт работы с инструментами инцидент-менеджмента: Datadog, PagerDuty или OpsGenie, JIRA или JIRA Service Management, Slack, Confluence.
— Аналитический склад ума: умение выявлять тренды и повторяющиеся проблемы из данных инцидентов и переводить их в рекомендации для продуктовых и инженерных команд.
— Опыт работы с операциями, ориентированными на SLA/SLO, где измеряются и улучшаются MTTD, MTTA и MTTR.
— Готовность к круглосуточным сменам в модели follow-the-sun с перекрытиями смен.
— Обязательное участие в ротации дежурств по выходным для критических инцидентов.
Преимущества:
— Опыт коммуникаций с клиентами и партнёрами по инцидентам и управлению статусной страницей.
— Интерес или опыт в AI/ML для операций: обнаружение аномалий, корреляция алертов, предиктивный алертинг, автоматическое устранение, самовосстанавливающаяся автоматизация.
— Администрирование JIRA Service Management: рабочие процессы, таймеры SLA, правила автоматизации, очереди, права доступа.
— Знакомство с Datadog Service Catalog, scorecards и SLO, особенно burn-rate alert и мультиоконные SLO.
— Опыт построения операционной функции с нуля: определение процессов, написание runbook, установление управленческих циклов.
— Знания Kubernetes, облачной инфраструктуры (предпочтительно GCP), микросервисной архитектуры или распределённых систем.
— Сертификация ITIL (Foundation или выше) приветствуется, но не обязательна.
Условия:
— Удалённая работа.
— Зарплата в валюте.
— Программа льгот: неограниченный гибкий отпуск, абонемент в спортзал, ежемесячный проездной, персональная дорожная карта развития.
— Инвестиции в профессиональное развитие через обучение и образовательные возможности.
Контакты работодателя доступны по кнопке «Откликнуться» после входа.