О проекте
Приглашаем DevOps / SRE инженеров в команду сопровождения бизнес-приложений. Предстоит заниматься сопровождением крупной корпоративной системы на базе ELMA365 и связанных с ней сервисов и интеграций.
Команда DevOps отвечает за инфраструктурную часть: Kubernetes, CI/CD, развёртывание приложений и сопровождение релизов. Поддержка непосредственно коробочного решения ELMA365 осуществляется на стороне вендора. Это расширение существующей команды. Рассматриваем специалистов уровня Middle / Middle+ / Senior. В приоритете опытные и самостоятельные инженеры.
Задачи:
— сопровождение Kubernetes-кластеров;
— развёртывание приложений и сервисов на стендах;
— раскатка и обновление релизов;
— настройка и сопровождение CI/CD-процессов;
— разработка и поддержка Jenkins pipelines;
— работа с Helm;
— выполнение change-задач;
— сопровождение существующей инфраструктуры;
— диагностика проблем в работе приложений и сервисов;
— анализ логов и состояния сервисов;
— участие во второй линии поддержки;
— взаимодействие с разработчиками, системными администраторами, архитекторами, инфраструктурными командами и другими смежными подразделениями;
— автоматизация рутинных операций;
— подготовка и актуализация технической документации.
Технологический стек:
Основной стек:
Kubernetes 1.33 Cloud;
Helm;
Jenkins / CI/CD;
Linux;
Docker.
Также используются:
Ansible;
Nexus / Docker Registry;
Bitbucket;
Zabbix;
Grafana / Prometheus;
ELK;
Jira / Service Desk.
Требования
— коммерческий опыт работы DevOps / SRE;
— уверенное практическое знание Kubernetes;
— опыт самостоятельного развёртывания и настройки Kubernetes-кластеров;
— опыт deployment приложений в Kubernetes;
— уверенное владение Helm;
— опыт работы с CI/CD;
— практический опыт работы с Jenkins;
— знание Linux на уровне администратора;
— понимание принципов работы микросервисных и клиент-серверных приложений;
— способность самостоятельно разбираться в проблемах и доводить задачи до результата;
— хорошие навыки коммуникации и взаимодействия со смежными командами.
Будет преимуществом:
— умение самостоятельно писать Dockerfile;
— опыт автоматизации с помощью Ansible;
— опыт работы с Nexus / Docker Registry;
— Bitbucket;
— Prometheus / Grafana;
— Zabbix;
— ELK;
— опыт работы с enterprise-приложениями;
— использование генеративных AI-инструментов в работе;
— опыт создания AI-агентов.
Команда и формат работы:
Вы будете работать в команде DevOps из 14 специалистов.
За отдельными системами закреплены свои DevOps-инженеры. В работе также участвуют отдельные команды инфраструктуры, системного администрирования, информационной безопасности и архитектуры.
Работа организована по задачам: дейлики, спринты, change-задачи и сопровождение систем.
Дежурств и on-call в рамках позиции нет — за реагирование на алерты и инциденты отвечает отдельное подразделение.
Условия:
— полностью удалённая работа из любой точки РФ;
— общие очные встречи команды ориентировочно 1 раз в квартал;
— официальное оформление;
— ДМС с первого дня;
— льготные ипотечные условия кредитования;
— корпоративная пенсионная программа;
— скидки на продукты компаний-партнёров;
— обучение за счёт компании: онлайн-курсы, корпоративная библиотека, корпоративный университет, тренинги и митапы;
— возможность профессионального развития и получения новой квалификации.
Garner Health is a healthcare technology startup focused on reducing employee health insurance costs for large companies by transforming the U.S. healthcare system using proprietary clinical metrics and AI.
About the role:
We are seeking a Senior Site Reliability Engineer to own the reliability, performance, and resilience of the cloud infrastructure powering Garner’s products and AI/ML workloads. This role is part of the Platform Engineering team and involves defining and upholding SLOs, leading incident response, and driving automation and standards to enable faster and more reliable shipping by engineers. The role emphasizes automation-first approaches using AI tools to convert manual operational work into monitored, hands-free processes.
Responsibilities:
— Own end-to-end reliability, performance, and resilience of cloud environments (AWS, Kubernetes), including AI/ML workloads
— Define, measure, and uphold SLOs across critical services
— Lead incident response, participate in on-call rotation, conduct root cause analysis, and review infrastructure changes
— Build and maintain monitoring, alerting, and observability systems
— Translate scaling requirements into automated infrastructure-as-code deliverables using Terraform
— Identify and implement cost-efficiency and performance improvements across the stack
— Reduce operational toil and tech debt through AI-driven automation
— Build and maintain deployment and observability standards to empower engineering teams
— Ensure infrastructure and operations comply with security and HIPAA requirements
Requirements:
— 4+ years of hands-on experience operating production cloud infrastructure at scale in SRE, DevOps, or platform engineering roles
— Deep expertise with Kubernetes and Terraform in cloud-first environments (AWS preferred)
— Strong experience with production observability: defining SLOs, monitoring, alerting, incident response, and blameless post-incident reviews
— Strong software engineering skills in Python or Go applied to infrastructure automation; experience with Kubernetes APIs is a plus
— Experience optimizing cloud cost and performance across compute, storage, and networking
— Experience supporting AI/ML or data-intensive workloads in production is a plus
— Experience in security-conscious or regulated environments (HIPAA, SOC 2) is a plus
— Familiarity or strong motivation to use AI tools (e.g., Claude) for engineering and operations workflows
— Commitment to high performance, accountability, and authentic feedback
Technologies used:
AWS, Kubernetes, Terraform, Istio, Python, Go, TypeScript, Postgres, NATS, Datadog, GitLab
Additional information:
— Remote position with occasional travel to NYC headquarters
— No visa sponsorship available
— Compensation range: $191,000 - $226,000 per year plus equity and benefits including flexible PTO, medical/dental/vision plans, 401(k) with company match, flexible spending accounts, and Teladoc Health
— Equal Employment Opportunity employer committed to diversity and accommodations for disabilities