Задачи:
— Проектирование контейнерной инфраструктуры с нуля, включая архитектуру Kubernetes-кластеров (выбор CNI-плагинов, сетевых политик, систем мониторинга).
— Создание шаблонов и стандартов для деплоя приложений с использованием Helm.
— Интеграция инфраструктуры с гибридной средой (On-premise + Cloud) и существующими сетевыми политиками в координации с администраторами сетей.
— Разработка регламентов и политик безопасности: формирование стандартов безопасности (hardening образов, RBAC), создание документации и процессов для CI/CD (Gitlab CI), управления секретами (Vault), резервного копирования.
— Внедрение политик сетевой безопасности (Network Policies) и механизмов контроля трафика (Ingress/Egress).
— Автоматизация инфраструктуры с помощью IaC (Terraform для облака, Ansible для конфигураций).
Требования:
— Опыт построения систем с нуля.
— Проектирование Kubernetes-инфраструктуры в гибридных средах.
— Разработка политик безопасности и стандартов для контейнеризированных приложений.
— Знание Kubernetes (архитектура кластеров, CSI, CRD, CNI: Calico/Cilium).
— Владение Helm, Terraform, Ansible.
— Опыт работы с Gitlab CI.
— Умение согласовывать требования между DevOps, сетевыми администраторами и ИБ.
— Практика документирования архитектурных решений и регламентов.
— Желательно: развертывание Service Mesh (Istio), Bash/Python для автоматизации.
— Ключевые компетенции: системное мышление, способность проектировать масштабируемую и отказоустойчивую инфраструктуру, умение формализовать бизнес-требования в технические спецификации.
Условия:
— Официальное оформление согласно ТК РФ в штат ИТ-аккредитованной компании.
— Конкурентный уровень заработной платы и ежегодная индексация.
— Выплата белой заработной платы 2 раза в месяц без задержек.
— Годовая премия.
— ДМС со стоматологией, материальная помощь при необходимости.
— График работы 5/2 с 9:00 до 18:00.
Задачи:
— Подготовка деплой-пакетов и конфигураций, создание и поддержка Helm-чартов, Kubernetes-манифестов, стандартизация конфигураций; управление секретами, сертификатами и переменными окружения
— Управление инфраструктурой как код (IaC): разработка и поддержка Terraform-модулей, Ansible-ролей для развертывания и настройки инфраструктуры (bare-metal, cloud, виртуализация)
— Администрирование платформ оркестрации: установка, настройка и эксплуатация Kubernetes-кластеров (в том числе управление узлами, сетевыми политиками, storage, обновлениями)
— Настройка наблюдаемости (observability): реализация сбора метрик, логирования и трассировки; настройка мониторинга (Prometheus/Victoria Metrics), алертинга (Alertmanager), визуализации (Grafana); обеспечение выполнения SLO/SLA
— Обеспечение безопасности инфраструктуры: контроль доступа (RBAC, network policies), управление секретами, настройка политик безопасности подов, сканирование уязвимостей образов и конфигураций; участие в DevSecOps-практиках
— Подготовка эксплуатационной документации и реагирование на инциденты: разработка runbook, процедур восстановления, участие в устранении инцидентов и постмортемах; поддержка готовности сервисов к продуктивной эксплуатации
— Оптимизация ресурсов и надежности: мониторинг утилизации ресурсов, планирование емкости, оптимизация затрат (cost management) для облачных и on-prem решений; поддержка регулярных релизов и обновлений
— Взаимодействие с командами разработки: консультирование по DevOps-практикам, совместная работа над архитектурой приложений, внедрение стандартов и инструментов, повышение культуры автоматизации
— Участие в архитектурных решениях и планировании: оценка новых технологий, проектирование инфраструктуры, участие в формировании требований к доступности и производительности, декомпозиция технических задач
Требования:
— Опыт разработки и поддержки CI/CD пайплайнов (Jenkins, GitLab CI)
— Уверенное владение Kubernetes: развертывание, настройка, управление кластерами, работа с Helm, операторами, сетевыми политиками
— Практический опыт с Infrastructure as Code (Terraform, Ansible) — автоматизация развертывания инфраструктуры и конфигураций
— Знание принципов observability: настройка Prometheus/Victoria Metrics, Grafana, Loki/ELK, Alertmanager, трассировка
— Опыт работы с системами управления секретами (Hashicorp Vault, Kubernetes Secrets, внешние хранилища) и сертификатами
— Понимание подходов DevSecOps: управление доступом, network policies, сканирование уязвимостей (SAST/DAST), работа с инструментами безопасности
— Знание Git, работа с ветвлением, стратегии управления релизами
Желательные навыки:
— Опыт внедрения прогрессивных стратегий доставки (canary, blue-green, A/B) с использованием Argo Rollouts, Istio, Flagger
— Знание SQL/NoSQL баз данных (PostgreSQL, MongoDB) на уровне администрирования и оптимизации
— Опыт работы с Kafka (настройка, мониторинг, управление топиками)
— Навыки написания runbook и документации, участие в постмортемах
Задачи:
— Обеспечение CI/CD-цикла по всем требованиям Банка на проекте АС AI HUB Блока Строительство;
— Взаимодействие с разработчиками для оптимизации процессов сборки, развертывания и тестирования ПО;
— Автоматизация процессов управления конфигурациями;
— Соблюдение требований технических стандартов и метрик по всем вверенным системам;
— Участие в формировании жизненного цикла системы, оптимизация производственного процесса;
— Мониторинг и улучшение производительности систем, обеспечение отказоустойчивости и масштабируемости инфраструктурных компонентов;
— Диагностика и устранение критичных сбоев и неполадок, работа над предотвращением ошибок;
— Внедрение современного технологического стека, пилотирование перспективных решений (в т.ч. GenAI) в периметре ДИТ.
Требования:
— Готовность к офисному формату работы;
— Знания сетевых технологий, протоколов;
— Знания операционных систем Linux семейства RHEL;
— Опыт администрирования СУБД PostgreSQL, как дополнительный плюс знания СУБД ClickHouse, Opensearch, Apache Ignite, Redis;
— Понимание принципов работы векторных поисковиков (Qdrant, Pinecone, Weaviate и др.);
— Опыт работы с современными методами работы с информацией (Retrieval-Augmented Generation, Semantic Search);
— Знания систем контроля версий, в частности git. Знание методологий ветвления GitFlow, Trunk Based Development, а также методологии GitOps;
— Опыт работы с ArgoCD, Jenkins, SonarQube, Hashicorp Vault, Apache Superset;
— Опыт работы с Docker, Docker-compose, Kubernetes, как дополнительный плюс работы с Istio и EnvoyProxy;
— Опыт работы с Jira и подобными инструментами.
Условия:
— Офисный формат работы (г. Москва, ш Варшавское Бизнес-центр Чайка Плаза, 25Астр6);
— Льготные ипотечные условия кредитования;
— Подписка Прайм с возможностью совместного использования на трёх близких;
— Скидки на продукты компаний – партнеров: Okko, Сбер Маркет, Мега Маркет, Самокат, Еаптека и другие;
— ДМС с первого дня и скидки на страхование для близких;
— Корпоративная пенсионная программа;
— Детский отдых и подарки за счет Компании;
— Обучение за счет Компании, Онлайн курсы, неограниченный доступ к библиотеке и обучение на базе Корпоративного университета, тренинги, митапы и возможность получить новую квалификации.
ОфисmiddleМосква
Зарплата не указана
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Задачи:
— Создание, разработка и управление масштабируемой инфраструктурой AWS.
— Создание и поддержка эффективных CI/CD пайплайнов для оптимизации развертывания приложений.
— Мониторинг и быстрое решение проблем с приложениями и инфраструктурой.
— Взаимодействие с кросс-функциональными командами для обеспечения плавной интеграции и развертывания ПО.
— Обеспечение соблюдения политик безопасности и лучших отраслевых практик.
— Автоматизация процессов развертывания инфраструктуры и приложений.
— Обеспечение устойчивости и доступности производственных систем.
Требования:
— Опыт работы более 5 лет в области облачных технологий, инфраструктуры или разработки ПО.
— Глубокие знания AWS сервисов: EC2, S3, RDS, CloudFront, VPC, Lambda и др.
— Владение инструментами Infrastructure as Code (IaC): Ansible, Terraform, AWS CDK.
— Опыт работы с контейнеризацией и оркестрацией: Docker, Kubernetes (EKS/ECS).
— Знание скриптовых языков: Python, Bash, Golang.
— Опыт работы с CI/CD инструментами: Gitlab, Gitlab-CI, FluxCD(v2).
— Хорошее понимание сетевых принципов и протоколов.
— Знание Service Mesh, в частности Istio.
— Опыт работы с инструментами мониторинга: Prometheus, VictoriaMetrics, AlertManager, Grafana.
— Способность работать в динамичной, быстро меняющейся среде.
— Отличные аналитические, проблемно-решающие и коммуникативные навыки.
Garner Health is a healthcare technology startup focused on reducing employee health insurance costs for large companies by transforming the U.S. healthcare system using proprietary clinical metrics and AI.
About the role:
We are seeking a Senior Site Reliability Engineer to own the reliability, performance, and resilience of the cloud infrastructure powering Garner’s products and AI/ML workloads. This role is part of the Platform Engineering team and involves defining and upholding SLOs, leading incident response, and driving automation and standards to enable faster and more reliable shipping by engineers. The role emphasizes automation-first approaches using AI tools to convert manual operational work into monitored, hands-free processes.
Responsibilities:
— Own end-to-end reliability, performance, and resilience of cloud environments (AWS, Kubernetes), including AI/ML workloads
— Define, measure, and uphold SLOs across critical services
— Lead incident response, participate in on-call rotation, conduct root cause analysis, and review infrastructure changes
— Build and maintain monitoring, alerting, and observability systems
— Translate scaling requirements into automated infrastructure-as-code deliverables using Terraform
— Identify and implement cost-efficiency and performance improvements across the stack
— Reduce operational toil and tech debt through AI-driven automation
— Build and maintain deployment and observability standards to empower engineering teams
— Ensure infrastructure and operations comply with security and HIPAA requirements
Requirements:
— 4+ years of hands-on experience operating production cloud infrastructure at scale in SRE, DevOps, or platform engineering roles
— Deep expertise with Kubernetes and Terraform in cloud-first environments (AWS preferred)
— Strong experience with production observability: defining SLOs, monitoring, alerting, incident response, and blameless post-incident reviews
— Strong software engineering skills in Python or Go applied to infrastructure automation; experience with Kubernetes APIs is a plus
— Experience optimizing cloud cost and performance across compute, storage, and networking
— Experience supporting AI/ML or data-intensive workloads in production is a plus
— Experience in security-conscious or regulated environments (HIPAA, SOC 2) is a plus
— Familiarity or strong motivation to use AI tools (e.g., Claude) for engineering and operations workflows
— Commitment to high performance, accountability, and authentic feedback
Technologies used:
AWS, Kubernetes, Terraform, Istio, Python, Go, TypeScript, Postgres, NATS, Datadog, GitLab
Additional information:
— Remote position with occasional travel to NYC headquarters
— No visa sponsorship available
— Compensation range: $191,000 - $226,000 per year plus equity and benefits including flexible PTO, medical/dental/vision plans, 401(k) with company match, flexible spending accounts, and Teladoc Health
— Equal Employment Opportunity employer committed to diversity and accommodations for disabilities
Удалённоsenior
191 000 – 226 000 $
Все вакансии в одном месте — страница 2 · Job Hunters