Задачи:
— Реагирование и разрешение инцидентов в продакшене (Sev1–Sev4)
— Участие в ротации дежурств (1 неделя из 5, отдельная оплата)
— Создание и поддержка runbook'ов (управляемых как код с CI валидацией)
— Разработка автоматизации и изменений инфраструктуры для клиентских окружений
— Настройка систем наблюдения (Datadog, Prometheus, Grafana)
— Подготовка постмортемов и техническая коммуникация с клиентами
— Внесение вклада в базу знаний
— 30–40% времени уделяется инженерным проектам (автоматизация, AI-инструменты, наблюдение)
— Участие в развитии AI-усиленного L1 слоя (триаж и автоматизация на основе RAG)
Требования:
— Опыт работы 5+ лет с Kubernetes, Terraform, AWS/GCP/Azure, Datadog, Prometheus, Grafana, PagerDuty, Linux, Python, Bash, ArgoCD, Helm, CI/CD (GitLab CI / GitHub Actions)
— Опыт дежурств в продакшене — обязателен
— Опыт Java-разработчика или SRE
— Умение работать с AI-агентами (критическое мышление)
— Чтение чужого кода и внесение мелких исправлений
— Знание SQL
— Управление инцидентами (Sev1–Sev4)
— Продвинутый английский для прямого общения с клиентами
— Внимательность, ответственность, хорошие коммуникативные навыки
Условия:
— Работа полностью удалённая, только для LATAM (AMER хаб, GMT-3…-6)
— Стандартные часы работы 09:00–18:00 по местному времени
— Дежурства 1 неделя в ротации с отдельной оплатой (стендбай + оплата за инциденты)
— Нет ночных смен, обязательное время восстановления после дежурств
— Возможность стать одним из основателей AMER хаба
— Реальная автономия, не позиция обработки тикетов
— 30–40% времени на инженерные проекты
— Работа напрямую с техническим лидом и командой CEMEA
Задачи:
— Проектировать и строить инфраструктурные примитивы, определяющие масштабирование CI/CD платформы, систем сборки и сред разработки по всей инженерной организации.
— Помогать строить и эксплуатировать Kubernetes-контрольную плоскость для CI/CD платформы, включая инфраструктуру self-hosted раннеров GitHub Actions (автомасштабирование, изоляция, оптимизация затрат и производительности), GitHub Apps и GitHub-as-code (права доступа, вебхуки, автоматизация на уровне организации), безопасный сетевой доступ для CI/CD и удалённых сред разработки (Tailscale), GitOps-деплой платформенных сервисов (Flux), эфемерные/по требованию среды разработки и системы сборки.
— Разрабатывать ключевые инфраструктурные компоненты, включая Kubernetes Operators и автомасштабирование, которые напрямую используют продуктовые команды, снижая необходимость в индивидуальных CI/CD и средах.
— Не заниматься операционной поддержкой, а создавать системы, определяющие процесс сборки, тестирования и деплоя, формируя надёжность и масштабируемость опыта разработчиков в организации.
Требования:
— 6–9+ лет опыта в SRE, платформенной или инфраструктурной инженерии.
— Подтверждённый опыт масштабирования Kubernetes в высоконагруженных продуктивных средах.
— Глубокие знания Kubernetes, включая внутренние механизмы, поведение планировщика, кастомные ресурсы и диагностику сбоев на уровне кластера.
— Опыт создания платформенной инфраструктуры, контрольных плоскостей или Kubernetes Operators, а не только их использования.
— Сильный опыт распределённых систем и обеспечения надёжности в продуктиве.
— Владение Terraform и GitOps, включая проектирование и сопровождение автоматизации, а не только выполнение сценариев.
— Опыт работы с GitOps-подходами (Flux, ArgoCD).
— Практический опыт масштабных CI/CD платформ: GitHub Actions (self-hosted раннеры, workflows-as-code), GitHub Apps, системы сборки.
— Опыт работы с AWS и облачной инфраструктурой в продуктиве.
— Владение Go (предпочтительно) или другим системным языком.
Условия:
— Удалённая работа из Канады.
— Зарплата от 90 000 до 125 000 USD в год.
Задачи:
— Обеспечение надежности, масштабируемости и производительности распределенной инфраструктуры ZK-сопроцессоров.
— Управление парком блокчейн-нод (RPC, Validators) и специализированных Prover-нод в мультичейн среде.
— Автоматизация процессов развертывания и управления инфраструктурой (IaC) с использованием Terraform / Pulumi.
— Глубокий мониторинг и алертинг (Prometheus, Grafana, VictoriaMetrics) с фокусом на специфические метрики блокчейна и прувинга.
— Оптимизация производительности систем (Performance Tuning) и работа над минимизацией сетевых задержек (low-latency).
— Управление инцидентами, проведение Post-mortem анализа и разработка мер по предотвращению повторных сбоев.
— Внедрение и развитие практик GitOps и CI/CD пайплайнов для инфраструктурных и прикладных сервисов.
Требования:
— Опыт работы в роли SRE или DevOps Engineer от 4-5 лет.
— Экспертное владение Kubernetes (управление кластерами, написание Helm чартов / Operator SDK).
— Глубокие знания Linux internals, сетевых протоколов и безопасности.
— Опыт работы с облачными провайдерами (AWS — основной, GCP/Azure).
— Уверенное владение Python или Go для написания инструментов автоматизации.
— Практический опыт работы с инструментами IaC (Terraform).
— Английский язык: Upper-Intermediate (свободная коммуникация в международной команде).
Будет плюсом:
— Опыт эксплуатации блокчейн-инфраструктуры (Ethereum, L2s, Solana).
— Понимание специфики работы ZK-Rollups или систем с интенсивными вычислениями (GPU/FPGA acceleration).
— Опыт работы с инструментами распределенной трассировки (Jaeger / Tempo).
Удалённоsenior
6 500 – 9 300 $
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Задачи:
— Развертывание и эксплуатация Bitcoin Core nodes.
— Построение отказоустойчивой инфраструктуры для backend-сервисов.
— Мониторинг состояния Bitcoin-нод и внутренних сервисов.
— Настройка metrics, logging, alerting и dashboards.
— Secrets management и безопасная работа с credentials.
— Backup и disaster recovery.
— Автоматизация deployment и infrastructure provisioning.
— CI/CD.
— Контроль доступов и сегментация инфраструктуры.
— Анализ и устранение production-инцидентов.
— Capacity planning и оптимизация ресурсов.
— Совместная работа с security engineer над hardening инфраструктуры.
Требования:
— Опыт DevOps/SRE в production-системах.
— Linux на уверенном уровне.
— Docker и контейнерная инфраструктура.
— Опыт с Kubernetes или аналогичными orchestration-платформами.
— Infrastructure as Code: Terraform, Ansible или аналоги.
— Опыт построения monitoring/alerting систем.
— Понимание сетей, firewall, TLS и управления доступом.
— Практический опыт secrets management.
— Опыт построения backup/recovery процессов.
— Умение расследовать production-инциденты.
Будет плюсом:
— Опыт эксплуатации Bitcoin Core nodes.
— Понимание Bitcoin P2P/networking.
— Опыт эксплуатации blockchain infrastructure.
— Опыт с security-sensitive или financial infrastructure.
— Опыт защиты публичных сервисов от DDoS/DoS.
— Опыт построения privacy-oriented инфраструктуры.
Что важно в этой роли:
Для проекта критична не только доступность сервисов, но и минимизация инфраструктурных рисков и утечек метаданных. Поэтому нам нужен инженер, который рассматривает security и privacy как часть инфраструктурной архитектуры, а не как отдельный этап после запуска.
Nitka Technologies is an international IT company specializing in custom software development and IT consulting.
The vacancy is for a Senior SRE Engineer / Platform Reliability Engineer position with remote work.
No further details about tasks, requirements, or conditions are provided in the text.
Задачи:
— Решать технические проблемы клиентов от начала до конца (Helpdesk + Slack) в рамках SLA
— Проводить анализ корневых причин с использованием Grafana, Datadog (логи, метрики, трассировки)
— Создавать дашборды мониторинга и проактивные оповещения
— Писать скрипты на Python для автоматизации и массовых операций
— Активно использовать AI-инструменты (Claude, Cursor, ChatGPT) для ускорения устранения проблем
Требования:
— Опыт ежедневной работы с LLM и prompt engineering
— Практические навыки работы с Grafana/Datadog (создание дашбордов и оповещений)
— Скриптинг на Python и хорошее понимание распределённых систем
— Опыт работы 2+ года в TechOps/технической поддержке (FinTech/Forex/Crypto будет плюсом)
— Отличное владение английским языком (C1+)
Условия:
— Удалённая работа, предпочтительно в часовом поясе GMT+5 - GMT+8
— Работа в англоязычной команде
Требуется DevOps/SRE инженер для outstaff проекта на удалёнку из Европы.
Требования:
— Опыт работы с AWS, Terraform, Kubernetes, включая продуктовую эксплуатацию в высоконагруженных системах.
— Знания ядра Linux: академическая/теоретическая база и практическое применение.
Будет плюсом:
— Опыт работы с Azure.
— Ежедневная работа с AI.
О проекте
Приглашаем DevOps / SRE инженеров в команду сопровождения бизнес-приложений. Предстоит заниматься сопровождением крупной корпоративной системы на базе ELMA365 и связанных с ней сервисов и интеграций.
Команда DevOps отвечает за инфраструктурную часть: Kubernetes, CI/CD, развёртывание приложений и сопровождение релизов. Поддержка непосредственно коробочного решения ELMA365 осуществляется на стороне вендора. Это расширение существующей команды. Рассматриваем специалистов уровня Middle / Middle+ / Senior. В приоритете опытные и самостоятельные инженеры.
Задачи:
— сопровождение Kubernetes-кластеров;
— развёртывание приложений и сервисов на стендах;
— раскатка и обновление релизов;
— настройка и сопровождение CI/CD-процессов;
— разработка и поддержка Jenkins pipelines;
— работа с Helm;
— выполнение change-задач;
— сопровождение существующей инфраструктуры;
— диагностика проблем в работе приложений и сервисов;
— анализ логов и состояния сервисов;
— участие во второй линии поддержки;
— взаимодействие с разработчиками, системными администраторами, архитекторами, инфраструктурными командами и другими смежными подразделениями;
— автоматизация рутинных операций;
— подготовка и актуализация технической документации.
Технологический стек:
Основной стек:
Kubernetes 1.33 Cloud;
Helm;
Jenkins / CI/CD;
Linux;
Docker.
Также используются:
Ansible;
Nexus / Docker Registry;
Bitbucket;
Zabbix;
Grafana / Prometheus;
ELK;
Jira / Service Desk.
Требования
— коммерческий опыт работы DevOps / SRE;
— уверенное практическое знание Kubernetes;
— опыт самостоятельного развёртывания и настройки Kubernetes-кластеров;
— опыт deployment приложений в Kubernetes;
— уверенное владение Helm;
— опыт работы с CI/CD;
— практический опыт работы с Jenkins;
— знание Linux на уровне администратора;
— понимание принципов работы микросервисных и клиент-серверных приложений;
— способность самостоятельно разбираться в проблемах и доводить задачи до результата;
— хорошие навыки коммуникации и взаимодействия со смежными командами.
Будет преимуществом:
— умение самостоятельно писать Dockerfile;
— опыт автоматизации с помощью Ansible;
— опыт работы с Nexus / Docker Registry;
— Bitbucket;
— Prometheus / Grafana;
— Zabbix;
— ELK;
— опыт работы с enterprise-приложениями;
— использование генеративных AI-инструментов в работе;
— опыт создания AI-агентов.
Команда и формат работы:
Вы будете работать в команде DevOps из 14 специалистов.
За отдельными системами закреплены свои DevOps-инженеры. В работе также участвуют отдельные команды инфраструктуры, системного администрирования, информационной безопасности и архитектуры.
Работа организована по задачам: дейлики, спринты, change-задачи и сопровождение систем.
Дежурств и on-call в рамках позиции нет — за реагирование на алерты и инциденты отвечает отдельное подразделение.
Условия:
— полностью удалённая работа из любой точки РФ;
— общие очные встречи команды ориентировочно 1 раз в квартал;
— официальное оформление;
— ДМС с первого дня;
— льготные ипотечные условия кредитования;
— корпоративная пенсионная программа;
— скидки на продукты компаний-партнёров;
— обучение за счёт компании: онлайн-курсы, корпоративная библиотека, корпоративный университет, тренинги и митапы;
— возможность профессионального развития и получения новой квалификации.
Garner Health is a healthcare technology startup focused on reducing employee health insurance costs for large companies by transforming the U.S. healthcare system using proprietary clinical metrics and AI.
About the role:
We are seeking a Senior Site Reliability Engineer to own the reliability, performance, and resilience of the cloud infrastructure powering Garner’s products and AI/ML workloads. This role is part of the Platform Engineering team and involves defining and upholding SLOs, leading incident response, and driving automation and standards to enable faster and more reliable shipping by engineers. The role emphasizes automation-first approaches using AI tools to convert manual operational work into monitored, hands-free processes.
Responsibilities:
— Own end-to-end reliability, performance, and resilience of cloud environments (AWS, Kubernetes), including AI/ML workloads
— Define, measure, and uphold SLOs across critical services
— Lead incident response, participate in on-call rotation, conduct root cause analysis, and review infrastructure changes
— Build and maintain monitoring, alerting, and observability systems
— Translate scaling requirements into automated infrastructure-as-code deliverables using Terraform
— Identify and implement cost-efficiency and performance improvements across the stack
— Reduce operational toil and tech debt through AI-driven automation
— Build and maintain deployment and observability standards to empower engineering teams
— Ensure infrastructure and operations comply with security and HIPAA requirements
Requirements:
— 4+ years of hands-on experience operating production cloud infrastructure at scale in SRE, DevOps, or platform engineering roles
— Deep expertise with Kubernetes and Terraform in cloud-first environments (AWS preferred)
— Strong experience with production observability: defining SLOs, monitoring, alerting, incident response, and blameless post-incident reviews
— Strong software engineering skills in Python or Go applied to infrastructure automation; experience with Kubernetes APIs is a plus
— Experience optimizing cloud cost and performance across compute, storage, and networking
— Experience supporting AI/ML or data-intensive workloads in production is a plus
— Experience in security-conscious or regulated environments (HIPAA, SOC 2) is a plus
— Familiarity or strong motivation to use AI tools (e.g., Claude) for engineering and operations workflows
— Commitment to high performance, accountability, and authentic feedback
Technologies used:
AWS, Kubernetes, Terraform, Istio, Python, Go, TypeScript, Postgres, NATS, Datadog, GitLab
Additional information:
— Remote position with occasional travel to NYC headquarters
— No visa sponsorship available
— Compensation range: $191,000 - $226,000 per year plus equity and benefits including flexible PTO, medical/dental/vision plans, 401(k) with company match, flexible spending accounts, and Teladoc Health
— Equal Employment Opportunity employer committed to diversity and accommodations for disabilities