Задачи:
– Обеспечивать отказоустойчивость работы платформы искусственного интеллекта, формировать планы аварийных переключений, применять технологии для обеспечения отказоустойчивой работы
– Анализировать метрики производительности, проводить анализ причин инцидентов и ошибок работы платформы искусственного интеллекта, разрабатывать меры по недопущению повторений сбоев
– Автоматизировать рутинные действия, внедрять и применять лучшие практики подхода "инфраструктура как код"
– Принимать участие в проектировании и организации вычислительных ресурсов для решения новых функциональных задач и внедрения в эксплуатацию технологий, в части касающейся системного программного обеспечения оркестрации микросервисов и аппаратно-технических средств используемых в средах с применением графических ускорителей платформ искусственного интеллекта
– Осуществлять администрирование системного программного обеспечения платформ искусственного интеллекта, включая операционные системы, оркестратор микросервисов, модули управления и мониторинга и другие компоненты
Требования:
– Опыт сопровождения Kubernetes от 3 лет
– Опыт внедрения кластеров виртуализации, частных/публичных облаков с использованием GPU Nvidia для AI/ML, в т.ч. LLM
– Опыт использования и развертывания Istio, haproxy, opensearch, vector, kafka, victoria metrics, vault, kyverno, calico, Kserve, multus, sriov, rdma, infiniband, patroni, postgresql, multi-tenant k8s, nvidia gpu-operator, network operator, dcgm, grafana, argo workflow, argo cd
– Опыт внедрения и сопровождения систем с использованием сети Infiniband на базе коммутаторов Mellanox
– Понимание работы, тюнинг и настройка OpenSM (настройка фабрик Infiniband)
– Навыки использования Go\Python (создание скриптов, операторов K8S)
– Знание и применение Ansible/Terraform
– Понимание принципов работы NFS, S3 (опыт работы приветствуется)
Контакты работодателя доступны по кнопке «Откликнуться» после входа.