
// Open Role at Xsolla
Join Xsolla's SRE team to ensure the reliability and scalability of a global video game commerce platform. You'll drive infrastructure at the application level, from CI/CD to observability, impacting millions of gamers and developers worldwide.
Об Xsolla
Xsolla — глобальный лидер в сфере видеоигровой коммерции, предоставляющий разработчикам все возможности для запуска, развития и монетизации игр. Компания поддерживает студии любого масштаба — от инди до AAA — с помощью решений в области Direct-to-Consumer коммерции, интеллектуальных платежей, IP из медиаиндустрии и инструментов вовлечения игроков. Xsolla помогает разработчикам финансировать, распространять, продвигать и монетизировать игры в глобальном масштабе.
Нам доверяют более 70 процентов из топ-100 самых кассовых игр. Xsolla выступает в роли merchant of record в 200+ регионах мира с доступом к более чем 1000 локальных платёжных методов.
Xsolla глубоко верит в будущее игровой индустрии и последовательно объединяет все возможности, открывая путь к росту для разработчиков по всему миру.
О роли
Мы ищем Site Reliability Engineer (SRE) — прагматичного специалиста с продуктовым мышлением, который одинаково уверенно чувствует себя как при написании кода, так и при эксплуатации production-систем, — в SRE-команду департамента Инфраструктуры.
Идеальный кандидат умеет эффективно работать в быстро меняющейся, динамичной среде с высоким уровнем взаимодействия между командами и готов нести ответственность за инфраструктуру на уровне приложений — от CI/CD-пайплайнов и Kubernetes-манифестов до SLO, capacity planning и production readiness.
Для этой роли необходимы сильные навыки в Kubernetes, observability и разработке ПО, а также опыт эксплуатации production-сервисов в облачной среде (GCP/GKE или аналогичной) и тесного взаимодействия с продуктовыми командами разработки.
Ключевым фактором успеха будет способность одновременно понимать обе стороны — как разработчики создают и выпускают новые функциональные возможности и что необходимо инфраструктуре для сохранения высокой надежности — и учитывать требования к надежности уже на ранних этапах проектирования и принятия архитектурных решений.
Если вам интересно превращать сложные распределенные системы в предсказуемые и стабильно работающие платформы и вы хотите развивать commerce- и monetization-инфраструктуру, которая помогает разработчикам игр по всему миру получать доход от своих продуктов, будем рады познакомиться!
Отвечать за инфраструктуру на уровне приложений: Helm-чарты, конфигурации Terraform, Kubernetes-деплойменты, runtime-конфигурацию, а также сетевые настройки и интеграции сервисов.
Отвечать за observability в рамках продуктового домена: проектировать и внедрять SLO/SLI, мониторы, алерты и дашборды для критичных сервисов с использованием Datadog и инструментов на базе OpenTelemetry.
Помогать в создании и развитии CI/CD-пайплайнов для сервисов домена (GitLab CI, GitHub Actions), включая автоматизацию деплоя и отката изменений.
Выполнять планирование производительности и емкости инфраструктуры, а также performance tuning перед ожидаемыми пиковыми нагрузками — запусками продуктов, распродажами и региональными релизами. Проводить нагрузочное тестирование и расследовать регрессии производительности.
Проводить Production Readiness Review для новых сервисов и значительных изменений; определять и контролировать критерии готовности сервисов домена к эксплуатации в production.
Участвовать в реагировании на инциденты в рамках домена: помогать в глубоком расследовании сложных инцидентов, участвовать в подготовке post-mortem, инициировать и доводить до реализации улучшения надежности, а также поддерживать runbook-документацию в актуальном состоянии.
Разрабатывать автоматизацию, специфичную для домена и сокращающую объем рутинных операционных задач: автоматизацию runbook-процедур, инструменты для деплоя и регулярные операционные скрипты.
Совместно с техническими лидерами продуктовых команд формировать и развивать долгосрочный roadmap по надежности домена.
Участвовать в планировании, refinement-сессиях и архитектурных ревью продуктовых команд, обеспечивая учет требований к надежности еще до того, как изменение архитектурных решений станет дорогостоящим.
Совместно с основной SRE-командой разрабатывать корпоративные стандарты в области SLO/SLI, capacity planning и эксплуатации; напрямую участвовать в улучшении общих подсистем, находящихся в зоне ответственности SRE.
Участвовать в дежурствах SRE-команды, оказывая поддержку разработчикам по всей компании.
От 3 лет подтвержденного опыта работы в роли SRE, DevOps- или Platform Engineer: участие в on-call/реагировании на инциденты, ответственность за SLO и мониторинг, работа с deployment pipelines и инфраструктурой production-сервисов.
Опыт разработки ПО: вы не только эксплуатировали системы, но и разрабатывали и выпускали backend-сервисы. Умеете читать и анализировать код приложения при расследовании проблем и писать production-quality автоматизацию как минимум на одном языке программирования, например Go или PHP.
Практический опыт работы с Kubernetes: Helm, manifests, стратегии деплоя, диагностика проблем производительности и сетевого взаимодействия на уровне приложений; опыт с GKE или другими managed Kubernetes-платформами.
Уверенные знания и практический опыт в observability: создание мониторов, дашбордов и SLO/SLI на современных платформах. Предпочтителен Datadog; опыт с Prometheus/Grafana также релевантен. Знакомство с OpenTelemetry.
Опыт работы с Infrastructure as Code (Terraform/Terragrunt), достаточный для эффективного взаимодействия с Platform-командами.
Опыт работы с GCP, включая IAM, networking и managed services.
Опыт создания и поддержки CI/CD-пайплайнов в GitLab CI и/или GitHub Actions.
Уверенные навыки программирования и написания скриптов, достаточные для создания автоматизации и внутренних инструментов, например на Python, Go или Bash.
Практический опыт реагирования на инциденты, проведения post-mortem и реализации улучшений надежности по результатам инцидентов.
Сильные коммуникативные навыки и умение эффективно работать в команде — эта роль предполагает ежедневную тесную работу с продуктовыми командами разработки.
Опыт работы с платежными системами, fintech, e-commerce или gaming-продуктами с высоконагруженными транзакционными системами.
Развитие и обучение: доступ к внутренней платформе, участие в профессиональных конференциях, хакатонах, митапах и воркшопах
Современные инструменты: топовое оборудование (Mac), доступ к продвинутым ИИ-сервисам, которые избавляют от рутины и помогают быть продуктивнее
Забота о здоровье: ДМС со стоматологией для вас и членов вашей семьи (супруг, дети), 21 день доплачиваемого до размера зарплаты больничного
Глобальные возможности: участие в международных проектах, командировки и потенциальная релокация в один из зарубежных офисов
Удалёнка с комфортом: компенсация расходов на обустройство эргономичного рабочего места дома - для удаленщиков
Если вам откликается эта роль, но вы не уверены, что соответствуете каждому пункту — всё равно напишите. Мы открыты к диалогу и с интересом рассмотрим вашу кандидатуру. Возможно, вы идеально подойдёте именно нам.
От 3 лет подтвержденного опыта работы в роли SRE, DevOps- или Platform Engineer, включая on-call и ответственность за SLO/мониторинг. Опыт разработки backend-сервисов и автоматизации на Go или PHP. Практический опыт работы с Kubernetes (Helm, manifests, GKE) и уверенные знания в observability (Datadog, Prometheus, Grafana, OpenTelemetry). Опыт работы с Infrastructure as Code (Terraform/Terragrunt) и GCP (IAM, networking). Опыт создания и поддержки CI/CD-пайплайнов (GitLab CI/GitHub Actions). Уверенные навыки программирования и написания скриптов на Python, Go или Bash. Практический опыт реагирования на инциденты и реализации улучшений надежности. Сильные коммуникативные навыки и опыт работы с платежными системами, fintech, e-commerce или высоконагруженными игровыми продуктами.