
// Open Role at Ubisoft
Join Ubisoft Montreal as a Site Reliability Specialist to enhance the availability, reliability, and performance of critical game development platforms. You will drive automation, observability, and operational excellence in a global gaming environment.
Ubisoft est une référence mondiale du jeu vidéo, avec des équipes réparties aux quatre coins du monde qui créent des expériences de jeu originales et mémorables, de Assassin’s Creed à Rainbow Six en passant par Just Dance et bien d’autres encore. Nous croyons que la diversité des points de vue fait progresser à la fois les joueurs et les équipes. Si vous êtes passionné·e par l’innovation et que vous souhaitez repousser les limites du divertissement, rejoignez notre aventure et aidez-nous à créer l’inconnu!
En tant que spécialiste en fiabilité des sites à Ubisoft Montréal, vous rejoindrez l’équipe TI Games and Studios et contribuerez à améliorer la disponibilité, la fiabilité et la performance des plateformes et services essentiels au développement de jeux chez Ubisoft.
Vous travaillerez en collaboration avec des équipes de développement, des spécialistes infonuagiques et des équipes d’infrastructure afin de concevoir des solutions résilientes, d’améliorer les pratiques d’observabilité et de soutenir l’excellence opérationnelle dans les environnements de production. Grâce à l’automatisation, à l’amélioration continue et aux initiatives axées sur la fiabilité, vous contribuerez à assurer la stabilité et l’efficacité des services utilisés à travers l’organisation.
Ce que vous ferez
Ce que vous apportez à l'équipe
- Collaborate with service teams to define and maintain Service Level Objectives (SLO) and Service Level Indicators (SLI). - Design and implement automation solutions to improve operational efficiency and service reliability. - Document technical solutions and support their integration into internal platforms and services. - Ensure technical solutions align with quality standards, engineering practices, and IT guidelines. - Work closely with development, infrastructure, and platform teams to improve operational consistency and system reliability. - Support observability practices, including monitoring, logging, alerting, and incident management. - Participate in root cause analyses and continuous improvement initiatives following service incidents. - Optimize deployment processes and operations through automation and infrastructure improvements. - Support the evolution and maintenance of cloud environments and services. - Share knowledge and contribute to service reliability initiatives. - Experience in infrastructure engineering, automation, and DevOps practices. - Knowledge of GitLab and GitLab CI/CD for deployments and automation. - Proficiency in programming and scripting languages such as Python, Bash, and Go. - Experience with Terraform, Infrastructure as Code (IaC) practices, and Kubernetes (K8s) in public cloud environments like Amazon Web Services (AWS) or Microsoft Azure. - Familiarity with configuration management tools like Ansible or Chef. - Experience with observability and monitoring platforms such as Prometheus and Grafana. - Interest in AI-assisted engineering tools like GitHub Copilot, Claude Code, or similar solutions. - Ability to collaborate effectively with technical and non-technical partners while contributing to problem-solving and continuous improvement.