Retour à la recherche
S
SherwebSource d’offres vérifiée

Spécialiste de la fiabilité des sites (Site Reliability Specialist)

Offre en anglais

The specialist ensures the reliability, availability, and performance of production platforms by applying SRE principles and automation. They are responsible for reducing manual operational tasks, managing incidents, and improving system observability through engineering practices.

  • Télétravail
  • Quebec, Quebec, Canada
  • Publié 2 août 2026
  • Postuler avant le 1 sept. 2026
  • 1 poste

Résumé du poste

Lieu : Hybride – Province de Québec Le ou la spécialiste de la fiabilité des sites (Site Reliability Specialist) au sein de l’équipe des opérations TI contribue à la fiabilité, la disponibilité, la performance et la résilience des plateformes et services de Sherweb. Il s’agit d’un rôle hautement technique de contributeur individuel qui applique les principes de l’ingénierie de la fiabilité des sites (SRE) dans des environnements de production. Ce poste combine l’administration de systèmes, le développement logiciel, l’automatisation, l’observabilité et l’excellence opérationnelle afin d’améliorer la fiabilité des services, de réduire les tâches opérationnelles manuelles et d’accroître l’évolutivité des plateformes. En travaillant en étroite collaboration avec les équipes Infrastructure, Développement, DevOps, Plateforme, Sécurité et Produits, la ou le spécialiste de la fiabilité des sites contribue à assurer la stabilité, la maintenabilité et l’amélioration continue des systèmes de production grâce à des pratiques d’ingénierie et d’automatisation. Voici comment vous contribuerez au succès de l’entreprise Développer, maintenir et améliorer des scripts, des processus d’automatisation et des outils opérationnels afin de réduire les interventions manuelles, d’améliorer la fiabilité et de diminuer les tâches répétitives. Appliquer les principes SRE pour améliorer la fiabilité, la disponibilité, la performance et la résilience des plateformes hébergées et des services de production de Sherweb. Mettre en œuvre et soutenir les normes de fiabilité, les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) ainsi que les pratiques opérationnelles établies pour les plateformes et services. Adopter une mentalité de développeur afin de transformer les tâches opérationnelles répétitives en solutions automatisées évolutives, réutilisables, documentées et faciles à soutenir. Fournir un soutien opérationnel avancé et résoudre les incidents affectant les services de production tout en collaborant étroitement avec les équipes SRE, Infrastructure, Développement, DevOps et Produits. Enquêter sur les problèmes récurrents et effectuer des analyses des causes fondamentales afin d’identifier des mesures correctives à court terme et des améliorations durables à long terme. Concevoir, soutenir et maintenir des systèmes de production et des technologies de services hébergés tout en respectant les procédures opérationnelles, les meilleures pratiques de sécurité et les exigences de conformité. Améliorer la surveillance, les alertes, la journalisation, les métriques et la visibilité opérationnelle afin de permettre à l’équipe de détecter les enjeux plus rapidement, de mieux comprendre les comportements des systèmes et de prévenir les incidents. Contribuer à l’amélioration de l’observabilité de bout en bout et de la compréhension des systèmes grâce aux métriques, journaux, traces, données de télémétrie et outils de diagnostic opérationnel. Contribuer aux pratiques d’observabilité en tant que code (Observability as Code), d’infrastructure en tant que code (Infrastructure as Code), de configuration en tant que code (Configuration as Code) et d’automatisation lorsque pertinent. Explorer et tirer parti d’Azure AI Foundry, de Power Automate ainsi que des capacités des agents d’IA afin d’améliorer l’efficacité opérationnelle, d’automatiser les flux de travail répétitifs et d’accélérer la résolution d’incidents ou les améliorations de fiabilité. Participer aux activités du cycle de vie des plateformes, aux déploiements, aux fenêtres de maintenance, aux migrations et aux initiatives d’amélioration continue des services. Collaborer avec les développeurs, architectes, experts de domaine, équipes DevOps et Infrastructure afin de soutenir l’implantation, l’optimisation, le dépannage et la préparation opérationnelle des services. Créer et maintenir la documentation opérationnelle, notamment les procédures normalisées (SOP), les guides d’exploitation (runbooks), les guides de dépannage, la documentation liée à l’automatisation, les procédures de maintenance et les outils de partage des connaissances. Suivre, organiser et gérer les incidents, demandes et billets de service afin de respecter les ententes de niveau de service (SLA) et d’assurer des communications claires dans le cadre des processus ITSM. Participer à la rotation de garde (« on-call ») et effectuer des travaux de maintenance à l’extérieur des heures normales de travail lorsque requis. Effectuer toute autre tâche connexe selon l’évolution du poste et les besoins du département. Voici ce que vous devez posséder et maîtriser pour obtenir le poste Formation Diplôme collégial ou universitaire en informatique, développement logiciel, technologies de l’information, génie ou toute combinaison équivalente de formation et d’expérience. Expérience De 3 à 5 ans d’expérience en administration de systèmes, opérations TI, soutien à l’infrastructure, développement logiciel, DevOps, automatisation ou dans un rôle technique similaire. Expérience de soutien de systèmes de production dans des environnements critiques pour les affaires et orientés vers la clientèle. Expérience démontrée dans l’amélioration de l’efficacité opérationnelle grâce à l’automatisation et aux pratiques d’ingénierie. Compétences principales Solides compétences en développement ou en scripting avec au moins un des langages suivants : PowerShell, Python, Bash, JavaScript, TypeScript ou C#. Capacité démontrée à concevoir, développer, tester, dépanner, documenter et maintenir des scripts ou de petites applications destinées à automatiser des tâches opérationnelles. Expérience démontrée du soutien d’environnements Microsoft et/ou Linux, incluant le dépannage, la maintenance, le soutien opérationnel et l’automatisation. Excellentes aptitudes en diagnostic, en enquête et en résolution de problèmes, avec la capacité d’analyser les incidents, d’en identifier les causes fondamentales et de mettre en œuvre des améliorations durables grâce à l’automatisation ou à l’ingénierie. Bonne compréhension des systèmes distribués, des concepts réseau, des dépendances entre systèmes, de la disponibilité, de la performance, de la fiabilité et des opérations de services dans les environnements de production. Expérience avec la surveillance, les alertes, l’observabilité, la gestion des journaux, la télémétrie et l’analyse de données opérationnelles afin de détecter, dépanner et prévenir les problèmes. Connaissance des systèmes de contrôle de versions, des flux de travail Git, des pipelines CI/CD, des pratiques de revue de code et de l’automatisation des déploiements. Une expérience avec l’infrastructure en tant que code (IaC), la gestion de configuration ou des outils d’automatisation tels que Terraform, Ansible, DSC, Azure DevOps, GitHub Actions, Docker ou Kubernetes constitue un atout. Une connaissance d’Azure AI Foundry, Power Automate, Copilot/agents d’IA ou des concepts d’automatisation basée sur des agents constitue un atout. Une connaissance des environnements à haute disponibilité, de la virtualisation, des services infonuagiques, des pratiques de sauvegarde et restauration ainsi que des modèles de soutien de production constitue un atout. Qualités professionnelles Personne autonome, fiable et motivée, dotée d’un esprit d’apprentissage continu et d’un fort intérêt pour l’amélioration de la fiabilité par les pratiques d’ingénierie logicielle et d’automatisation. Excellentes habiletés en communication et en collaboration, avec la capacité de travailler efficacement avec des intervenants techniques et non techniques. Excellente maîtrise de l’anglais, tant à l’oral qu’à l’écrit, essentielle; la maîtrise du français constitue un atout. Les certifications pertinentes de l’industrie telles que Microsoft Azure, Red Hat, Linux Foundation, Kubernetes, DevOps ou des plateformes d’observabilité sont considérées comme des atouts. Exigences additionnelles Disponibilité pour participer à une rotation de garde (« on-call ») dans un environnement opérationnel 24 heures sur 24, 7 jours sur 7. Voici les avantages de travailler chez Sherweb Sherweb, c’est d’abord et avant tout une culture où les besoins de notre clientèle sont au cœur de nos actions et sont soutenus par des Sherwebois engagés à vivre pleinement nos valeurs de passion, de travail d’équipe et d’intégrité. Environnement de travail dynamique et flexible Une culture de travail amicale et diversifiée qui valorise l’inclusion et l’équité. Un écosystème et des outils technologiques de pointe. Une culture axée sur les résultats au sein de laquelle les nouvelles idées, les actions et le savoir-faire sont reconnus à leur juste valeur. Ajustement salarial annuel basé sur la performance. Des collègues généreux et bienveillants issus d’une multitude d’horizons professionnels et culturels. Offre de rémunération globale flexible Un salaire de base entre $ 71,300.00 et $ 101,900.00 par année. Une indemnité de vacances qui considère votre expérience antérieure. Des congés rémunérés disponibles dès le premier jour (vacances et congés mobiles). Un régime d’assurance collective flexible qui vous permet de choisir ce qui vous convient. Possibilités de croissance illimitées Un plan de carrière qui offre des occasions d’apprendre et de grandir. Une proximité avec votre gestionnaire direct et des échanges francs et ouverts afin de soutenir votre développement. De multiples occasions de formation initiale et en cours d’emploi ainsi que des outils afin de suivre votre progression et de vous préparer à différentes perspectives professionnelles. Et enfin, une vie sociale énergique (surnommée Sherweblife) grâce à un riche calendrier d’activités qui nous permet de tisser des liens en virtuel et en présentiel tout au long de l’année. Chez Sherweb, nous croyons à la transparence et à l'équité salariale. La fourchette indiquée a pour but de donner une indication du salaire auquel vous pouvez vous attendre pour ce poste. Cependant, nous sommes conscients que chaque candidat apporte un ensemble unique de compétences et d'expériences. C'est pourquoi la rémunération globale finale sera adaptée pour refléter les qualifications et l'expertise spécifiques du candidat choisi, ce qui nous permettra de rester compétitifs et équitables dans nos offres. Motifs de l’exigence de l’anglais : Sherweb dessert des clients internationaux et la maitrise de l’anglais est le seul moyen d’assurer une prestation de service adéquate à nos clients. Les tâches principales reliées à ce poste exigent des communications écrites et orales avec une clientèle anglophone et ce, 100% du temps.

Ce que vous ferez

The specialist ensures the reliability, availability, and performance of production platforms by applying SRE principles and automation. They are responsible for reducing manual operational tasks, managing incidents, and improving system observability through engineering practices.

Exigences

Requires 3 to 5 years of experience in systems administration, DevOps, or software development with strong scripting skills in languages like Python or PowerShell. A college or university degree in computer science or a related field is required, along with proficiency in English.

Avantages

• Annual performance-based salary adjustment • Vacation allowance based on previous experience • Paid time off from day one • Flexible group insurance plan • Career development and growth opportunities • Initial and on-the-job training • Social activities (Sherweblife)

Compétences indiquées

  • JavaScriptSouhaitée
  • TypeScriptSouhaitée
  • C++Souhaitée
  • GitSouhaitée
  • PythonSouhaitée

Autres compétences pertinentes

Relevées dans la description du poste. Confirmez les exigences importantes ci-dessus.

  • Site Reliability Engineering
  • Automation
  • PowerShell
  • Python
  • Bash
  • JavaScript
  • TypeScript
  • C#
  • Microsoft Systems Administration
  • Linux Administration
  • Observability
  • CI/CD Pipelines
  • Infrastructure as Code
  • Git
  • Incident Management
  • Azure AI Foundry

Domaines d’emploi

  • Technology
  • Software
  • Engineering
  • Consulting
  • Data & Analytics

Renseignements supplémentaires

Formation minimale
Diplôme collégial
Expérience minimale
2+ ans
Postuler avant le
1 sept. 2026
Langue de l’offre
français
Heures de travail
40 heures par semaine
Exigences de lieu
Country, Québec, Quebec, Canada
Niveau d’expérience
Mid-Senior level