Ingénieur en fiabilité de site
À propos de la mission. Une entreprise technologique déploie rapidement de nouvelles fonctionnalités et agents basés sur l'IA. Pour garantir la fiabilité, l'évolutivité et la mesurabilité, nous recherchons un ingénieur en fiabilité de site. Vous serez l'architecte de la visibilité opérationnelle et le moteur de nos métriques. Vous fournirez la couche de données fondamentale qui prouve que nos systèmes fonctionnent au plus haut niveau de qualité.
Vous traduirez des données de télémétrie complexes en informations claires pour toutes les parties prenantes.
Ce que vous ferez.
- Concevoir et implémenter la structure de surveillance principale pour l'application SaaS. Définir des indicateurs de niveau de service (SLI) et des objectifs de niveau de service (SLO) clairs dans Datadog pour les points de terminaison critiques (tels que les temps de réponse API et les latences de base de données). Identifier et éliminer les goulots d'étranglement de performance à l'aide d'alertes de budget d'erreur et de la surveillance des utilisateurs réels (RUM).
- Construire la couche de visibilité opérationnelle. Agréger les signaux OTel existants dans Datadog et les lier au suivi des PR par développeur, aux coûts de l'IA et aux chiffres de consommation pour fournir un aperçu direct de l'adoption et du débit avant et après le déploiement généralisé des outils d'IA.
- Porter l'observabilité à un niveau supérieur en se concentrant sur les agents d'IA eux-mêmes. Mesurer les invocations de compétences, les taux de réussite, la dérive et la qualité de la sortie pour s'assurer que tout fonctionne au niveau de qualité approprié.
Technologies.
- Observabilité et fiabilité: Datadog (APM & RUM), OpenTelemetry (OTel), StatusPage, frameworks de métriques DORA.
- Gestion des fonctionnalités et déploiement: LaunchDarkly, GitHub Actions, Docker, Terraform.
- Services AWS: SNS, SQS, S3, Lambda, API Gateway.
- Technologies de base et collaboration: MySQL, OpenSearch, PHP/Laravel, Vue.js, Linear, Confluence, Slack.
Profil
- Un joueur d'équipe organisé, méthodique et flexible avec une passion pour la fiabilité de la plateforme axée sur les données et la performance des applications.
- Solides compétences en communication pour encadrer les développeurs et visualiser clairement les données de performance pour toute l'équipe.
- Vaste expérience des normes SRE et d'observabilité modernes, spécifiquement avec Datadog APM, les synthétiques et OpenTelemetry.
- Expérience dans la définition et la surveillance des SLI, des SLO et la mise en place d'alertes proactives basées sur les budgets d'erreur.
- Connaissance des outils de livraison progressive tels que LaunchDarkly et de la communication d'incidents via StatusPage.
- Esprit analytique, proactif et toujours à la recherche de moyens d'optimiser la latence des applications et les coûts d'infrastructure.
- Expérience en ingénierie logicielle ou DevOps/SRE, idéalement dans un environnement de scale-up ou SaaS.
Pratique
- Un rôle passionnant dans une scale-up SaaS internationale en croissance.
- Grande autonomie, hiérarchies plates et circuits de décision courts.
- Options de travail flexibles.
- Événements d'équipe et opportunités de développement personnel.
- Choix de votre propre matériel (Windows, Mac, Linux).
Comment postuler
Consultez le texte complet de la mission et les informations de candidature des que votre candidature sur mesure est prete.
Commandez une candidature sur mesure pour consulter la mission complete et les informations de candidature.
Plus de contexte, moins d'heures de recherche dispersees.
Vous recevez juste assez de contexte pour evaluer si cette mission est interessante. Le briefing complet, les details client et les prochaines etapes restent disponibles dans l'app.