Fiabilité à grande échelle (SRE)
Observabilité, SLO, gestion d’incidents, on-call, haute disponibilité. 30 M de requêtes et 100 000 jobs par jour, base de 500 Go.
99,99 %d’uptime, seul SRE
Platform Engineering & SRE
Vincent Legendre, Platform Engineer / SRE senior. Huit ans d’expérience, ancien data et software engineer. Seul SRE d’une plateforme à 30 millions de requêtes par jour. Je cadre, je livre, je transmets, en autonomie.
Méthode
La bonne solution, pas la plus impressionnante.
Bascule maîtrisée sur 30 minutes plutôt que stratégie zéro downtime, parce que le rapport coût / bénéfice ne la justifiait pas.
Profiling, EXPLAIN plans, analyse de la distribution des temps de réponse, jusqu’au patch.
Architecture multi-provider, sans dépendance à un fournisseur unique.
Infrastructure as Code, tests et observabilité dès la conception, documentation systématique. L’équipe continue sans moi.
Expertise
Huit domaines, de la fiabilité à la plateforme data — chacun adossé à un résultat, pas à une promesse.
Observabilité, SLO, gestion d’incidents, on-call, haute disponibilité. 30 M de requêtes et 100 000 jobs par jour, base de 500 Go.
99,99 %d’uptime, seul SRE
Front, back et base traités comme un seul système. Jobs de fond en échec réduits de 95 %.
÷ 2temps de réponse API
Migration d’applications (Helm, déploiements reproductibles, rollbacks maîtrisés, bascule sans interruption), reprise d’une migration entamée, exploitation en production.
3clusters en production
Performance, haute disponibilité, réplication, et les gestes sensibles sans downtime : montées de version, pg_repack, Row Level Security sans régression.
0downtime sur les montées de version
Migration cloud vers bare-metal, egress supprimé, à performance au moins égale.
÷ 3facture d’infrastructure
Conception d’architectures complètes : authentification, compute, bases de données, IAM, exposition d’APIs, WAF. Du réseau à la sécurité applicative.
Terraform, Pulumi, Ansible ; secrets et configuration maîtrisés. Facture de CI divisée par trois.
< 3 minde CI, plus de 10 avant
Plateforme data GCP-native conçue de bout en bout en fintech (BigQuery, Dataflow / Apache Beam, Elasticsearch en datacenter, Airflow). Équipe data rendue autonome.
Outils
Orchestration & plateforme
IaC & CI/CD
Observabilité
Données & stockage
Data engineering
Cloud & infrastructure
Langages
Déroulé
Audit rapide pour dimensionner le chantier et objectiver le besoin.
Périmètre et rythme fixés une fois le chantier cadré, jamais annoncés à l’aveugle.
Compréhension approfondie et développement nécessaires pour livrer. Un changement à la fois.
Je transmets : documentation et reproductibilité. L’équipe continue sans moi.
Régie ou forfait selon la prévisibilité du périmètre. Full-remote.
Preuves
Facture d’infrastructure divisée par trois : compute migré vers le bare-metal, egress supprimé.
À performance au moins égale.
Latence au centile 99 divisée par dix, sans que la moyenne ait bougé.
Uptime tenu sur l’année, seul SRE, sur une plateforme à 30 millions de requêtes par jour.
100 000 jobs par jour, base de 500 Go.
Temps de réponse API réduits de moitié, jobs de fond en échec réduits de 95 %.
Par le diagnostic outillé, pas la réécriture.
CI ramenée de plus de dix minutes à moins de trois, facture de CI divisée par trois.
Un audit de cadrage suffit pour démarrer : un diagnostic objectivé et un plan d’action priorisé, sans engagement sur la suite.
Pour qui
Scale-ups SaaS, fintech, plateformes à fort trafic, équipes tech en croissance sans fonction SRE établie. Typiquement une équipe d’une vingtaine de développeurs qui a besoin d’une expertise Platform / SRE senior sans recruter à temps plein.
Un diagnostic objectivé et un plan d’action priorisé, sans engagement sur la suite. Deux champs suffisent — le reste se dit de vive voix.
Trente minutes, sans engagement. Le plus efficace si vous avez déjà un chiffre qui vous inquiète.
Voir les disponibilités