🎯 Contexte de mission
Dans le cadre de la stabilisation d’une plateforme Amazon Managed Workflows for Apache Airflow (MWAA) rencontrant des dysfonctionnements récurrents, la mission consiste à intervenir en Task Force afin d’identifier les causes racines, rétablir rapidement la stabilité de la plateforme et sécuriser durablement son fonctionnement.
L’intervention nécessite un véritable expert Airflow / MWAA, capable d’aller au-delà du développement de DAGs pour intervenir sur l’architecture, le paramétrage, les performances et les mécanismes internes d’Airflow.
📋 Missions principales et rôle
-
Réaliser un diagnostic flash des incidents, dysfonctionnements et goulots d’étranglement.
-
Identifier les causes racines des problèmes rencontrés.
-
Mettre en œuvre des correctifs immédiats afin de restaurer la stabilité de la plateforme.
-
Reprendre et analyser les conclusions des expertises précédentes.
-
Auditer l’architecture, la configuration et le paramétrage de l’environnement MWAA.
-
Analyser les problématiques liées aux Schedulers, Executors, Celery et à la base de métadonnées Airflow.
-
Investiguer les problématiques de parallélisme, mémoire, ressources et dimensionnement.
-
Analyser les logs et métriques afin d’identifier les problèmes de performance.
-
Investiguer notamment les fuites mémoire, locks BDD, problèmes de capacité et d’auto-scaling MWAA.
-
Construire une feuille de route corrective priorisée.
-
Piloter la mise en œuvre des actions de remédiation.
-
Mesurer l’efficacité des corrections via des KPIs de performance et de stabilité.
-
Accompagner les équipes internes dans l’application des bonnes pratiques Airflow / MWAA.
-
Contribuer à la pérennisation de la plateforme et à l’amélioration de son architecture.
🎯 Objectifs
-
Court terme : rétablir rapidement la stabilité et la disponibilité de la plateforme MWAA.
-
Moyen terme : identifier précisément les causes structurelles des dysfonctionnements.
-
Long terme : mettre en place une architecture et une configuration robustes, performantes et maintenables.
-
Réduire durablement le taux d’incidents et les problèmes de performance.
-
Transférer l’expertise aux équipes en place.
🛠️ Compétences requises
-
Apache Airflow : expertise indispensable sur les mécanismes internes et le paramétrage.
-
Maîtrise approfondie des :
-
Schedulers
-
Executors
-
Celery / CeleryExecutor
-
Metadata Database
-
Gestion du parallélisme
-
Gestion mémoire et ressources
-
Tuning et optimisation des performances
-
AWS MWAA : expertise indispensable.
-
Maîtrise de l’écosystème AWS associé :
-
IAM
-
CloudWatch
-
S3
-
VPC
-
Security Groups
-
Expertise en troubleshooting et performance.
-
Capacité à analyser des logs complexes et des métriques d’exploitation.
-
Expérience des problématiques de :
-
Memory leaks
-
Database locks
-
Saturation de ressources
-
Auto-scaling
-
Dimensionnement MWAA
-
Expérience en audit technique et architecture Data Platform.
-
Expérience de missions de remédiation, crise ou Task Force.
👤 Profil
-
Senior Data Engineer, Architecte Data ou Expert Cloud/Data Infrastructure.
-
5 à 8 ans minimum d’expérience en ingénierie Data / infrastructure.
-
Forte spécialisation sur Apache Airflow, idéalement dans des environnements de production complexes.
-
Expérience concrète d’AWS MWAA.
-
Habitué aux contextes de diagnostic d’urgence, audit, stabilisation et refonte d’architecture.
-
Profil très analytique, pragmatique et orienté résolution de problèmes.
-
Forte capacité à intervenir rapidement dans un environnement existant et à prendre des décisions techniques.
-
Ce n’est pas un profil de développeur DAGs uniquement : l’expertise attendue porte principalement sur l’administration, le tuning, l’architecture et le troubleshooting d’Airflow/MWAA.