Construire et exploiter une solution d’analyse
- Mettre en place les espaces de travail Fabric : Spark, domaines, OneLake et Apache Airflow
- Gérer le cycle de vie : contrôle de version, projets de base de données, pipelines de déploiement
- Sécurité et gouvernance : accès au niveau de l’espace de travail et des éléments, au niveau des lignes, des colonnes et des objets, masquage dynamique des données, étiquettes de confidentialité, journaux d’audit, sécurité OneLake
- Orchestrer les traitements : choisir entre Dataflow Gen2, pipeline ou notebook ; planifications et déclencheurs basés sur les événements ; modèles d’orchestration avec paramètres et expressions dynamiques
Ingérer et transformer les données
- Concevoir des modèles de chargement : chargement complet et incrémentiel, préparation pour un modèle dimensionnel, modèles de chargement pour les données en flux
- Données par lots : choisir le magasin de données adapté, transformation avec Dataflows Gen2, notebooks, KQL ou T-SQL
- Raccourcis OneLake et mise en miroir (mirroring), ingestion via des pipelines
- Transformation avec PySpark, SQL et KQL : dénormaliser, regrouper, agréger, traiter les doublons ainsi que les données manquantes et tardives
- Données en flux : choisir le moteur de streaming adapté, Eventstreams, Spark Structured Streaming, KQL, fonctions de fenêtrage
Surveiller et optimiser
- Surveiller l’ingestion, la transformation et l’actualisation des modèles sémantiques, mettre en place des alertes
- Cerner et résoudre les erreurs – dans les pipelines, Dataflows, notebooks, Eventhouse, Eventstream, T-SQL et les raccourcis OneLake
- Optimiser les performances : tables Lakehouse, pipelines, entrepôt de données, Eventstreams et Eventhouses, Spark et requêtes