Analyselösung aufbauen und betreiben
- Fabric-Arbeitsbereiche einrichten: Spark, Domänen, OneLake und Apache Airflow
- Lebenszyklus verwalten: Versionskontrolle, Datenbankprojekte, Bereitstellungspipelines
- Sicherheit und Governance: Zugriff auf Arbeitsbereichs- und Elementebene, Zeilen-, Spalten- und Objektebene, dynamische Datenmaskierung, Vertraulichkeitsbezeichnungen, Überwachungsprotokolle, OneLake-Sicherheit
- Abläufe orchestrieren: Dataflow Gen2, Pipeline oder Notebook richtig wählen; Zeitpläne und ereignisbasierte Auslöser; Orchestrierungsmuster mit Parametern und dynamischen Ausdrücken
Daten aufnehmen und transformieren
- Ladepattern entwerfen: Voll- und Inkrementalladung, Aufbereitung für ein dimensionales Modell, Ladepattern für Streamingdaten
- Batchdaten: passenden Datenspeicher wählen, Transformation mit Dataflows Gen2, Notebooks, KQL oder T-SQL
- OneLake-Verknüpfungen und Mirroring, Aufnahme über Pipelines
- Transformation mit PySpark, SQL und KQL: denormalisieren, gruppieren, aggregieren, Dubletten sowie fehlende und verspätete Daten behandeln
- Streamingdaten: passende Streaming-Engine wählen, Eventstreams, Spark Structured Streaming, KQL, Fensterfunktionen
Überwachen und optimieren
- Aufnahme, Transformation und Aktualisierung semantischer Modelle überwachen, Warnungen einrichten
- Fehler eingrenzen und beheben – in Pipelines, Dataflows, Notebooks, Eventhouse, Eventstream, T-SQL und bei OneLake-Verknüpfungen
- Leistung optimieren: Lakehouse-Tabellen, Pipelines, Data Warehouse, Eventstreams und Eventhouses, Spark und Abfragen