Fabric und Azure

Was ist ein Data Lake? Unterschied zum Data Warehouse

Was ein Data Lake ist, wie er sich von Warehouse und Lakehouse unterscheidet und wie er bei Microsoft läuft: OneLake, ADLS Gen2, Delta, Direct Lake.

Austin Levine

·

Aktualisiert

Ein Data Lake ist ein Speicher, der Daten in ihrem rohen, nativen Format hält, strukturiert oder nicht, bis etwas sie für eine Analyse braucht. Anders als ein Warehouse verlangt er kein festes Schema, bevor Daten darin landen können. Im Microsoft-Umfeld ist der Data Lake OneLake: ein Lake pro Tenant, fest in Microsoft Fabric eingebaut und von Azure Data Lake Storage Gen2 getragen.

Wie sich ein Data Lake vom Data Warehouse unterscheidet


Data Warehouse

Data Lake

Schema

Wird vor dem Laden der Daten festgelegt (Schema-on-Write)

Wird beim Lesen der Daten angewendet (Schema-on-Read)

Form der Daten

Strukturierte, modellierte Tabellen

Jedes Format: CSV, JSON, Parquet, Bilder, Logs

Typische Nutzung

Reporting und BI auf kuratierten, modellierten Daten

Rohdaten aus vielen Quellen günstig speichern

Aufwand für die Struktur

Vorab bezahlt, bei der Modellierung

Später bezahlt, wenn jemand die Daten abfragt oder transformiert

Ein Warehouse liefert schnelle, konsistente Abfragen, weil die Struktur schon feststeht. Ein Lake erlaubt flexibles Laden, weil sie es nicht tut. Die Modellierungsarbeit rückt damit weiter nach hinten in die Pipeline, statt zu entfallen.

Was ein Lakehouse ergänzt

Ein Lakehouse verbindet den günstigen, flexiblen Dateispeicher eines Lake mit den Transaktionsgarantien eines Warehouse. Dafür nutzt es ein offenes Tabellenformat, meist Delta Lake: Dateien als Parquet, gepaart mit einem Transaktionslog, das ACID-Transaktionen, Schemaprüfung und Versionsverlauf auf Dateien in gewöhnlichem Lake-Speicher legt.

Ein Lakehouse-Item in Microsoft Fabric ist dieses Muster, fertig eingebaut. Es bietet über demselben zugrunde liegenden Speicher zwei Bereiche: einen Bereich Files für rohe, unstrukturierte Daten und einen Bereich Tables, in dem Daten als Delta-Tabellen liegen und sich entweder mit einem SQL-Endpunkt oder einem Spark-Notebook abfragen lassen.

Die Umsetzung von Microsoft: OneLake, ADLS Gen2 und Delta-Tabellen

Drei Teile bilden die Umsetzung von Microsoft:

  • OneLake ist der einzige Data Lake hinter jedem Microsoft-Fabric-Tenant. Er nutzt Azure Data Lake Storage Gen2 als zugrunde liegende Speicherschicht. Daten von Lakehouse und Warehouse liegen in demselben Lake, geordnet nach Workspace und Item statt in getrennten, nicht verbundenen Speicherkonten.

  • Delta-Tabellen sind das Standard-Tabellenformat in einem Fabric Lakehouse. Weil das Format offen ist (Parquet plus Transaktionslog), kann dieselbe Tabelle von einem Spark-Notebook, einer SQL-Abfrage oder einem Power-BI-Report gelesen werden, ohne dass Daten zwischen Engines kopiert werden.

  • Direct Lake ist der Power-BI-Speichermodus für genau diese Art von Daten. Er liest Delta-Parquet-Tabellen aus OneLake für einen Report direkt in den Arbeitsspeicher. Er kopiert die Daten nicht in das Modell wie der Import-Modus, der eine vollständige Kopie der Daten im Semantic Model speichert, und er schickt auch nicht jede Abfrage an eine Quelle zurück wie DirectQuery, das bei jeder Interaktion im Report die Quelle live abfragt.

Wie die beiden Produkte zusammenpassen, lesen Sie in unserem Leitfaden zu Microsoft Fabric und Power BI, und wie sich OneLake in den Rest der Plattform einfügt, unter Warum Microsoft Fabric.

Ein konkretes Beispiel: Daten in OneLake laden und bereinigen

Ein gängiges Muster lädt Rohdateien in den Bereich Files eines Lakehouse, bereinigt sie mit einem Notebook und schreibt das Ergebnis als Delta-Tabelle:

df = spark.read.option("header", "true").csv("Files/raw/sales/2026-09-01_sales.csv")

df_clean = df.dropna(subset=["ProductID", "Quantity", "UnitPrice"])

df_clean.write.format("delta").mode("overwrite").saveAsTable("sales_clean")

Das CSV wird aus dem Bereich Files des Lakehouse gelesen. Geschrieben wird in den Bereich Tables als verwaltete Delta-Tabelle, die sofort per SQL abfragbar ist oder für ein Direct-Lake-Semantic-Model sichtbar wird, ohne separaten Export oder Ladeschritt.

Wann ein Data Lake statt eines Warehouse die richtige Wahl ist

  • Viele Quellformate, vorab unbekannte Struktur. Logs, Sensordaten, Exporte aus mehreren Systemen ohne gemeinsames Schema.

  • Günstige Langzeitspeicherung roher Historie. Die Originaldateien für eine erneute Verarbeitung behalten, auch wenn anderswo schon eine bereinigte Version existiert.

  • Data Science und explorative Arbeit, die die Rohdaten braucht und nicht nur eine modellierte Zusammenfassung.

Greifen Sie zu einem Warehouse oder zum Bereich Tables eines Lakehouse, sobald der Reporting-Bedarf definiert und stabil genug zum Modellieren ist. Wie Sie Daten aus anderen Azure-Quellen in diesen Lake bringen, lesen Sie in unserem Vergleich von Data Factory: Fabric vs. Azure.

FAQs

Was ist der Unterschied zwischen einem Data Lake und einem Data Warehouse?

Ein Warehouse braucht ein definiertes Schema, bevor Daten geladen werden, und ist für konsistente, schnelle Reporting-Abfragen gebaut. Ein Lake nimmt Daten im Rohformat an und verschiebt die Struktur auf den Zeitpunkt, zu dem jemand sie liest. Dafür gibt er Konsistenz bei Abfragen für flexibles Laden auf.

Was ist ein Lakehouse?

Ein Lakehouse ist ein Data Lake mit einem transaktionalen Tabellenformat obendrauf, meist Delta Lake. Es behält den günstigen, flexiblen Dateispeicher eines Lake und ergänzt ACID-Transaktionen und Schemaprüfung eines Warehouse.

Verbindet sich Power BI direkt mit einem Data Lake?

Ja. Power BI kann Delta-Tabellen in einem Fabric Lakehouse direkt über den Direct-Lake-Modus abfragen oder sich über Power Query wie mit jeder anderen Quelle mit Lake-Speicher verbinden.

Quellen

Ein Data Lake ist ein Speicher, der Daten in ihrem rohen, nativen Format hält, strukturiert oder nicht, bis etwas sie für eine Analyse braucht. Anders als ein Warehouse verlangt er kein festes Schema, bevor Daten darin landen können. Im Microsoft-Umfeld ist der Data Lake OneLake: ein Lake pro Tenant, fest in Microsoft Fabric eingebaut und von Azure Data Lake Storage Gen2 getragen.

Wie sich ein Data Lake vom Data Warehouse unterscheidet


Data Warehouse

Data Lake

Schema

Wird vor dem Laden der Daten festgelegt (Schema-on-Write)

Wird beim Lesen der Daten angewendet (Schema-on-Read)

Form der Daten

Strukturierte, modellierte Tabellen

Jedes Format: CSV, JSON, Parquet, Bilder, Logs

Typische Nutzung

Reporting und BI auf kuratierten, modellierten Daten

Rohdaten aus vielen Quellen günstig speichern

Aufwand für die Struktur

Vorab bezahlt, bei der Modellierung

Später bezahlt, wenn jemand die Daten abfragt oder transformiert

Ein Warehouse liefert schnelle, konsistente Abfragen, weil die Struktur schon feststeht. Ein Lake erlaubt flexibles Laden, weil sie es nicht tut. Die Modellierungsarbeit rückt damit weiter nach hinten in die Pipeline, statt zu entfallen.

Was ein Lakehouse ergänzt

Ein Lakehouse verbindet den günstigen, flexiblen Dateispeicher eines Lake mit den Transaktionsgarantien eines Warehouse. Dafür nutzt es ein offenes Tabellenformat, meist Delta Lake: Dateien als Parquet, gepaart mit einem Transaktionslog, das ACID-Transaktionen, Schemaprüfung und Versionsverlauf auf Dateien in gewöhnlichem Lake-Speicher legt.

Ein Lakehouse-Item in Microsoft Fabric ist dieses Muster, fertig eingebaut. Es bietet über demselben zugrunde liegenden Speicher zwei Bereiche: einen Bereich Files für rohe, unstrukturierte Daten und einen Bereich Tables, in dem Daten als Delta-Tabellen liegen und sich entweder mit einem SQL-Endpunkt oder einem Spark-Notebook abfragen lassen.

Die Umsetzung von Microsoft: OneLake, ADLS Gen2 und Delta-Tabellen

Drei Teile bilden die Umsetzung von Microsoft:

  • OneLake ist der einzige Data Lake hinter jedem Microsoft-Fabric-Tenant. Er nutzt Azure Data Lake Storage Gen2 als zugrunde liegende Speicherschicht. Daten von Lakehouse und Warehouse liegen in demselben Lake, geordnet nach Workspace und Item statt in getrennten, nicht verbundenen Speicherkonten.

  • Delta-Tabellen sind das Standard-Tabellenformat in einem Fabric Lakehouse. Weil das Format offen ist (Parquet plus Transaktionslog), kann dieselbe Tabelle von einem Spark-Notebook, einer SQL-Abfrage oder einem Power-BI-Report gelesen werden, ohne dass Daten zwischen Engines kopiert werden.

  • Direct Lake ist der Power-BI-Speichermodus für genau diese Art von Daten. Er liest Delta-Parquet-Tabellen aus OneLake für einen Report direkt in den Arbeitsspeicher. Er kopiert die Daten nicht in das Modell wie der Import-Modus, der eine vollständige Kopie der Daten im Semantic Model speichert, und er schickt auch nicht jede Abfrage an eine Quelle zurück wie DirectQuery, das bei jeder Interaktion im Report die Quelle live abfragt.

Wie die beiden Produkte zusammenpassen, lesen Sie in unserem Leitfaden zu Microsoft Fabric und Power BI, und wie sich OneLake in den Rest der Plattform einfügt, unter Warum Microsoft Fabric.

Ein konkretes Beispiel: Daten in OneLake laden und bereinigen

Ein gängiges Muster lädt Rohdateien in den Bereich Files eines Lakehouse, bereinigt sie mit einem Notebook und schreibt das Ergebnis als Delta-Tabelle:

df = spark.read.option("header", "true").csv("Files/raw/sales/2026-09-01_sales.csv")

df_clean = df.dropna(subset=["ProductID", "Quantity", "UnitPrice"])

df_clean.write.format("delta").mode("overwrite").saveAsTable("sales_clean")

Das CSV wird aus dem Bereich Files des Lakehouse gelesen. Geschrieben wird in den Bereich Tables als verwaltete Delta-Tabelle, die sofort per SQL abfragbar ist oder für ein Direct-Lake-Semantic-Model sichtbar wird, ohne separaten Export oder Ladeschritt.

Wann ein Data Lake statt eines Warehouse die richtige Wahl ist

  • Viele Quellformate, vorab unbekannte Struktur. Logs, Sensordaten, Exporte aus mehreren Systemen ohne gemeinsames Schema.

  • Günstige Langzeitspeicherung roher Historie. Die Originaldateien für eine erneute Verarbeitung behalten, auch wenn anderswo schon eine bereinigte Version existiert.

  • Data Science und explorative Arbeit, die die Rohdaten braucht und nicht nur eine modellierte Zusammenfassung.

Greifen Sie zu einem Warehouse oder zum Bereich Tables eines Lakehouse, sobald der Reporting-Bedarf definiert und stabil genug zum Modellieren ist. Wie Sie Daten aus anderen Azure-Quellen in diesen Lake bringen, lesen Sie in unserem Vergleich von Data Factory: Fabric vs. Azure.

FAQs

Was ist der Unterschied zwischen einem Data Lake und einem Data Warehouse?

Ein Warehouse braucht ein definiertes Schema, bevor Daten geladen werden, und ist für konsistente, schnelle Reporting-Abfragen gebaut. Ein Lake nimmt Daten im Rohformat an und verschiebt die Struktur auf den Zeitpunkt, zu dem jemand sie liest. Dafür gibt er Konsistenz bei Abfragen für flexibles Laden auf.

Was ist ein Lakehouse?

Ein Lakehouse ist ein Data Lake mit einem transaktionalen Tabellenformat obendrauf, meist Delta Lake. Es behält den günstigen, flexiblen Dateispeicher eines Lake und ergänzt ACID-Transaktionen und Schemaprüfung eines Warehouse.

Verbindet sich Power BI direkt mit einem Data Lake?

Ja. Power BI kann Delta-Tabellen in einem Fabric Lakehouse direkt über den Direct-Lake-Modus abfragen oder sich über Power Query wie mit jeder anderen Quelle mit Lake-Speicher verbinden.

Quellen

Zeigen Sie uns Ihren Report, dem niemand traut.

1 · Ein Gespräch von 30 Minuten.

2 · Wir sehen uns gemeinsam Ihre aktuellen Reports an.

3 · Wir sagen Ihnen, was wir tun würden.

Zeigen Sie uns Ihren Report, dem niemand traut.

1 · Ein Gespräch von 30 Minuten.

2 · Wir sehen uns gemeinsam Ihre aktuellen Reports an.

3 · Wir sagen Ihnen, was wir tun würden.

Zeigen Sie uns Ihren Report, dem niemand traut.

1 · Ein Gespräch von 30 Minuten.

2 · Wir sehen uns gemeinsam Ihre aktuellen Reports an.

3 · Wir sagen Ihnen, was wir tun würden.

CaseWhen ist eine BI-Beratung aus Berlin. Wir bauen Reporting, dem die Geschäftsführung vertraut, auf dem Microsoft-Stack: Power BI, Fabric und Azure.

Berlin, Deutschland

© CaseWhen Consulting GmbH

Deutsch

CaseWhen ist eine BI-Beratung aus Berlin. Wir bauen Reporting, dem die Geschäftsführung vertraut, auf dem Microsoft-Stack: Power BI, Fabric und Azure.

Berlin, Deutschland

© CaseWhen Consulting GmbH

Deutsch

CaseWhen ist eine BI-Beratung aus Berlin. Wir bauen Reporting, dem die Geschäftsführung vertraut, auf dem Microsoft-Stack: Power BI, Fabric und Azure.

Berlin, Deutschland

© CaseWhen Consulting GmbH

Deutsch