Skip to content

OneLake w Microsoft Fabric

Jedna warstwa danych zamiast wielu kopii i systemów

Rozproszona architektura danych

W klasycznych architekturach danych każda warstwa – hurtownia, data lake czy systemy BI – często operuje na własnej kopii danych. To zwiększa złożoność, koszty i utrudnia zarządzanie. Microsoft Fabric wprowadza inne podejście. Zamiast wielu rozproszonych magazynów danych, opiera się na jednej, wspólnej warstwie – OneLake.

Architektura OneLake w Microsoft Fabric oparta na Azure Data Lake Storage Gen2 i Delta Lake

Czym jest OneLake

OneLake to wspólna warstwa danych w Microsoft Fabric, na której operują wszystkie komponenty platformy – od inżynierii danych po raportowanie w Power BI.

Pełni rolę centralnego magazynu danych dla całej organizacji, eliminując potrzebę utrzymywania wielu kopii tych samych danych w różnych systemach. Wszystkie procesy w Microsoft Fabric – inżynieria danych, analityka czy data science – korzystają z tej samej warstwy danych.

Podejście to opiera się na koncepcji jednego źródła prawdy (single source of truth). W praktyce oznacza to ograniczenie silosów danych, uproszczenie zarządzania oraz spójność pracy zespołów, które operują na tych samych zbiorach danych.

OneLake nie jest osobnym systemem przechowywania danych, lecz warstwą logiczną opartą na Azure Data Lake Storage Gen2. Dane przechowywane są w otwartych formatach, takich jak Delta Lake, co umożliwia ich wykorzystanie przez różne silniki analityczne bez konieczności migracji lub transformacji.

Jak działa OneLake

Format danych

Azure Data Lake Storage Gen2 jako warstwa przechowywania danych w OneLake

OneLake wykorzystuje Azure Data Lake Storage Gen2 jako warstwę przechowywania danych w jednym miejscu – od danych strukturalnych po niestrukturalne.

W OneLake przechowywane są m.in.:

dane strukturalne – tabele Delta, pliki Parquet, CSV

dane półstrukturalne – JSON, XML

dane niestrukturalne – pliki tekstowe, obrazy, logi czy dokumenty

Delta Lake jako format danych zapewniający transakcyjność i wersjonowanie w OneLake

Kluczowym elementem OneLake jest format Delta Lake.

Delta Lake to otwarty format tabelaryczny oparty na Parquet, rozszerzony o warstwę transakcyjną (ACID) oraz wersjonowanie danych. Dzięki temu możliwe jest bezpieczne przetwarzanie danych przy równoległych operacjach oraz dostęp do ich historycznych wersji.

Najważniejsze cechy Delta Lake:

transakcje ACID – spójność danych przy równoległych operacjach

time travel – dostęp do wcześniejszych wersji danych

schema enforcement – kontrola zgodności danych ze schematem

optymalizacje wydajności – lepsza organizacja i odczyt danych

Shortcuts

Shortcuts w OneLake pozwalają korzystać z danych znajdujących się poza Microsoft Fabric tak, jakby były częścią tej samej przestrzeni danych.

Zamiast kopiować dane między systemami, OneLake umożliwia tworzenie logicznych odwołań do źródeł zewnętrznych. Dzięki temu dane pozostają w miejscu źródłowym, a jednocześnie są dostępne dla wszystkich komponentów Fabric.

Podejście to upraszcza architekturę danych i ogranicza liczbę operacji związanych z ich synchronizacją. Zmiana danych w źródle jest natychmiast widoczna w OneLake, bez potrzeby dodatkowych procesów aktualizacji.

Bezpieczeństwo

Microsoft Entra ID jako system zarządzania dostępem i tożsamością w OneLake

Dostęp do danych w OneLake zarządzany jest przez Microsoft Entra ID. Odpowiada on za uwierzytelnianie użytkowników oraz kontrolę uprawnień.

Kontrola dostępu odbywa się na kilku poziomach:

przestrzeń robocza (workspace)

zasób (item)

folder i dane

Takie podejście pozwala precyzyjnie określić, kto ma dostęp do konkretnych danych i operacji. Różne zespoły mogą pracować na tej samej warstwie danych, mając dostęp tylko do wybranych elementów.

Dodatkowo, model ról ogranicza zakres działań użytkowników:

Admin – pełna kontrola nad workspace

Member – edycja i zarządzanie zasobami

Contributor – tworzenie zawartości

Viewer – dostęp tylko do odczytu

OneLake wspiera również bezpieczną komunikację ze źródłami danych poprzez mechanizmy takie jak Private Link czy Data Gateway, co pozwala ograniczyć publiczny dostęp do danych i zachować kontrolę nad przepływem informacji.

Obsługa różnych narzędzi i technologii

Dzięki wspólnemu formatowi danych w OneLake, te same dane mogą być wykorzystywane przez różne silniki analityczne bez konieczności ich kopiowania.

W praktyce oznacza to możliwość pracy na jednej warstwie danych z wykorzystaniem różnych podejść i technologii:

Apache Spark – przetwarzanie danych i data science (PySpark, Scala, Spark SQL)

SQL (Polaris) – zapytania analityczne w języku T-SQL

Python – analiza danych i szybkie operacje bez konieczności uruchamiania klastra

Direct Lake – bezpośredni dostęp Power BI do danych w OneLake

KQL – analiza danych w czasie rzeczywistym i logów

Każdy z tych silników operuje na tych samych danych, co eliminuje potrzebę tworzenia oddzielnych warstw dla różnych zastosowań i upraszcza architekturę analityczną.

OneLake jako fundament Microsoft Fabric

OneLake stanowi centralną warstwę danych dla wszystkich komponentów Microsoft Fabric. Niezależnie od tego, czy dane są przetwarzane przez team inżynierów danych, analizowane w Power BI czy wykorzystywane w modelach data science, wszystkie operacje odbywają się na tej samej warstwie danych.

W klasycznych architekturach poszczególne narzędzia często korzystają z własnych magazynów danych lub ich kopii. W Microsoft Fabric podejście to zostało uproszczone – wszystkie komponenty platformy operują bezpośrednio na danych przechowywanych w OneLake.

Takie podejście eliminuje konieczność replikacji danych między systemami, upraszcza przepływ danych oraz pozwala na równoległą pracę różnych zespołów na tych samych zbiorach danych.

OneLake jako centralna warstwa danych dla komponentów Microsoft Fabric

Integracja źródeł danych

OneLake umożliwia bezpośrednią pracę na danych pochodzących z różnych systemów – bez konieczności ich kopiowania i duplikowania w wielu miejscach. Platforma integruje źródła chmurowe, lokalne oraz usługi SaaS, tworząc jedną, spójną warstwę danych dostępną dla całej organizacji.

Dzięki temu zespoły mogą korzystać z tych samych danych niezależnie od narzędzia czy kontekstu pracy – od analityki, przez raportowanie, aż po modele AI.

Zamiast budować złożone procesy ETL i utrzymywać wiele kopii tych samych danych, OneLake pozwala pracować bezpośrednio na źródłach poprzez mechanizmy takie jak shortcuts. Dane pozostają w oryginalnym miejscu, a jednocześnie są dostępne w ramach jednej architektury, co znacząco upraszcza zarządzanie i ogranicza koszty utrzymania.

OneLake jako centralna warstwa danych integrująca różne źródła w Microsoft Fabric

Jedna warstwa danych, realna przewaga biznesowa

OneLake zmienia sposób, w jaki organizacje pracują z danymi – zamiast zarządzać wieloma kopiami i rozproszonymi systemami, wszystkie zespoły korzystają z jednej, spójnej warstwy danych.

To oznacza mniej złożoności, niższe koszty utrzymania i szybszy dostęp do aktualnych informacji. Dane nie są już blokowane w silosach – stają się dostępne tam, gdzie są potrzebne, w czasie rzeczywistym.

Dzięki temu firmy mogą szybciej podejmować decyzje, lepiej wykorzystywać potencjał analityki i budować rozwiązania oparte na danych bez ograniczeń typowych dla tradycyjnych architektur.

Skontaktuj się z nami

Chcesz uporządkować dane i ograniczyć ich duplikację w organizacji?
Umów krótką konsultację i sprawdź, jak OneLake może uprościć Twoją architekturę danych.

Antdata - calendar person