OneLake nedir, neden var?
Geleneksel veri mimarilerinde her ekip — veri mühendisliği, veri bilimi, iş zekası — kendi veri kopyasını tutardı. Satış ekibi Excel'den çeker, BI ekibi SQL'den çeker, veri bilimcisi kendi veri setini hazırlar. Sonuç: aynı verinin onlarca kopyası, tutarsızlıklar, veri güvencesi sorunları ve yönetim karmaşası.
OneLake, Microsoft Fabric'in merkezi veri gölü olarak bu döngüyü kırıyor. Tek bir veri gölü, tüm Fabric deneyimlerine — Lakehouse, Warehouse, Data Factory, ML — tek bir veri kaynağı olarak hizmet veriyor.
OneLake mimarisi: Tek veri gölü, sonsuz deneyim
OneLake, Azure Data Lake Storage Gen2 üzerine inşa edilmiş ve OneDrive'ın dosya organizasyonu mantığıyla çalışıyor. Her tenant için tek bir mantıksal veri gölü oluşturuyor ve tüm veri varlıklarınız burada yaşıyor.
Klasik veri göllerinden farkı: Short-cut mekanizması. Bir ekip veriyi bir kez yüklediğinde, diğer ekipler bu veriye fiziksel olarak kopyalamadan erişebiliyor. Veri hâlâ tek bir yerde duruyor, sadece farklı deneyimler bu veriye işaret ediyor.
💡 Teknik not: OneLake, Delta formatını varsayılan depolama formatı olarak kullanıyor. Parquet tabanlı bu format, hem ACID işlemleri hem de açık kaynak ekosistemle uyumluluk sağlıyor. Yani verilerinizi Spark, Snowflake, Databricks veya Fabric — hangisi olursa olsun — aynı formatta okuyabiliyorsunuz.
OneLake'de veri organizasyonu: Workspace ve item yapısı
OneLake'de her şey iki seviyede organize ediliyor:
- Workspace — projeler veya ekipler bazında mantıksal ayrım. Her workspace'in kendi güvenlik ve erişim denetimi var.
- Item — Lakehouse, Warehouse, Data Pipeline, ML Model gibi Fabric deneyimlerinin kendisi. Her item, OneLake'de bir klasör olarak karşılık buluyor.
Bu yapı, Kimball'ın veri ambarcılığı yaklaşımıyla da uyumlu. Veri ambarcılığında "data mart" kavramı neyse, Fabric'te "item" odaklı yaklaşım da aynı işlevi görüyor — işlevsel ekipler kendi veri alanlarını bağımsız olarak yönetiyor, ama hepsi aynı veri gölünü paylaşıyor.
Direct Lake mode: Power BI performansının sırrı
OneLake'in Power BI ile entegrasyonunda en güçlü özellik Direct Lake modu. Bu modda Power BI, verileri OneLake'den doğrudan okuyor — ne import ne de DirectQuery gibi ara katmanlar var.
Import mode'da veriler Power BI'ın belleğine kopyalanır, bu hızlıdır ama veriler güncel olmayabilir. DirectQuery'de ise her sorgu kaynağa gider, bu güncellik sağlar ama yavaştır. Direct Lake, her iki dünyanın en iyisini sunuyor: güncel veri, düşük gecikme.
Gerçek kullanım senaryosu: Perakende şirketi
Örnek üzerinden gidelim. Bir perakende zinciri düşünün: POS sistemleri, e-ticaret sitesi, CRM, tedarik zinciri ve finans sistemleri ayrı veri kaynaklarından besleniyor.
Geleneksel yaklaşım: Her ekip kendi ETL sürecini yazıyor, kendi veri ambarını oluşturuyor, kendi raporlarını üretiyor. Sonuçta onlarca veri kopyası, tutarsız metrikler, yüksek bakım maliyeti.
OneLake yaklaşımı: Data Factory ile tüm kaynaklardan veriler OneLake'e aktarılıyor. Lakehouse'ta dönüşüm ve modelleme yapılıyor. Warehouse'da iş kullanıcıları için raporlama hazırlanıyor. Data Science ekibi aynı veriye ML modelleri için erişiyor. Power BI ise Direct Lake ile anlık raporlar sunuyor. Tüm bunlar tek bir veri kaynağı üzerinden, sıfır veri kopyasıyla.
OneLake ve güvenlik
OneLake, Azure Active Directory ve Fabric'in rol tabanlı erişim denetimiyle (RBAC) entegre çalışıyor. Workspace seviyesinde yetkilendirme yapılabildiği gibi, satır düzeyinde güvenlik (RLS) ile hassas verilerin yalnızca yetkili kullanıcılara gösterilmesi sağlanabiliyor.
Ayrıca Microsoft Purview ile OneLake'deki verilerinizin veri haritası, veri sözlüğü ve duyarlılık sınıflandırması yapılabiliyor. KVKK ve GDPR uyumu için bu özellikler kritik önem taşıyor.
OneLake'e geçiş: Nereden başlamalı?
Mevcut bir veri mimarisinden OneLake'e geçiş, büyük bir proje gibi görünse de adım adım ilerlenebilir. İşte pratik bir yol haritası:
- Veri envanteri çıkarın: Hangi veriler nerede, kim kullanıyor, hangi bağımlılıklar var?
- Kritik veri akışları belirleyin: En çok kullanılan ve en değerli veri akışlarından başlayın.
- Landing zone oluşturun: Ham verilerin OneLake'e ilk giriş noktasını tanımlayın.
- Short-cut ile mevcut verilere bağlanın: Verileri taşımadan önce mevcut ADLS Gen2 veya Azure Blob verilerinize short-cut oluşturun.
- Delta formatına dönüştürün: Parquet formatındaki verilerinizi Delta formatına evirerek Fabric'in tüm özelliklerinden yararlanın.
Sonuç
OneLake, veri yönetiminde "tek kaynak, çoklu tüketim" ilkesini hayata geçiriyor. Veri kopyalamadan, tutarsızlıklardan ve silolardan kurtulmak istiyorsanız, Fabric ekosistemine geçişte OneLake en doğru başlangıç noktası. Tüm veri profesyonellerinin — veri mühendislerinden iş analistlerine — aynı veri havuzundan çalışması, hem verimliliği artırıyor hem de veri yönetişimini sadeleştiriyor.