İçeriğe geç

Data Lakehouse

Data Lakehouse: Modern Data ve AI Mimarilerinin Ortak Veri Katmanı

Data Lakehouse, Data Lake'in ölçeklenebilir ve esnek veri saklama yaklaşımı ile Data Warehouse'un tablo yönetimi, güvenilirlik ve analitik yeteneklerini ortak bir veri mimarisinde birleştirir.

Son güncelleme: Eylül 2026

Data Lakehouse, Data Lake'in ölçeklenebilir ve esnek veri saklama yaklaşımı ile Data Warehouse'un tablo yönetimi, güvenilirlik ve analitik yeteneklerini ortak bir veri mimarisinde birleştiren yaklaşımdır. Modern bir Data Lakehouse yalnızca verilerin saklandığı bir alan değildir; Analytics, Business Intelligence, Machine Learning ve Generative AI iş yüklerinin aynı kurumsal veri üzerinde çalışabilmesini sağlayan ortak bir veri katmanı oluşturur. Veri object storage üzerinde açık formatlarda durur, tablo yönetimi ise bu dosyaların üzerindeki bir metadata katmanıyla sağlanır.

Modern bir Data Lakehouse yalnızca verilerin saklandığı bir alan değildir. Analytics, Business Intelligence, Machine Learning ve Generative AI iş yüklerinin aynı kurumsal veri üzerinde çalışabilmesini sağlayan ortak bir veri katmanı oluşturur.

Kauzas Data Platform, açık ve değiştirilebilir teknoloji katmanları üzerine kurulu Lakehouse mimarisiyle kurumsal verinin farklı analitik ve AI iş yükleri tarafından kullanılmasını sağlar.

Data Lake, Data Warehouse ve Data Lakehouse

Geleneksel Data Warehouse sistemleri yapılandırılmış verinin raporlama ve analitik amaçlarla kullanılmasında güçlüdür. Data Lake yaklaşımı ise yapılandırılmış ve yapılandırılmamış büyük miktarda verinin daha esnek ve ekonomik storage katmanlarında tutulabilmesini sağlar.

Ancak yalnızca dosyaların object storage üzerinde tutulması kurumsal bir veri platformu oluşturmak için yeterli değildir. Data Lakehouse yaklaşımı bu iki dünyanın avantajlarını birleştirmeyi hedefler:

Data WarehouseData LakeData Lakehouse
Structured data✓✓✓
Unstructured dataSınırlı✓✓
SQL analytics✓Değişken✓
ML / AIDeğişken✓✓
Açık dosya formatlarıGenellikle sınırlı✓✓
Table management✓Sınırlı✓
Schema evolutionPlatforma bağlıSınırlı✓
Çoklu compute engineGenellikle sınırlı✓✓
Object storagePlatforma bağlı✓✓

Veriyi ayrı analitik ve AI platformlarına tekrar tekrar kopyalamak yerine ortak bir veri katmanı oluşturmak.

Lakehouse'un Katmanları

Modern bir Lakehouse mimarisi kabaca şu katmanlardan oluşur:

  1. Enterprise Data Sources
  2. Data Integration & Processing
  3. Object Storage
  4. Open Table Format
  5. Catalog
  6. Query & Processing Engines
  7. Analytics / BI / ML / AI

Bu mimaride storage ve compute birbirinden ayrılabilir. Veri object storage üzerinde tutulurken farklı compute teknolojileri aynı veri üzerinde farklı iş yükleri gerçekleştirebilir.

Örneğin aynı veri Trino ile SQL sorgularında, Apache Spark ile büyük ölçekli data processing ve makine öğrenmesi süreçlerinde, başka AI servisleri tarafından ise model veya Agent kullanım senaryolarında kullanılabilir.

Parquet Dosyaları Tek Başına Lakehouse Yapmaz

Object storage üzerinde Parquet dosyaları tutmak tek başına Lakehouse oluşturmaz. Kurumsal ölçekte tabloların şu yönlerinin yönetilmesi gerekir:

  • Schema değişiklikleri
  • Partition yapıları
  • Snapshot'lar
  • Metadata
  • Transaction durumları

Bu nedenle modern Lakehouse mimarilerinde Apache Iceberg gibi açık table formatları kullanılabilir.

Apache Iceberg büyük analitik veri setleri için geliştirilmiş açık bir table formatıdır; schema evolution, partition evolution ve snapshot tabanlı table state gibi özellikleri destekler. Bu sayede veri object storage üzerinde açık formatlarda tutulurken kurumsal tablo yönetimi yetenekleri sağlanabilir.

Apache Iceberg

Kauzas Data Platform'un Lakehouse mimarisinde Apache Iceberg kullanılabilir.

Iceberg verinin kendisini proprietary bir database formatına kapatmak yerine Parquet, ORC veya Avro gibi veri dosyalarının üzerinde bir table metadata katmanı oluşturur. Bu mimari önemli yetenekler sağlar.

Schema evolution

Tabloya kolon eklemek, kaldırmak, yeniden adlandırmak veya uygun veri tiplerini değiştirmek mümkün olabilir. Iceberg bu değişikliklerin önemli bir bölümünü mevcut data file'larını yeniden yazmadan metadata değişiklikleriyle gerçekleştirebilir.

Partition evolution

Veri büyüdükçe veya sorgu biçimleri değiştikçe partition stratejisi değiştirilebilir. Iceberg eski ve yeni partition düzenlerinin aynı tabloda birlikte çalışmasını destekler.

Hidden partitioning

Uygulamaların fiziksel partition yapısını bilmesi gerekmez. Iceberg sorguları fiziksel partition yapısından ayırarak veri düzeninin zaman içerisinde değiştirilebilmesini kolaylaştırır.

Time travel

Snapshot yapısı sayesinde tablonun geçmiş durumları üzerinde sorgular gerçekleştirilebilir.

Lakehouse'u bir dosya deposu olmaktan çıkaran şey bu özelliklerdir.

Data Catalog

Bir Lakehouse içerisinde binlerce tablo bulunabilir ve bu tabloların yalnızca storage üzerinde bulunması yeterli değildir. Sistemlerin şunları bilmesi gerekir:

  • Hangi tabloların bulunduğunu
  • Tabloların schema'larını
  • Metadata'sını
  • Güncel table state'ini

Bu nedenle Lakehouse mimarisinde catalog kritik bir bileşendir.

Kauzas mimarisinde açık table formatlarıyla birlikte çalışan catalog yaklaşımı sayesinde farklı compute engine'lerinin aynı kurumsal veri katmanını kullanabileceği mimariler oluşturulabilir.

Storage ve Compute'u Ayırmak

Geleneksel veri platformlarında storage ve compute çoğu zaman aynı sistem içerisinde sıkı biçimde bağlıdır. Lakehouse mimarisinde ise iki katman ayrılabilir.

  1. Object storage
  2. Parquet / ORC / Avro
  3. Apache Iceberg tabloları

Bu katmanın üzerinde Trino, Spark, analitik, makine öğrenmesi ve AI iş yükleri birbirinden bağımsız çalışır ve bağımsız ölçeklenir.

Bu ayrım sayesinde aynı verinin farklı kullanım senaryoları için tekrar tekrar başka platformlara taşınması ihtiyacı azaltılabilir. Aynı zamanda compute kapasitesi iş yüküne göre bağımsız olarak ölçeklenebilir.

Distributed SQL ile Lakehouse Verisini Sorgulamak

Lakehouse üzerinde bulunan verinin SQL ile hızlı ve ölçeklenebilir biçimde sorgulanabilmesi gerekir. Kauzas mimarisinde Trino gibi distributed SQL query engine'leri kullanılabilir.

Trino, Iceberg dahil farklı table formatlarında ve S3 ile S3 uyumlu object storage dahil farklı storage sistemlerinde bulunan verileri sorgulayabilir. Bu sayede Lakehouse verileri şu kullanımlara açılır:

  • BI
  • Ad-hoc analytics
  • Data applications
  • Farklı veri servisleri

Apache Spark ve Data Processing

Lakehouse yalnızca sorgulama katmanından oluşmaz. Verinin işlenmesi, temizlenmesi, dönüştürülmesi, zenginleştirilmesi ve makine öğrenmesi süreçlerine hazırlanması gerekir.

Kauzas Data Platform'da Apache Spark gibi dağıtık data processing teknolojileri bu iş yükleri için kullanılabilir. Böylece SQL analytics ve büyük ölçekli data processing iş yükleri aynı Lakehouse veri katmanı üzerinde çalışabilir.

Data Lakehouse ve Yapay Zekâ

AI modellerinin değeri erişebildikleri kurumsal veriyle doğrudan ilişkilidir. Bir kurumun verisi Data Warehouse, Data Lake, operasyonel veritabanı, doküman sistemi ve uygulamalarda birbirinden kopuk duruyorsa AI projeleri için tekrar tekrar yeni veri entegrasyonları oluşturmak gerekir.

Lakehouse, kurumsal verinin AI tarafından kullanılabileceği ortak veri katmanlarından biri haline gelebilir.

  1. Enterprise Data
  2. Data Lakehouse
  3. Catalog + Governance
  4. Analytics / ML / AI
  5. RAG / AI Agents / Applications

Modern Lakehouse mimarisi yalnızca Business Intelligence altyapısı değil, kurumsal AI altyapısının veri temelidir.

Lakehouse ve Enterprise RAG

Enterprise RAG sistemleri yalnızca dokümanlardan bilgi almak zorunda değildir. Lakehouse üzerinde bulunan structured kurumsal veri de AI uygulamalarının kullanabileceği bilgi kaynaklarından biri olabilir.

Bir kullanıcı “Geçen ay en yüksek satış artışı gösteren ürünler hangileri?” diye sorduğunda cevap structured veriden gelebilir. Ardından “Bu ürünlerin teknik özellikleri neler?” sorusunun cevabı dokümanlardan gelebilir.

Bu durumda AI sistemi structured ve unstructured kaynakları aynı konuşma içerisinde kullanabilir.

Enterprise RAG hakkında daha fazla bilgi

Lakehouse ve AI Agent'lar

AI Agent'lar kurumsal görevleri yerine getirirken yalnızca dokümanlara değil, güncel operasyonel ve analitik verilere de ihtiyaç duyabilir. Bir Agent Lakehouse üzerinde veri sorgulayabilir, sonuçları analiz edebilir, bir makine öğrenmesi modelini kullanabilir ve ardından belirlenen kurumsal araçlarla işlem gerçekleştirebilir.

Ancak Agent'ın Lakehouse üzerindeki her veriye erişebilmesi gerekmez. Data access politikaları Agent kimliği ve kullanıcı yetkileriyle birlikte değerlendirilmelidir.

AI Agent Governance hakkında daha fazla bilgi

Açık Lakehouse ve Vendor Lock-In

Lakehouse mimarisinde verinin açık dosya ve table formatlarında tutulması, storage ile compute katmanlarının ayrıştırılmasına yardımcı olur. Apache Iceberg gibi açık table formatları aynı veri katmanının farklı query ve processing engine'leri tarafından kullanılabilmesini sağlar.

Bu yaklaşım vendor lock-in'i tamamen ortadan kaldırmaz; ancak kurumsal verinin tek bir compute teknolojisinin veya platformun proprietary veri katmanına sıkı biçimde bağlanmasını azaltabilir.

Kauzas Data Platform, açık ve değiştirilebilir teknoloji katmanları üzerine kurulu Lakehouse yaklaşımını benimser.

Open Data Lakehouse ve vendor lock-in hakkında daha fazla bilgi

Kauzas Data Platform ile Lakehouse

Kauzas Data Platform, Lakehouse'u tek bir proprietary teknoloji olarak değil, birlikte çalışan açık ve değiştirilebilir teknoloji katmanları olarak ele alır.

  1. Enterprise Data Sources
  2. Data Integration & Orchestration
  3. Object Storage
  4. Apache Iceberg
  5. Catalog
  6. Trino + Apache Spark
  7. Analytics + Machine Learning + AI
  8. Enterprise Applications

Bu mimari Kubernetes üzerinde çalıştırılabilir. Böylece kurumlar aynı Data Platform yaklaşımını on-premise, private cloud ve uygun public cloud ortamlarında kullanabilir.

Katmanlı Data & AI mimarisi

On-Premise Lakehouse

Modern Lakehouse mimarisi belirli bir public cloud sağlayıcısına bağlı olmak zorunda değildir. S3 uyumlu object storage, açık table formatları ve Kubernetes üzerinde çalışan compute teknolojileri kullanılarak Lakehouse kurumun kendi altyapısında kurulabilir.

Trino dokümantasyonu da Lakehouse iş yüklerinin cloud object storage'ın yanında S3 uyumlu storage ve HDFS gibi farklı storage sistemleriyle çalışabildiğini gösterir. Bu nedenle aynı mimari yaklaşım farklı altyapı modellerinde uygulanabilir.

On-Premise AI Platform hakkında daha fazla bilgi

Lakehouse Hangi Kurumlar İçin

Lakehouse yaklaşımı özellikle şu kurumlar için değerlendirilebilir:

  • Çok sayıda veri kaynağı bulunan kurumlar
  • Yüksek hacimli veri işleyen kurumlar
  • Data Warehouse maliyetlerini veya ölçeklenebilirliğini yeniden değerlendirenler
  • Analytics ve makine öğrenmesini ortak veri üzerinde çalıştırmak isteyenler
  • Generative AI projeleri için kurumsal veri altyapısı oluşturanlar
  • On-premise veya hybrid cloud gereksinimi bulunanlar
  • Verisini proprietary storage formatlarına bağımlı hale getirmek istemeyenler

Sık Sorulan Sorular

Data Lakehouse nedir?
Data Lakehouse, Data Lake'in esnek ve ölçeklenebilir veri saklama yaklaşımıyla Data Warehouse'un tablo yönetimi ve analitik yeteneklerini bir araya getiren modern veri mimarisidir.
Data Lake ile Data Lakehouse arasındaki fark nedir?
Data Lake temel olarak farklı türlerde verilerin ölçeklenebilir biçimde saklanmasına odaklanır. Lakehouse ise bunun üzerine table management, metadata, transaction ve gelişmiş analytics yetenekleri ekler.
Apache Iceberg nedir?
Apache Iceberg büyük analitik veri setleri için geliştirilmiş açık bir table formatıdır. Schema evolution, partition evolution, hidden partitioning ve snapshot gibi özellikler sunar.
Lakehouse yapay zekâ için kullanılabilir mi?
Evet. Lakehouse üzerinde bulunan structured ve unstructured veriler makine öğrenmesi, Generative AI, RAG ve AI Agent kullanım senaryolarında kurumsal veri kaynağı olarak kullanılabilir.
Lakehouse on-premise kurulabilir mi?
Evet. Object storage, açık table formatları ve Kubernetes tabanlı compute teknolojileri kullanılarak on-premise Lakehouse mimarileri oluşturulabilir.
Kauzas Data Platform bir Lakehouse mudur?
Lakehouse, Kauzas Data Platform'un temel mimari bileşenlerinden biridir. Kauzas bunun üzerine data processing, distributed SQL, catalog, governance, orchestration ve Data & AI kullanım senaryolarını destekleyen daha geniş bir platform katmanı sağlar.

Verinizi AI'a Hazır Hale Getirin

Modern AI uygulamalarının temelinde yalnızca güçlü modeller değil, erişilebilir, yönetilebilir ve güvenilir kurumsal veri bulunur. Kauzas Data Platform ile açık teknolojiler üzerine kurulu, Analytics, Machine Learning ve AI iş yüklerini destekleyen modern bir Data Lakehouse oluşturun. Kurumunuzun kendi verisi üzerinde çalışan bir Data & AI kullanım senaryosunu birlikte hayata geçirelim.