Open Data Lakehouse
Open Data Lakehouse: Vendor Lock-in Olmadan Veri Platformu
Kurumsal veri platformları yıllarca kullanılan altyapılardır. Bu süre içerisinde veri hacmi büyür, kullanım senaryoları değişir ve yeni analitik, makine öğrenmesi ve AI teknolojileri ortaya çıkar.
Son güncelleme: Eylül 2026
Open Data Lakehouse, verinin açık dosya ve table formatlarında tutulduğu ve farklı compute engine'lerinin aynı veri katmanı üzerinde çalışabildiği Lakehouse mimarisidir. Kurumsal veriyi tek bir proprietary veri platformuna veya compute engine'e bağımlı hale getirmek yerine storage, table format, catalog, processing ve query katmanlarını birbirinden ayrıştırır. Temel prensibi şudur: verinin sahibi onu işleyen teknoloji değil, kurumun kendisidir.
Bugün doğru olan query engine, catalog, processing teknolojisi veya cloud altyapısı birkaç yıl sonra kurumun ihtiyaçlarını karşılamayabilir. Bu nedenle modern bir veri platformunda yalnızca bugünkü teknoloji seçimi değil, yarın bu teknolojilerin değiştirilebilmesi de önemlidir.
Kauzas Data Platform, storage, table format, catalog, processing ve query katmanlarını birbirinden ayrıştıran mimarisiyle kurumların Data & AI altyapılarını tek bir teknoloji sağlayıcısına sıkı biçimde bağlamadan oluşturabilmesini hedefler.
Open Data Lakehouse Nedir?
Open Data Lakehouse, verinin açık dosya ve table formatlarında tutulduğu ve farklı compute engine'lerinin aynı veri katmanı üzerinde çalışabildiği Lakehouse mimarisidir.
- Bir query engine'in değiştirilmesi verinin taşınmasını gerektirmemeli
- Bir processing teknolojisinin değiştirilmesi bütün platformun yeniden kurulmasını gerektirmemeli
- Cloud sağlayıcısının değişmesi veri mimarisinin tamamen değiştirilmesini zorunlu hale getirmemeli
- Object Storage
- Open File Formats
- Open Table Format
- Catalog
- Multiple Compute Engines
- Analytics / ML / AI
Bu mimarinin temel prensibi şu üç maddede özetlenebilir:
Verinin sahibi onu işleyen teknoloji değil, kurum olmalıdır.
Vendor Lock-in Nedir?
Vendor lock-in, bir kurumun kullandığı platform veya teknolojiyi değiştirmesinin teknik, operasyonel veya ekonomik olarak çok zor hale gelmesidir. Veri platformlarında lock-in farklı seviyelerde oluşabilir.
Storage lock-in
Verinin yalnızca belirli bir platform tarafından kullanılabilen proprietary formatta tutulması.
Compute lock-in
Verinin yalnızca belirli bir query veya processing engine üzerinden verimli biçimde kullanılabilmesi.
Catalog lock-in
Tablo metadata'sının ve veri organizasyonunun belirli bir platforma bağımlı olması.
Infrastructure lock-in
Platformun yalnızca belirli bir cloud sağlayıcısı veya altyapı üzerinde çalışabilmesi.
Operational lock-in
Deployment, monitoring ve platform operasyonlarının belirli bir sağlayıcının servislerine sıkı biçimde bağımlı hale gelmesi.
Vendor lock-in her durumda kötü veya yanlış bir tercih değildir. Yönetilen ve bütünleşik platformlar bazı kurumlar için operasyonel kolaylık ve hızlı başlangıç sağlayabilir.
Asıl konu, kurumun bu bağımlılığı bilinçli olarak seçip seçmediği ve ileride değiştirme maliyetini bilip bilmediğidir.
Açık Dosya Formatları
Open Lakehouse mimarisinin en alt katmanlarından biri açık veri formatlarıdır. Apache Parquet, analitik iş yüklerinde yaygın kullanılan açık kolon bazlı dosya formatlarından biridir.
Verinin açık formatlarda saklanması, aynı veri dosyalarının farklı teknolojiler tarafından kullanılabilmesini sağlar.
Ancak yalnızca Parquet dosyaları kullanmak bir Lakehouse oluşturmak için yeterli değildir. Kurumsal ölçekte tabloların metadata, schema, partition, transaction ve snapshot durumlarının da yönetilmesi gerekir. Bu noktada açık table formatları devreye girer.
Apache Iceberg ve Açık Table Formatları
Apache Iceberg, büyük analitik veri setleri için geliştirilmiş açık bir table formatıdır. Schema evolution, partition evolution, hidden partitioning ve snapshot tabanlı table state gibi özellikler sunarken verinin farklı compute engine'leri tarafından kullanılabilmesine olanak sağlar.
Örneğin aynı Iceberg tablosu uygun entegrasyonlarla şu teknolojiler tarafından kullanılabilir:
- Apache Spark
- Trino
- Flink
- Farklı analitik teknolojiler
Böylece tablo formatı ile compute engine birbirinden ayrıştırılabilir. Bu ayrım Open Lakehouse mimarisinin temel prensiplerinden biridir.
Compute Engine Verinin Sahibi Değildir
Geleneksel veri platformlarında storage ve compute aynı sistemin parçaları olabilir. Open Lakehouse yaklaşımında ise iki katman birbirinden ayrıştırılır:
- Object storage
- Parquet
- Apache Iceberg
Trino, Spark, makine öğrenmesi ve AI iş yükleri bu katmanı kullanır; ona sahip olmaz.
Bunun önemli bir sonucu vardır: compute teknolojisi değişebilir, veri katmanı kalabilir.
Örneğin kurum belirli SQL iş yüklerinde bugün bir query engine kullanırken gelecekte farklı bir teknoloji kullanmak isteyebilir. Veri açık table formatlarında tutuluyorsa böyle bir değişiklik tüm kurumsal verinin proprietary bir sistemden başka bir sisteme taşınmasını gerektirmeyebilir.
Tek Platform, Tek Teknoloji Demek Değildir
Kurumsal platform kavramı bazen bütün teknoloji katmanlarının aynı üretici tarafından sağlanması gerektiği şeklinde yorumlanır. Kauzas farklı bir yaklaşım benimser.
Bir veri platformunda storage için bir teknoloji, table format için başka bir teknoloji, catalog için başka bir teknoloji, SQL query için başka bir teknoloji ve data processing için başka bir teknoloji kullanılabilir.
Platformun görevi bu teknolojilerin hepsini kendi proprietary karşılıklarıyla değiştirmek değil, birlikte çalışan ve yönetilebilen bir kurumsal veri platformu oluşturmaktır.
Tek platform, tek teknoloji demek değildir.
Değiştirilebilir Teknoloji Katmanları
Kauzas Data Platform'un temel mimari prensiplerinden biri teknoloji katmanlarının bağımsız ve değiştirilebilir olmasıdır.
- Infrastructure
- Object Storage
- Table Format
- Catalog
- Processing & Query
- Governance & Orchestration
- Analytics / ML / AI
Her katmanın açık arayüzler ve standartlarla mümkün olduğunca diğer katmanlardan ayrıştırılması hedeflenir.
Böylece teknoloji seçimi “Kauzas hangi teknolojiyi zorunlu kılıyor?” yerine “Bu workload için hangi teknoloji daha uygun?” sorusuna göre yapılabilir.
Bir Teknoloji Değiştiğinde Ne Olur?
Kurumun SQL sorguları için kullandığı teknolojinin gelecekte ihtiyaçlarını karşılamamaya başladığını varsayalım. Sıkı bağlı bir mimaride bu değişiklik şunları gerektirebilir:
- Verinin taşınması
- Metadata'nın yeniden oluşturulması
- Pipeline'ların değiştirilmesi
- Uygulamaların yeniden yazılması
Açık ve ayrıştırılmış bir mimaride hedef şudur: storage aynı kalır, table format aynı kalır, veri aynı kalır; değişen compute katmanıdır.
Bu, her teknoloji değişiminin tamamen maliyetsiz olduğu anlamına gelmez. Query syntax, performans optimizasyonları, connector'lar ve operasyonel süreçlerde uyarlamalar gerekebilir. Ama mimari, değişimi mümkün kılacak şekilde tasarlanmıştır.
Cloud Vendor Lock-in
Vendor lock-in yalnızca veri teknolojilerinde oluşmaz; altyapı katmanında da ortaya çıkabilir. Bir veri platformunun storage, orchestration, processing ve monitoring katmanları yalnızca belirli bir cloud sağlayıcısının proprietary servisleri üzerine kurulmuşsa başka bir ortama taşınması zorlaşabilir.
Kauzas'ın Kubernetes tabanlı yaklaşımı platform servislerinin farklı altyapılarda çalıştırılabilmesini hedefler. Aynı platform yaklaşımı şu ortamlarda uygulanabilir:
- On-Premise
- Private Cloud
- Public Cloud
- Hybrid Cloud
Buradaki amaç cloud kullanmamak değildir.
Amaç, cloud'u kullanmak ile cloud'a bağımlı olmak arasındaki farkı korumaktır.
On-Premise ve Open Lakehouse
Open Lakehouse yaklaşımının önemli avantajlarından biri belirli bir public cloud altyapısına ihtiyaç duymamasıdır. S3 uyumlu object storage, açık table formatları ve Kubernetes üzerinde çalışan compute teknolojileri kullanılarak kurumun kendi veri merkezinde de Lakehouse mimarisi oluşturulabilir.
Örneğin Trino'nun Lakehouse connector'ları S3 uyumlu object storage dahil farklı storage sistemleriyle çalışabilir. Bu sayede aynı temel veri mimarisi kurumun altyapı stratejisine göre farklı ortamlarda uygulanabilir.
Open Lakehouse ve AI
Açık veri mimarisinin önemi AI ile daha da artar, çünkü AI teknolojileri çok hızlı değişir. Bugün kullanılan bileşenler birkaç yıl sonra farklı olabilir:
- Embedding modeli
- Vector database
- LLM
- Agent framework'ü
- Makine öğrenmesi engine'i
- Enterprise Data
- Open Lakehouse
- Catalog + Governance
- ML / LLM / RAG / Agents
AI katmanı değişirken kurumun temel veri altyapısı korunabilir.
Kurumsal verinin bu teknolojilerden herhangi birine sıkı biçimde bağlı olması, yeni AI teknolojilerinin kullanılmasını zorlaştırabilir. Open Lakehouse yaklaşımında veri katmanı AI teknolojilerinden ayrıştırılır.
Open Lakehouse ve Enterprise RAG
Enterprise RAG sistemlerinin ihtiyaç duyduğu kurumsal bilgi zaman içerisinde farklı AI modelleri ve retrieval teknolojileri tarafından kullanılabilir.
Kurumsal verinin açık bir Lakehouse katmanında bulunması, AI uygulamalarının veri altyapısını tek bir model veya AI sağlayıcısına bağlamadan geliştirilmesini destekler. Structured veri Lakehouse üzerinden sorgulanırken unstructured bilgi farklı retrieval yöntemleriyle kullanılabilir.
Open Lakehouse ve AI Agent'lar
AI Agent'lar kurumsal veri üzerinde sorgular gerçekleştirebilir ve farklı veri servislerini araç olarak kullanabilir.
Açık veri mimarisi, Agent katmanının temel kurumsal veriyi belirli bir AI framework'ünün proprietary veri katmanına taşımadan kullanabileceği mimariler oluşturulmasını destekler. Agent'ın hangi verilere erişebileceği ise ayrı governance ve authorization politikalarıyla kontrol edilmelidir.
Open Lakehouse ve Sıkı Bağlı Platform
İki yaklaşımın farkı tek bir tabloda toplanabilir:
| Open Lakehouse | Sıkı bağlı proprietary platform | |
|---|---|---|
| Veri formatı | Açık formatlar kullanılabilir | Platforma özgü olabilir |
| Table format | Açık | Platforma bağlı olabilir |
| Compute | Birden fazla engine | Genellikle platform odaklı |
| Storage | Ayrıştırılabilir | Sıkı bağlı olabilir |
| Cloud seçimi | Farklı ortamlar mümkün | Sağlayıcıya bağlı olabilir |
| On-premise | Mümkün | Ürüne göre değişir |
| Teknoloji değiştirme | Mimari olarak desteklenebilir | Migration gerektirebilir |
| Operasyon kolaylığı | Daha fazla platform yönetimi gerektirebilir | Genellikle daha bütünleşik |
Son satır da tablonun bir parçası: açık mimarinin bedeli operasyondur.
Açık Mimari Daha Fazla Operasyon Gerektirir mi?
Genellikle evet. Birden fazla açık teknolojiden oluşan veri platformunu kurumun kendi başına kurması ve işletmesi şu sorumlulukları oluşturabilir:
- Deployment
- Upgrade
- Dependency management
- Security
- Monitoring
- Scaling
- Integration
Kauzas'ın rolü burada ortaya çıkar: açık teknolojilerin esnekliğini korurken bunları tek bir platform deneyimi içerisinde yönetilebilir hale getirmek.
Yani seçim açık kaynak ile kurumsal platform arasında olmak zorunda değildir.
Open architecture + enterprise platform experience.
Kauzas Open Data Lakehouse
Kauzas Data Platform, açık ve değiştirilebilir teknoloji katmanları üzerine kurulmuş kurumsal Data Lakehouse yaklaşımı sunar. Mimari içerisinde kullanım senaryosuna göre şu teknoloji katmanları birlikte çalışabilir:
- Object storage
- Apache Iceberg
- Catalog
- Trino
- Apache Spark
- Orchestration
- Governance
- Observability
Platform Kubernetes üzerinde çalışır ve farklı altyapı ortamlarında uygulanabilir. Böylece kurumlar açık mimarinin esnekliğini korurken Data Platform'un operasyonel karmaşıklığını Kauzas üzerinden yönetebilir.
Sık Sorulan Sorular
- Open Data Lakehouse nedir?
- Open Data Lakehouse, verinin açık dosya ve table formatlarında tutulduğu ve farklı query, processing ve AI teknolojilerinin aynı veri katmanı üzerinde çalışabildiği Lakehouse mimarisidir.
- Vendor lock-in nedir?
- Vendor lock-in, kullanılan teknoloji veya platformun değiştirilmesinin teknik, operasyonel veya ekonomik olarak zor hale gelmesidir.
- Apache Iceberg vendor lock-in'i önler mi?
- Iceberg açık bir table formatıdır ve farklı compute engine'leri tarafından kullanılabilir. Bu, table ve compute katmanlarının ayrıştırılmasına yardımcı olur; ancak bir sistemin tamamen lock-in içermemesi yalnızca table formatına bağlı değildir.
- Open Lakehouse on-premise çalışabilir mi?
- Evet. Uygun object storage, catalog ve compute teknolojileri kullanılarak Open Lakehouse kurumun kendi altyapısında çalıştırılabilir.
- Açık mimarinin dezavantajı var mı?
- Birden fazla teknoloji bileşeni deployment, monitoring, upgrade ve entegrasyon açısından ek operasyonel karmaşıklık oluşturabilir. Kurumsal platform katmanları bu karmaşıklığın yönetilmesine yardımcı olabilir.
- Kauzas proprietary bir Data Lakehouse mudur?
- Kauzas'ın yaklaşımı veriyi proprietary bir Kauzas formatına taşımak yerine açık veri ve table formatları üzerinde çalışan farklı teknoloji katmanlarını ortak bir platform içerisinde yönetmektir.
Veriniz Sizin, Teknoloji Seçiminiz de Sizin Olsun
Kurumsal veri platformunuzun yıllarca yaşayacak olması, bugün seçtiğiniz teknolojilerin de yıllarca değişmeden kalacağı anlamına gelmez. Veri katmanınızı teknoloji katmanlarından ayrıştırın. Kauzas Data Platform ile açık teknolojiler üzerine kurulu, farklı altyapılarda çalışabilen ve değişen Data & AI ihtiyaçlarına uyarlanabilen modern bir Data Lakehouse oluşturun. Kendi altyapınız üzerinde Kauzas'ı ücretsiz PoC ile birlikte test edelim.