İçeriğe geç

Veri Olgunluğu ve AI Hazırlığı: Erişim, Yetki, Kalite

AI hazırlığı; verinin yalnızca mevcut olması değil, erişilebilir, yetkilendirilmiş, izlenebilir ve kalitesi ölçülmüş olmasıdır — bu dördü sağlanmadan kurulan AI sistemleri ya çalışmaz ya da denetlenemez risk taşır.

Tanım
Veri Olgunluğu ve AI Hazırlığı: Erişim, Yetki, Kalite
AI hazırlığı; verinin yalnızca mevcut olması değil, erişilebilir, yetkilendirilmiş, izlenebilir ve kalitesi ölçülmüş olmasıdır — bu dördü sağlanmadan kurulan AI sistemleri ya çalışmaz ya da denetlenemez risk taşır.

Dört kapı: erişim, yetki, izlenebilirlik, kalite

1. Erişim. Veri teknik olarak alınabilir mi? Test: bir use-case için gereken veriyi bir mühendis kaç günde, kaç onayla ve hangi formatta çekebilir? Cevap "haftalar" ise AI değil, entegrasyon projesi konuşuyorsunuz.
2. Yetki (RBAC). Kim neyi görmeye yetkili ve bu yetki sistem düzeyinde sorgulanabilir mi? Bu kapı AI'da klasik yazılımdan farklı davranır: bir RAG sistemi, indekslediği her dokümanın içeriğini soru soran kullanıcıya aktarabilir. Doküman düzeyinde yetki modeli indeksleme aşamasında kurulmazsa, sonradan eklenen filtre sızıntıyı kapatmaz — model o içeriği zaten özetleyebilir hale gelmiştir.
3. İzlenebilirlik (lineage). Bir sayının nereden geldiği izlenebiliyor mu? AI çıktısı bir karara girdiyse, o kararın gerekçesini geriye doğru izleyebilmek yalnızca uyum gereği değil, hata ayıklamanın da tek yoludur.
4. Kalite. Kalite mutlak bir hedef değil, use-case'e bağlı bir eşiktir. Aynı müşteri adresi alanı pazarlama segmentasyonu için %85 doğrulukla yeterliyken, fatura gönderimi için %99,5 gerekir. Bu yüzden "önce tüm veriyi temizleyelim" yaklaşımı hem bitmez hem gereksizdir; doğru sıra use-case seçip onun eşiğini karşılamaktır.

Doküman hazırlığı: RAG projelerinin gerçek darboğazı

Kurumsal RAG projelerinde zamanın büyük kısmı model seçimine değil, doküman hazırlığına gider. Sık karşılaşılan dört engel:
  • Tablo yapıları. Metin akışı içinde yaşayan tablolar, düz metne çevrildiğinde anlamını yitirir. Sabit boyutlu parçalama (chunking) tabloyu ortadan böler ve satır-başlık ilişkisi kopar; düzen-farkında (layout-aware) ayrıştırma bu yüzden opsiyonel değildir.
  • Taranmış belgeler. Görüntü PDF'ler OCR olmadan indekslenemez; OCR kalitesi düşükse model kendinden emin biçimde yanlış okur.
  • Sürüm karmaşası. Aynı yönetmeliğin üç sürümü indekslenmişse model hangi sürümün geçerli olduğunu bilemez. Yürürlük tarihi ve sürüm etiketi meta veri olarak taşınmalıdır.
  • Yetkisiz içerik karışması. Ortak bir dosya paylaşımından toplanan dokümanlar arasında bordro, sözleşme veya kişisel veri bulunması olağandır; indekslemeden önce sınıflandırma yapılmazsa bu içerik erişim kontrolünü baypas eder.
Pratik sıra: önce envanter ve sınıflandırma, sonra düzen-farkında ayrıştırma, sonra parçalama stratejisi, en sonda model seçimi. Bu sıra tersine çevrildiğinde proje teknik olarak çalışır ama cevapları güvenilmez olur.

Envanterin çıktısı: use-case başına karar

Veri envanteri çalışmalarının çoğu bir katalogla biter ve katalog kimse tarafından açılmaz. Kullanılabilir çıktı, her aday use-case için üç değerden birini veren bir karardır:
  • Hazır — veri erişilebilir, yetkilendirilmiş ve kalite eşiğini karşılıyor. Pilot başlayabilir.
  • Şu koşulla hazır — tek bir engel var ve o engel adı/tarihi belirlenmiş bir işle kapanır (ör. "doküman sınıflandırması tamamlanınca").
  • Hazır değil — engel yapısal (ör. tekil müşteri kimliği yok). Bu use-case portföyden çıkar veya engel ayrı bir girişim olarak ele alınır.
Bu üçlü karar, use-case önceliklendirmesinin fizibilite eksenini besler ve "AI yapalım" tartışmasını "hangi engeli kapatınca ne mümkün olur" tartışmasına dönüştürür — dönüşüm programlarındaki en verimli çerçeve değişimi budur.

Anahtar Çıkarımlar

  1. RBAC'siz RAG bir veri sızıntısı mimarisidir: modelin gördüğü doküman, ona soru soran herkesin gördüğü dokümana dönüşür.
  2. Veri kalitesi bir proje değil bir eşiktir: hangi alanın hangi doğruluk oranında olması gerektiği use-case'e göre değişir.
  3. Doküman hazırlığı çoğu RAG projesinin gerçek darboğazıdır — tablo, tarama (scan) ve sürüm karmaşası model seçiminden daha belirleyicidir.
  4. Veri envanterinin çıktısı katalog değil, use-case başına 'hazır / şu koşulla hazır / hazır değil' kararıdır.

Bu çerçeveyle çalışan araçlar

Sıkça Sorulan Sorular

AI'a başlamak için verinin tamamen temiz olması gerekir mi?

Hayır ve bu bekleyiş çoğu programı yıllarca geciktirir. Kalite bir use-case eşiğidir: seçilen ilk use-case'in ihtiyaç duyduğu alanların o eşiği karşılaması yeterlidir. 'Tüm veriyi temizleyelim' yaklaşımı bitmeyen bir projedir çünkü hangi kalitenin yeterli olduğu sorusu use-case olmadan cevaplanamaz.

RBAC'i sonradan eklemek neden yetersiz?

Çünkü indeksleme geri alınamaz bir bilgi aktarımıdır: içerik gömüldükten (embed) sonra model o içeriği özetleyebilir hale gelir ve sorgu katmanına eklenen filtre bunu tamamen engellemez. Doğru kurulum, yetki modelinin indeksleme aşamasında meta veri olarak taşınması ve getirme (retrieval) sırasında zorunlu filtre olarak uygulanmasıdır.

Veri olgunluğu için hangi ekip sorumlu olmalı?

Sahiplik veri üreten iş biriminde, yönetişim ise merkezi bir veri fonksiyonunda olmalıdır. Merkezi ekibe hem kalite hem sahiplik verildiğinde, iş birimi kendi verisinin kalitesinden sorumlu olmadığını düşünür ve kalite bir ekibin kapasite problemine dönüşür.

Doküman hazırlığı ne kadar sürer?

Tek bir alan (ör. bir mevzuat kümesi veya bir ürün dokümantasyonu) için envanter + sınıflandırma + düzen-farkında ayrıştırma pratikte 2–5 hafta sürer. Süreyi belirleyen doküman sayısı değil, format çeşitliliği ve taranmış belge oranıdır.

İlgili temel konular

Diğer çerçeveler

Kurumunuzun basamağını birlikte belirleyelim

Mevcut durumun teşhisi, en zayıf boyutun darboğazı ve önümüzdeki çeyrek için üç somut aksiyon — bir görüşmeyle başlayabiliriz.