Eval seti kurulumu, bir dil modeli uygulamasının kalitesini öznel izlenimle değil, önceden hazırlanmış bir soru ve beklenen sonuç kümesiyle ölçmek için altın soru setini tasarlama sürecidir. Kısacası eval seti kurulumu, "bence iyi çalışıyor" cümlesini "şu kabul eşiğinin üstünde çalışıyor" gibi savunulabilir bir ifadeye dönüştürür.
Bu yazı, LLM değerlendirme konusunun dar ve pratik bir kesitine odaklanır: üretime çıkacak bir uygulama için altın soru setini nasıl tasarlarsınız. Konunun tüm boyutlarını — metrikler, LLM-as-a-judge, üretim gözlemlenebilirliği — uçtan uca inceleyen kapsamlı rehber ayrı bir yazıdadır; burada tekrar etmeyiz. LLM değerlendirmenin neden zorunlu olduğunu ise LLM değerlendirme nedir yazısında ele alıyoruz.
- LLM değerlendirme seti (eval seti / altın soru seti)
- Bir dil modeli uygulamasının kalitesini öznel izlenimle değil, önceden hazırlanmış soru ve beklenen sonuç kümesiyle ölçen sabit test kümesi. Her soruya bir beklenen davranış ve bir puanlama rubriği; her değerlendirme boyutuna bir kabul eşiği bağlanır. Set, gerçek kullanıcı sorularını, zor ve uç vakaları ve bilinen hataları kapsar ve her sürüm değişikliğinde bir regresyon testi gibi çalıştırılır.
- Ayrıca: eval seti, altın soru seti, golden set, değerlendirme kümesi, LLM eval
"İyi Çalışıyor" Demenin Yetmediği Yer
Bir LLM uygulaması demoda etkileyici görünür; birkaç soru sorarsınız, akıcı cevaplar gelir, "iyi çalışıyor" dersiniz. Sorun şu ki bu izlenim ölçülebilir değildir: hangi soruların yanıtlandığını, hangilerinin sessizce yanlış olduğunu ve bir sonraki değişikliğin neyi bozacağını bilmezsiniz. Bir prompt'u iyileştirdiğinizde başka bir senaryonun bozulup bozulmadığını gözle takip etmek imkânsızdır.
İşte eval seti kurulumu tam bu boşluğu doldurur. Yazılımda testlerin kod için yaptığını, altın soru seti LLM uygulaması için yapar: davranışı sabitler, gerilemeleri yakalar ve iyileştirmeleri kanıta bağlar. LLM değerlendirme olmadan her sürüm bir kumar, her "düzeltme" bir umuttur. Bu risk, halüsinasyon gibi sessiz hataların fark edilmediği yapay zeka halüsinasyonu senaryolarında ve RAG tabanlı bilgi erişiminde özellikle yüksektir.
Eval Seti Kurulumu Nasıl Yapılır? Soru Setinin Kapsam Tasarımı
Eval seti kurulumu kapsam tasarımıyla başlar: neyi ölçtüğünüzü bilmeden hangi soruları soracağınızı bilemezsiniz. İlk adım, uygulamanın hangi görevleri hangi kullanıcı tipleri için yaptığını haritalamaktır. Bir destek asistanı için bu; ürün soruları, iade süreçleri, sorun giderme gibi görev başlıkları demektir. Her başlık, altın soru setinde temsil edilmesi gereken bir dilimdir; kapsam gerçek kullanım dağılımını yansıtmalı ki set üretimdeki gerçekliği temsil etsin.
Soruların kendisi üç kaynaktan gelir. Birincisi gerçek kullanıcı sorgularıdır: üretim loglarından alınan sorular setin gerçekçi kalmasını sağlar. İkincisi, bir sonraki başlıkta ayrıntılandıracağımız zor ve uç vakalardır. Üçüncüsü bilinen hatalardır: üretimde bir kez yanlış cevaplanmış her soru, aynı hata bir daha kaçmasın diye sete eklenmelidir.
Bir altın soru setini sıfırdan kurma
Üretime çıkacak bir LLM uygulaması için eval seti kurulumunun pratik adımları.
- 1
Kapsamı haritala
Uygulamanın hangi görevleri hangi kullanıcı tipleri için yaptığını listeleyip her başlık için temsili soru kotası belirleyin.
- 2
Soruları üç kaynaktan topla
Gerçek kullanıcı loglarından, tasarlanmış zor ve uç vakalardan ve üretimde görülmüş bilinen hatalardan soru derleyin.
- 3
Beklenen davranışı tanımla
Her soruya bir altın cevap veya net bir kabul kriteri (neyin doğru sayılacağı) bağlayın.
- 4
Rubrik ve kabul eşiği kur
Her değerlendirme boyutu için bir puanlama rubriği ve geçilmesi gereken kabul eşiği tanımlayın.
- 5
Çalıştır, kalibre et, tekrarla
Seti çalıştırıp insan değerlendirici uyumuyla kalibre edin ve her sürümde regresyon testi gibi yeniden çalıştırın.
Bu adımların çıktısı, mükemmel değil kullanışlı bir settir: küçük ama temsili bir altın soru seti, ölçüme hemen başlamanızı sağlar ve zamanla büyür.
Zor ve Uç Vakaların Dahil Edilmesi
Bir eval setinin değeri, kolay soruları ne kadar iyi yanıtladığıyla değil, zor soruları ne kadar açığa çıkardığıyla ölçülür. Yalnızca ortalama, iyi biçimli sorulardan oluşan bir set yanıltıcı bir güven verir: sistem "yüzde doksan doğru" görünür, ama gerçek kullanıcıların takıldığı köşe durumlarını hiç test etmemiştir. Bu yüzden altın soru setinin bilinçli olarak zorlaştırılması gerekir.
Uç vakalar birkaç biçimde gelir: belirsiz veya eksik sorular, kapsam dışı sorular (uygulamanın "bilmiyorum" demesi gereken durumlar), çelişkili ya da tuzak sorular, çok adımlı akıl yürütme gerektiren sorular ve kötü niyetli girişimler — örneğin prompt injection denemeleri. Güvenlik açısından, sistemin reddetmesi gereken istekleri de sete koymak, guardrail davranışını ölçmenin tek yoludur. Bir kural olarak: sistemin en çok utanacağı soruları bulun ve onları sete koyun; çünkü test etmediğiniz uç vaka, üretimde sizi bulur.
Puanlama Rubriği: Neyi, Nasıl Puanlarsınız?
Sorular yarısıdır; diğer yarısı "doğru cevap neye benzer" sorusudur. Puanlama rubriği, her sorunun yanıtının hangi boyutlarda, hangi ölçütle değerlendirileceğini tanımlar. Rubrik olmadan puanlama öznelleşir: aynı cevabı iki değerlendirici farklı puanlar, tutarlılık kaybolur ve set güvenilir bir sinyal veremez.
İyi bir rubrik, tek bir "iyi/kötü" yargısı yerine boyutlara ayrılır: doğruluk, dayanaklılık (yanıt kaynağa mı dayanıyor), eksiksizlik, format uyumu ve güvenlik. Her boyut için ya deterministik bir kontrol (şema doğrulama, tam eşleşme) ya da dereceli bir ölçek (örneğin 1-5) tanımlanır. Kritik olan, her boyuta ayrı bir kabul eşiği bağlamaktır: doğruluk için yüksek bir eşik, üslup için daha esnek bir hedef. Böylece bir sürümün nerede güçlü, nerede zayıf olduğunu tek bir ortalama sayının arkasına saklamadan görürsünüz.
Değerlendirme Boyutu, Ölçüm ve Kabul Eşiği: Özet Tablo
Aşağıdaki tablo, tipik bir LLM uygulamasında hangi boyutun hangi yöntemle ölçüldüğünü ve nasıl bir kabul yaklaşımı gerektirdiğini özetler; kendi rubriğinizi kurarken bir başlangıç şablonu olarak kullanılabilir.
| Değerlendirme boyutu | Ölçüm yöntemi | Kabul eşiği yaklaşımı |
|---|---|---|
| Doğruluk (olgusal) | Altın cevapla karşılaştırma / olgu kontrolü | Yüksek; kritik sorularda taban çizgisinin altına düşme yok |
| Dayanaklılık (groundedness) | Yanıtı kaynağa izleme (otomatik + örnekleme) | Uydurmaya sıfıra yakın tolerans |
| Format / şema uyumu | Deterministik şema doğrulama | Geçer/kalır; ikili kabul |
| Eksiksizlik | Rubrik puanı (1-5) | Hedef ortalama eşik (örn. 4/5) |
| Güvenlik / reddetme | Yasaklı istek kümesinde reddetme oranı | Çok yüksek; sıfır tolerans alt kümesi |
| Ton ve üslup | İnsan/LLM rubrik puanı | Esnek hedef puan |
| Gecikme / maliyet | p95 gecikme, yanıt başına token | Bütçe eşiği |
Tablodaki ayrım şunu gösterir: tek bir "kalite skoru" yanıltıcıdır. Her boyut farklı ölçülür ve farklı bir kabul eşiği gerektirir.
İnsan Değerlendirici Uyumu
Nüanslı boyutları — doğruluk, dayanaklılık, üslup — nihayetinde bir insan yargısı belirler. Ama insan yargısı da tutarsız olabilir: aynı cevabı iki değerlendirici farklı puanlarsa, hangi puana güveneceğinizi bilemezsiniz. Bu yüzden LLM değerlendirmenin sessiz temeli insan değerlendirici uyumudur: aynı örnekleri birden fazla kişiye puanlatıp aralarındaki tutarlılığı ölçmek.
Uyum düşükse sorun modelde değil, rubriğinizdedir: ölçüt yeterince net değildir. Bu durumda rubriği keskinleştirir, örnek cevaplarla ("bu 5, bu 2 çünkü...") kalibre eder ve tekrar ölçersiniz. Yeterli insan uyumu sağlandığında bu insan puanları otomatik puanlayıcınız için bir referans olur: bir LLM-as-a-judge kurulumunun insanla ne kadar örtüştüğünü ancak bu referansla kanıtlayabilirsiniz.
Otomatik Değerlendirmenin Sınırı Nerede?
Her şeyi elle puanlamak ölçeklenmez; bu yüzden otomatik değerlendirme kaçınılmazdır. Ama sınırlarını bilmeden ona güvenmek tehlikelidir. Otomatik puanlama üç biçimde çalışır: kural tabanlı kontroller (anahtar kelime, uzunluk), deterministik doğrulama (şema, tam eşleşme) ve bir modelin başka bir modelin çıktısını puanladığı LLM-as-a-judge yaklaşımı.
Deterministik boyutlarda otomatik puanlama neredeyse kusursuzdur: bir JSON şemaya uyuyor mu, yasaklı bir kelime geçiyor mu — bunlar makine işidir. Sınır, nüansta başlar. Bir LLM-as-a-judge, "bu cevap kaynağa dayanıyor mu" gibi bir yargıda kendine benzeyen cevapları kayırabilir, uzun cevaplara meyledebilir. Bu yüzden otomatik puanlayıcı, insan değerlendirici uyumuyla kalibre edilmeden üretim kararı için kullanılmamalıdır. Doğru desen hibrittir: otomatik puanlama geniş tarama için, insan denetimi kalibrasyon ve nüans için. Üretimde bu izlemenin nasıl kurulacağını LLM gözlemlenebilirliği ve LLMOps yazılarında ele alıyoruz.
Bakım: Eval Setini Bir Regresyon Testi Gibi Yaşatmak
Bir altın soru seti bir kez kurulup unutulan değil, sürekli yaşayan bir varlıktır. Değeri, tam olarak bir regresyon testi gibi çalıştırıldığında ortaya çıkar: her model güncellemesinde, her prompt değişikliğinde set baştan çalıştırılır ve skorlar taban çizgisiyle karşılaştırılır. Bir değişiklik herhangi bir boyutta kabul eşiğinin altına düşürüyorsa, ne kadar cazip görünürse görünsün o değişiklik üretime alınmaz. Bu, kalitenin sessizce bozulmasını önleyen kapıdır.
Set iki tetikleyicide büyür: üretimde yeni bir hata görüldüğünde o örnek sete eklenir, uygulamanın kapsamı genişlediğinde yeni görevler için sorular gelir. Zamanla artık geçerli olmayan beklenen cevapları güncellemek gerekir. Hukuki ya da düzenlemeye tabi alanlarda (örneğin uyum yanıtları) değerlendirme kriterlerini kurumun hukuk birimiyle birlikte tanımlamak yerinde olur; bu bir hukuki tavsiye değildir, bir tasarım pratiğidir. Regresyon testi disipliniyle bakılan bir set, LLM değerlendirmeyi tek seferlik bir kontrol olmaktan çıkarıp uygulamanın ömrü boyunca güvenilirliği koruyan bir sisteme dönüştürür.
Sıkça Sorulan Sorular
Eval seti nasıl hazırlanır?
Eval seti kurulumu dört adımla ilerler. Önce kapsamı tanımlarsınız: uygulamanın hangi görevleri, hangi kullanıcı tipleri için yaptığını listeleyip her başlık için soru toplarsınız. Sonra soruları üç kaynaktan doldurursunuz: gerçek kullanıcı sorguları (loglardan), zor ve uç vakalar ve üretimde görülmüş bilinen hatalar. Ardından her soruya bir beklenen davranış (altın cevap veya kabul kriteri) ve bir puanlama rubriği bağlarsınız. Son olarak her boyuta bir kabul eşiği koyup seti bir kez çalıştırır, insan değerlendirici uyumuyla kalibre eder ve bundan sonra her sürümde regresyon testi gibi tekrarlarsınız. Kritik nokta, seti mükemmel değil kullanışlı kurmaktır: küçük ama temsili bir altın soru seti, hiç olmayan devasa bir setten daha değerlidir.
Kaç soru yeterli?
Tek bir doğru sayı yoktur; yeterlilik soru sayısından çok kapsam çeşitliliğiyle belirlenir. Pratik bir başlangıç, uygulamanın her ana görev tipi için birkaç düzine temsili soru toplamaktır; toplamda birkaç yüz soruluk bir altın soru seti çoğu kurumsal uygulama için sağlam bir temeldir (illustratif bir aralık, kesin kural değil). Önemli olan sayının büyüklüğü değil, setin gerçek kullanım dağılımını ve riskli uç vakaları temsil etmesidir. Yüz iyi seçilmiş ve etiketlenmiş soru, bin gelişigüzel sorudan daha güvenilir bir sinyal verir. Set zamanla büyür: üretimde yeni bir hata görüldüğünde o örnek sete eklenir, böylece aynı hata regresyon testinde bir daha yakalanır.
Otomatik puanlama güvenilir mi?
Kısmen. Otomatik puanlama — kural tabanlı kontroller, şema doğrulama veya bir modelin başka bir modelin çıktısını puanladığı LLM-as-a-judge — hız ve ölçek sağlar, ama körü körüne güvenilmez. Deterministik boyutlarda (format uyumu, yasaklı içerik, tam eşleşme) otomatik puanlama oldukça güvenilirdir. Doğruluk, dayanaklılık ve üslup gibi nüanslı boyutlarda ise otomatik puanlayıcı yanılabilir; bu yüzden bir insan değerlendiriciyle karşılaştırılıp uyum ölçülmeli (insan değerlendirici uyumu) ve düzenli örneklemeyle denetlenmelidir. Doğru yaklaşım hibrittir: otomatik puanlamayı geniş tarama için, insan denetimini kalibrasyon ve nüans için kullanın. Otomatik puanlayıcıya güvenmeden önce onun insanla ne kadar uyumlu olduğunu kanıtlamak gerekir.
Kabul eşiği nasıl belirlenir?
Kabul eşiği, bir sürümün üretime çıkabilmesi için her değerlendirme boyutunda geçmesi gereken asgari puandır ve tek bir evrensel değer yoktur; riske göre belirlenir. Güvenlik ve hukuki doğruluk gibi kritik boyutlarda eşik çok yüksek, hatta bazı alt kümelerde sıfır tolerans olabilir; üslup veya biçim gibi düşük riskli boyutlarda daha esnek bir hedef puan yeterlidir. Eşiği belirlerken mevcut sürümün skorunu taban çizgisi alın ve "yeni sürüm bu tabanın altına düşmesin" kuralını koyun. Kabul eşiği aynı zamanda bir regresyon testi kapısıdır: eşiğin altına düşen bir değişiklik, ne kadar cazip görünürse görünsün üretime alınmaz.
Altın soru seti ne sıklıkla güncellenmeli?
Altın soru seti yaşayan bir varlıktır. En az iki tetikleyicide güncellenir: üretimde yeni bir hata tipi görüldüğünde (o örnek sete eklenir) ve uygulamanın kapsamı değiştiğinde (yeni bir görev veya kullanıcı tipi eklendiğinde). Bunun dışında seti düzenli aralıklarla gözden geçirmek, artık geçerli olmayan beklenen cevapları güncellemek ve gerçek kullanım dağılımıyla hâlâ örtüşüp örtüşmediğini kontrol etmek gerekir. Seti güncel tutmanın disiplini, LLM değerlendirme sisteminin zamanla değerini korumasının tek yoludur; güncellenmeyen bir set, gerçekliğin gerisinde kalır ve yanlış bir güven duygusu verir.
Özetle: Eval Seti Kurulumu Ölçmeyi Alışkanlığa Çevirir
Özetle, eval seti kurulumu bir LLM uygulamasının kalitesini sezgiden ölçüme taşır: gerçek kullanıcı sorularını, zor ve uç vakaları ve bilinen hataları kapsayan bir altın soru seti kurar, her soruya bir rubrik ve her boyuta bir kabul eşiği bağlar, otomatik puanlamayı insan değerlendirici uyumuyla kalibre eder ve seti her sürümde bir regresyon testi gibi çalıştırırsınız. İyi kurulmuş bir set, "iyi çalışıyor" izlenimini tekrar edilebilir ve savunulabilir bir LLM değerlendirme pratiğine dönüştürür.
Bu yazı, konunun dar ve pratik bir kesitidir; tüm boyutları görmek için kapsamlı rehber yazısına, temel kavramlar için LLM nedir ve LLM değerlendirme nedir yazılarına bakabilirsiniz. Ekibinize üretim düzeyinde eval seti kurulumu, altın soru seti tasarımı ve kabul eşiği yönetimi yetkinliğini kazandırmak için kurumsal eğitim programını inceleyin; doğru kurulan bir değerlendirme disiplini, yapay zeka yatırımınızın sessiz ama en belirleyici güvencesidir.
Danismanlik Baglantilari
Bu yazıya en yakın consulting sayfaları
Bu içerikten sonraki mantıklı adım için en ilgili solution, role ve industry landing'lerini burada görebilirsin.
E-Ticaret icin Arama, Oneri ve Destek Asistanlari
Urun kesfi, destek operasyonu ve icerik sureclerini yapay zeka ile guclendirerek gelir ve memnuniyet artisi saglayan sistemler.
Kurumsal RAG Sistemleri Gelistirme
Sirket ici bilgiye kaynakli, guvenli ve denetlenebilir erisim saglayan uretim seviyesinde RAG mimarileri.
AI Agent ve Workflow Otomasyonu
Tek adimli chatbot'larin otesine gecen; arac, kural ve insan onayi ile ilerleyen AI destekli is akislarina gecis.