
RAG yanıtı doğru görünebilir: Üç ölçü hatanın kaynağını ayırır

RAG sistemindeki uydurma veya ilgisiz yanıtları azaltmak için tek bir doğruluk puanı yerine bağlama sadakat, bağlam kesinliği ve yanıt ilgisi ayrı ölçülmelidir. Soru, sıralanmış bağlam parçaları ve üretilen yanıt birlikte saklandığında bu üç sonuç, arızayı getirme, üretim ya da soruyu karşılama katmanına kadar daraltır.
İlgili kanıt getirilmişken yanıt desteklenmeyen bir iddia ekliyorsa üretim katmanı; getirilen parçalar gürültülü veya kötü sıralanmışsa getirme katmanı incelenir. Yanıt bağlama sadık olduğu hâlde soruyu karşılamıyorsa sorun kanıttan çok talimat, niyet çözümleme veya yanıt oluşturma stratejisindedir.
Üç ölçü üç farklı ilişkiyi sınar
AWS’nin RAG değerlendirme rehberi, yanıt ilgisi, bağlam kesinliği ve bağlama sadakati ayrı ölçüler olarak tanımlar. Bunları tek bir ortalamada birleştirmek mümkün olsa da böyle bir toplam, düşük sonucun hangi ilişkide oluştuğunu gizleyebilir.
- Bağlama sadakat: Yanıttaki doğrulanabilir iddiaların getirilen bağlam tarafından desteklenip desteklenmediğini ölçer. Gerçekte doğru olan fakat bu istek için getirilen parçalarda bulunmayan bilgi de bu ölçü açısından desteksizdir.
- Bağlam kesinliği: Getirilen parçaların ilgisini ve kullanılan tanıma bağlı olarak sıralamadaki konumlarını değerlendirir. Düşük sonuç, retriever’ın ilgisiz parçalar seçtiğine veya yararlı parçaları yeterince yukarı taşıyamadığına işaret eder.
- Yanıt ilgisi: Üretilen metnin kullanıcının sorusunu ne ölçüde karşıladığını sınar. Kaynağa bütünüyle sadık bir yanıt, istenen ayrıntıyı vermiyorsa yine ilgisiz olabilir.
Bu ölçüler tek başlarına mutlak bir kök neden kanıtı değildir. Puanı, aynı çalıştırmanın sorusu, bağlamı ve yanıtıyla birlikte incelemek gerekir; aksi hâlde örneğin düşük sadakatin eksik kanıttan mı yoksa modelin mevcut kanıtı kullanmamasından mı doğduğu anlaşılamaz.
Küçük altın veri setini hata ayırmaya uygun kurun
Başlangıç kümesi yalnızca kolay ve açık yanıtlı sorulardan oluşmamalıdır. Çok anlamlı terimleri, bilgi tabanında yanıtı bulunmayan istekleri, güncelliğe duyarlı kayıtları, benzer ürün veya politika adlarını ve birden fazla parçanın birleştirilmesini gerektiren soruları da kapsamalıdır.
Her kayıt için kullanıcı sorusunu, kabul edilebilir referans yanıtın gerekli unsurlarını, doğru kanıtın belge ve parça kimliklerini, izin verilen alternatif ifadeleri ve yeterli bilgi bulunmadığında beklenen çekimserlik davranışını kaydedin. Referans yanıtı ezberlenecek tek metin olarak değil, hangi içeriğin zorunlu olduğunu belirleyen kısa bir doğruluk sözleşmesi olarak kullanın.
Her denemede üretilen yanıtla beraber getirilen parçaları sıralarıyla, belge ve indeks sürümlerini, retriever ayarlarını ve prompt sürümünü saklayın. Yalnızca son yanıtın tutulması, aynı hatanın getirme çıktısından mı yoksa üretim davranışından mı doğduğunu sonradan ayırmayı engeller.
Yanıtı atomik iddialara bölerek sadakati ölçün
Bütün paragrafa sezgisel bir puan vermek yerine her doğrulanabilir ifadeyi ayrı bir iddiaya dönüştürün. Langfuse’un iddia tabanlı yöntemi, her iddianın getirilen bağlama göre denetlenmesini ve desteklenen iddia sayısının toplam iddia sayısına bölünmesini tarif eder.
Koşullu bir örnekte “İade süresi 30 gündür ve ücret beş iş gününde karta döner” cümlesi iki atomik iddia içerir. Getirilen parça yalnızca ilk bilgiyi destekliyorsa sadakat sonucu 1/2’dir; ikinci bilgi başka bir yerde doğru olsa bile bu çalıştırmada bağlama dayanmıyordur. Böylece akıcı ve ikna edici görünen tek cümlenin içindeki desteksiz ayrıntı görünür olur.
LLM-as-a-judge kullanılıyorsa değerlendiriciden her iddia için destekleniyor veya desteklenmiyor etiketi, dayanak parça kimliği ve kısa gerekçe içeren yapılandırılmış çıktı isteyin. Otomatik değerlendiriciyi sürüm kapısı yapmadan önce kararlarını insanların etiketlediği küçük bir kalibrasyon kümesiyle karşılaştırın; değişen yönerge veya değerlendirici model, sistem değişmese bile puanı oynatabilir.
Bağlam kesinliğinin hangi varyantını kullandığınızı yazın
“Context precision” bütün araçlarda aynı girdilerle hesaplanmaz. Ragas bağlam kesinliği tanımı, ilgili parçaların ilgisizlerden daha üstte sıralanmasını değerlendirir; dokümantasyon ayrıca referans yanıtlı, üretilen yanıta dayalı ve parça kimliği kullanan varyantlar sunar.
Bu nedenle raporda yalnızca metrik adını değil, varyantı, girdileri, değerlendirici yönergesini ve sürümünü de kaydedin. Üretilen yanıta bakarak parça yararlılığını belirleyen referanssız bir yöntem, kötü bir yanıtın etkisini getirme puanına taşıyabilir. Altın kümedeki doğru parça kimlikleri veya insan etiketli parça ilgisi, retriever’ı generator’dan daha bağımsız değerlendirir.
Koşullu örneği iki ayrı hata etiketiyle okuyun
Bir kullanıcı “Teslimattan sonra iade talebi ne zamana kadar açılabilir?” diye sorsun. Altın kayıttaki gerekli parça “30 gün içinde” bilgisini içeriyor; retriever bu parçayı ilk sıraya, ilgisiz iki kampanya parçasını sonraki sıralara koyuyor. Model ise “30 gün içinde başvurulabilir; ödeme beş iş gününde döner” yanıtını üretiyor.
- Yanıtı “başvuru süresi 30 gündür” ve “ödeme beş iş gününde döner” biçiminde iki iddiaya ayırın.
- İlk iddiayı destekleniyor, ikinciyi desteklenmiyor olarak etiketleyin. Bu koşullu örneğin sadakat sonucu 1/2 olur.
- Üç parçanın ikisi ilgisiz olduğu için getirme çıktısını gürültülü olarak işaretleyin; gerekli parçanın ilk sırada bulunduğunu da ayrıca kaydedin.
- Yanıt sorulan süreyi verdiği için temel ilgililik şartını karşılar. Kayıt böylece tek bir “halüsinasyon” etiketi yerine “desteksiz üretim” ve “getirme gürültüsü” etiketlerini birlikte taşır.
Bu ayrım aynı yanıtta birden fazla arızanın bulunabileceğini gösterir. Tek etikete zorlamak, yalnızca promptu değiştirerek getirme gürültüsünü veya yalnızca retriever’ı değiştirerek desteksiz üretimi çözmeye çalışma riskini artırır.
Puan desenini karar ağacı olarak kullanın
- Kesinlik yüksek, sadakat düşük: Önce desteksiz iddianın dayanağının getirilen parçalarda bulunup bulunmadığını kontrol edin. Gerekli kanıt mevcutsa üretim yönergesi, çekimserlik davranışı ve model ayarları öne çıkar.
- Kesinlik düşük, sadakat yüksek: Model yalnızca mevcut kanıta dayanmış olabilir, ancak retriever gürültülü sonuç vermiştir. Parçalama, sorgu dönüşümü, metadata filtreleri, arama yöntemi ve yeniden sıralama incelenir.
- Sadakat yüksek, ilgililik düşük: Yanıt kaynakla uyumludur fakat kullanıcı niyetini karşılamıyordur. Soru ayrıştırma, sistem talimatı ve yanıt biçimi üretim katmanında gözden geçirilir.
- Üçü de düşük: Önce doğru kanıtın getirilip getirilmediğini sabitleyin; ardından aynı bağlamla üretimi yeniden çalıştırın. İki katmanı aynı anda değiştirmek, iyileşmenin kaynağını belirsizleştirir.
Bağlam kesinliği, gerekli kanıtın külliyatta bulunmasına rağmen hiç getirilmediğini tek başına göstermez; bunun için referans parça kontrolü veya bağlam geri çağırma ölçüsü gerekir. Üç puanın yüksek olması da kaynak belgenin güncel ve doğru olduğunu kanıtlamaz: sistem, hatalı ya da eski bir bilgi tabanına kusursuz biçimde sadık kalabilir.
Sürümler karşılaştırılırken aynı altın veri setini, sabit değerlendirici yönergesini ve saklanmış getirme çıktılarını koruyun. Böylece puan değişimini indeks, retriever, prompt, üretici model veya değerlendirme yöntemindeki değişiklikle ilişkilendirebilir; baskın hata etiketinin bulunduğu katmanı hedefleyebilirsiniz.
Ayrıca okuyun:
İlgili makaleler


Twitch’te bağımsız oyun yayınları yüzde 51 büyüdü

Suno v6 çıktı: eski modeller kapanırken lisanslı dönem başlıyor

Tek yönlü video mülakatta ikinci şans yok: Cevabı süreye göre kurun

Firestore, MongoDB değil: Taşımadan önce bilinen altı uyumsuzluk

AI pilotu hızlandı diye başarılı sayılmaz: ROI’yi dört sonuçla ölçün
Bültenimize abone olun
En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.