ROUGE (Özetleme Değerlendirme Metriği)
Araç kavramlarıROUGE nedir?
ROUGE (Recall-Oriented Understudy for Gisting Evaluation), bir modelin ürettiği metni — çoğunlukla özeti — insan tarafından yazılmış referans metinle kıyaslayan otomatik değerlendirme metriğidir. Temel mantığı basit: "modelin çıktısı, referanstaki kelime ve kelime gruplarının ne kadarını yakalamış?" ROUGE ne kadar yüksekse çıktı referansa o kadar çok örtüşüyor demektir. 2004'te özetleme sistemlerini ölçmek için ortaya çıktı ve o günden beri bu alanın standart karnesi oldu.
Nasıl çalışır?
ROUGE'un birkaç çeşidi var. ROUGE-N, referansla çıktı arasındaki ortak n-gram'lara bakar (ROUGE-1 tek kelime, ROUGE-2 ikili kelime grubu). ROUGE-L ise en uzun ortak alt diziyi (longest common subsequence) ölçer; kelimelerin sırasını da hesaba kattığı için akıcılık hakkında fikir verir. Hesap; recall (referansın ne kadarı yakalandı), precision (çıktının ne kadarı isabetli) ve ikisinin dengesi olan F1 üzerinden yapılır. İsmindeki "recall-oriented" vurgusu buradan gelir — özette bilgi kaçırmamak kritiktir.
Neden önemli?
Bir özetleme ya da çeviri modelini her seferinde insana okutmak pahalı ve yavaştır. ROUGE, binlerce çıktıyı saniyeler içinde sayısal bir skora çevirir; model karşılaştırmayı ve benchmark'ları mümkün kılar. BLEU çeviri tarafının, ROUGE ise özetleme tarafının klasik metriğidir. Ama sınırı da net: yalnızca kelime örtüşmesine baktığı için anlamı doğru ama farklı kelimelerle yazılmış bir özeti düşük puanlayabilir. Bu yüzden bugün yanına genellikle LLM-as-a-judge gibi anlam odaklı değerlendirmeler ekleniyor.
Kullanım alanları
Metin özetleme modellerinin karşılaştırılması, makale ve haber özetleyicilerin kalite takibi, çeviri ile başlık üretimi sistemlerinin değerlendirmesi ve akademik NLP çalışmalarında yeni modelin eskisini geçip geçmediğini raporlama. Bir özetleme aracının "state-of-the-art" iddiasını görürsen, altında büyük ihtimalle bir ROUGE tablosu vardır.
Ilgili terimler
