Veri Kümesi (Dataset)
Veri & eğitimVeri kümesi nedir?
Veri kümesi, bir yapay zeka modelinin öğrenmesi için toplanmış örneklerin düzenli bütünüdür. Görüntüler, metinler, ses kayıtları, tablolar — hepsi bir veri kümesi olabilir. Modelin gördüğü dünya bu kümeden ibarettir; kümede olmayan bir şeyi model gerçekten "bilmez".
Genelde üçe bölünür: eğitim (training) kümesi modelin üzerinde öğrendiği kısım, doğrulama (validation) kümesi ayarları test ettiğin kısım, test kümesi ise modelin daha önce hiç görmediği son sınav.
Nasıl çalışır?
Her örnek genellikle bir girdi ve —etiketliyse— bir hedef içerir. Bir kedi-köpek sınıflandırıcısı için girdi bir fotoğraf, hedef ise "kedi" ya da "köpek" etiketidir. Model eğitim sırasında bu eşleşmelere bakarak örüntüleri çıkarır.
Etiketli veri kümeleri supervised learning için, etiketsiz olanlar unsupervised ya da self-supervised yaklaşımlar için kullanılır. Verinin temizliği, dengesi ve çeşitliliği eğitimin başarısını belirler.
Neden önemli?
Model mimarisi ne kadar iyi olursa olsun, zayıf bir veri kümesiyle zayıf sonuç alırsın. Alan tabiriyle: garbage in, garbage out. Eksik, dengesiz ya da önyargılı veri; doğrudan modele yansır ve gerçek dünyada hatalı kararlara yol açar.
Bugün büyük dil modellerinin gücünün önemli bir kısmı, mimariden değil, devasa ve özenle süzülmüş veri kümelerinden gelir.
Kullanım alanları
Görüntü tanımadan çeviriye, öneri sistemlerinden tıbbi teşhise kadar her yerde. Hugging Face gibi platformlarda binlerce açık veri kümesi paylaşılır; şirketler ise çoğu zaman kendi özel verileriyle model eğitir ya da fine-tuning yapar.
Ilgili terimler
