Öznitelik Seçimi (Feature Selection)
İş akışıFeature Selection nedir?
Öznitelik seçimi, bir modeli eğitmeden önce elindeki onlarca (bazen binlerce) değişken arasından gerçekten işe yarayanları ayıklama işi. Amaç net: gürültüyü atıp sinyali tutmak. Her veri sütunu modele katkı sağlamaz; bazıları alakasızdır, bazıları birbirini tekrar eder, bazıları da modeli yanlış yöne çeker.
Nasıl çalışır?
Üç ana aile var. Filter yöntemleri değişkenleri istatistiksel ölçütlerle (korelasyon, ki-kare, mutual information) tek tek puanlar; modelden bağımsız çalışır ve hızlıdır. Wrapper yöntemleri farklı değişken kombinasyonlarıyla modeli tekrar tekrar eğitip performansa bakar (recursive feature elimination gibi); isabetli ama pahalıdır. Embedded yöntemler seçimi eğitim sürecine gömer; L1 regularization (Lasso) katsayıları sıfıra çekerek gereksiz değişkenleri kendiliğinden eler.
Neden önemli?
Az ama doğru değişkenle çalışan model daha hızlı eğitilir, daha az bellek tüketir ve çoğu zaman daha iyi genelleşir. Gereksiz değişkenler overfitting riskini artırır — model gürültüyü ezberlemeye başlar. Ayrıca sade bir model açıklanabilir olur; hangi girdinin sonucu etkilediğini görmek kolaylaşır.
Kullanım alanları
Kredi skorlama, tıbbi teşhis modelleri, genomik veri analizi ve herhangi bir tablo (tabular) veri problemi. Özellikle değişken sayısının örnek sayısından fazla olduğu durumlarda (ör. binlerce gen, yüzlerce hasta) neredeyse zorunlu bir adımdır. Dimensionality reduction ile karıştırılmamalı: feature selection mevcut değişkenlerden bir alt küme seçer, boyut indirgeme ise yeni birleşik değişkenler üretir.
Ilgili terimler
