Gradient Descent
Kayıp fonksiyonunu en aza indirmek için model parametrelerini adım adım güncelleyen optimizasyon algoritması.
Klasik gradyan inişi tüm veri kümesi üzerinden gradyan hesaplarken, pratikte bu hesaplama açısından maliyetli olduğundan mini-batch stokastik gradyan inişi (SGD) tercih edilir; her adımda verinin küçük bir alt kümesi kullanılır. Zamanla momentum, RMSprop ve özellikle günümüz derin öğrenmesinde standart haline gelen Adam gibi daha gelişmiş varyantlar geliştirilmiştir; bunlar öğrenme oranını adaptif biçimde ayarlayarak yakınsamayı hızlandırır ve yerel minimumlara takılma riskini azaltır. Geri yayılımın hesapladığı gradyanları kullanan bu algoritma, sinir ağlarından lojistik regresyona kadar hemen hemen tüm modern makine öğrenmesi modellerinin eğitiminin motorudur.
