Reinforcement Learning
Bir ajanın ödül-ceza mekanizmasıyla deneme yanılma yoluyla optimum davranışı öğrendiği yöntem.
Pekiştirmeli öğrenmenin en dikkat çekici erken başarıları oyun alanında görülmüştür; DeepMind'ın AlphaGo'su dünya şampiyonu Go oyuncularını yenmiş, çeşitli sistemler Atari oyunlarında insan üstü performans göstermiştir. Robotik kontrolde robotların yürüme veya nesne kavrama gibi karmaşık motor becerileri öğrenmesinde de yaygın kullanılır. Ancak alanın günümüz yapay zekasındaki en etkili uygulamalarından biri, büyük dil modellerinin insan tercihleriyle hizalanmasında kullanılan İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme (RLHF) yöntemidir: model, insan değerlendiricilerin hangi cevapları tercih ettiğine dayanan bir ödül sinyaliyle ince ayardan geçirilerek daha yararlı, güvenli ve talimatlara uygun cevaplar üretmeye yönlendirilir.
