R Harfi 👁 22 görüntülenme

Reinforcement Learning

Bir ajanın ödül-ceza mekanizmasıyla deneme yanılma yoluyla optimum davranışı öğrendiği yöntem.

Pekiştirmeli öğrenme (reinforcement learning), bir "ajanın" bir ortam içinde eylemler gerçekleştirerek, aldığı ödül veya ceza sinyaline dayanarak zamanla optimum davranış stratejisini (politikayı) deneme yanılma yoluyla öğrendiği bir makine öğrenmesi paradigmasıdır. Gözetimli öğrenmeden farklı olarak, ajan hiçbir zaman "doğru cevap" ile doğrudan beslenmez; bunun yerine bir eylem gerçekleştirir, ortamdan bir sonraki durumu ve sayısal bir ödül alır, ve zamanla toplam ödülü maksimize edecek eylemleri tercih etmeyi öğrenir. Bu süreç, bir çocuğun ateşe dokunup acı çekerek ateşten uzak durmayı öğrenmesine benzetilebilir: doğrudan bir talimat yoktur, ancak sonuçlardan öğrenme vardır.

Pekiştirmeli öğrenmenin en dikkat çekici erken başarıları oyun alanında görülmüştür; DeepMind'ın AlphaGo'su dünya şampiyonu Go oyuncularını yenmiş, çeşitli sistemler Atari oyunlarında insan üstü performans göstermiştir. Robotik kontrolde robotların yürüme veya nesne kavrama gibi karmaşık motor becerileri öğrenmesinde de yaygın kullanılır. Ancak alanın günümüz yapay zekasındaki en etkili uygulamalarından biri, büyük dil modellerinin insan tercihleriyle hizalanmasında kullanılan İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme (RLHF) yöntemidir: model, insan değerlendiricilerin hangi cevapları tercih ettiğine dayanan bir ödül sinyaliyle ince ayardan geçirilerek daha yararlı, güvenli ve talimatlara uygun cevaplar üretmeye yönlendirilir.