T Harfi 👁 28 görüntülenme

Transformer

Dikkat mekanizmasını temel alan, günümüz büyük dil modellerinin mimari temelini oluşturan sinir ağı yapısı.

Transformer, 2017 yılında Google araştırmacılarının yayımladığı "Attention Is All You Need" başlıklı makaleyle tanıtılan ve günümüz büyük dil modellerinin neredeyse tamamının mimari temelini oluşturan sinir ağı yapısıdır. Kendisinden önceki tekrarlayan sinir ağları (RNN) ve LSTM'ler, bir diziyi kelime kelime, sıralı biçimde işlediği için hem yavaştı hem de uzun mesafeli bağımlılıkları yakalamakta zorlanıyordu. Transformer bunun yerine öz-dikkat (self-attention) mekanizmasını kullanarak, bir dizideki her kelimenin diğer tüm kelimelerle ilişkisini aynı anda, paralel biçimde hesaplar. Bu, hem eğitimin GPU'larda çok daha hızlı yapılabilmesini hem de modelin çok uzun bağlamlarda tutarlılığını korumasını sağlamıştır.

Bir Transformer bloğu tipik olarak öz-dikkat katmanları ile ileri beslemeli sinir ağı katmanlarının art arda dizilmesinden oluşur; artık bağlantılar (residual connections) ve katman normalizasyonu, çok derin ağların istikrarlı eğitilmesine yardımcı olur. Orijinal mimari kodlayıcı-kodçözücü (encoder-decoder) yapısındaydı; günümüzde GPT gibi modeller yalnızca kodçözücü, BERT gibi modeller yalnızca kodlayıcı kısmını kullanır. Transformer'ın ölçeklenebilirliği -yani daha fazla veri ve parametreyle sürekli performans artışı göstermesi- büyük dil modeli çağının doğrudan tetikleyicisi olmuş, dil işlemenin ötesinde görüntü (Vision Transformer) ve ses işleme gibi alanlara da yayılmıştır.