Transformer
Dikkat mekanizmasını temel alan, günümüz büyük dil modellerinin mimari temelini oluşturan sinir ağı yapısı.
Bir Transformer bloğu tipik olarak öz-dikkat katmanları ile ileri beslemeli sinir ağı katmanlarının art arda dizilmesinden oluşur; artık bağlantılar (residual connections) ve katman normalizasyonu, çok derin ağların istikrarlı eğitilmesine yardımcı olur. Orijinal mimari kodlayıcı-kodçözücü (encoder-decoder) yapısındaydı; günümüzde GPT gibi modeller yalnızca kodçözücü, BERT gibi modeller yalnızca kodlayıcı kısmını kullanır. Transformer'ın ölçeklenebilirliği -yani daha fazla veri ve parametreyle sürekli performans artışı göstermesi- büyük dil modeli çağının doğrudan tetikleyicisi olmuş, dil işlemenin ötesinde görüntü (Vision Transformer) ve ses işleme gibi alanlara da yayılmıştır.
