Self-Attention
Bir dizideki her öğenin aynı dizideki diğer tüm öğelerle ilişkisini hesaplayan dikkat türü.
Öz-dikkatin en büyük teknik avantajı paralelleştirilebilir olmasıdır: RNN'lerin aksine, dizideki tüm konumlar için dikkat hesabı aynı anda, matris çarpımlarıyla yapılabilir; bu da GPU'larda çok büyük hızlanma sağlar ve modelin çok uzun mesafeli bağımlılıkları -örneğin bir paragrafın başındaki özneyle sonundaki fiil arasındaki ilişkiyi- doğrudan yakalamasına imkân tanır. "Çoklu kafa" (multi-head) dikkat adı verilen teknikte, model aynı anda birden fazla öz-dikkat hesabı yaparak dilin farklı yönlerini (sözdizimsel, anlamsal) paralel biçimde öğrenir. Öz-dikkat, Transformer mimarisinin ve dolayısıyla günümüz büyük dil modellerinin işlem gücünün ve ölçeklenebilirliğinin doğrudan kaynağıdır.
