Tokenization
Ham metni modelin işleyebileceği token dizisine dönüştürme süreci.
Tokenizasyon, ham metni bir dil modelinin işleyebileceği sayısal token dizisine dönüştürme sürecidir ve büyük dil modeli mimarisinin en temel ön işleme adımıdır. Basit yaklaşımlar metni doğrudan kelimelere veya karakterlere bölebilir, ancak bu yöntemlerin ciddi dezavantajları vardır: kelime bazlı tokenizasyon devasa ve yetersiz kalabilen bir sözlük gerektirirken, karakter bazlı tokenizasyon diziyi gereksiz yere uzatıp modelin bağlamı verimli kullanmasını zorlaştırır. Bu nedenle günümüzde Byte-Pair Encoding (BPE), WordPiece ve SentencePiece gibi alt kelime (subword) tabanlı algoritmalar tercih edilir; bunlar en sık geçen karakter veya karakter dizisi çiftlerini birleştirerek, sık kelimeleri tek parça, nadir kelimeleri birden fazla anlamlı parçaya bölen dengeli bir sözlük oluşturur.
İyi tasarlanmış bir tokenizasyon, modelin hem yaygın hem de nadir kelimeleri, hatta daha önce hiç görmediği kelimeleri (örneğin özel isimler veya teknik terimler) makul sayıda token ile temsil edebilmesini sağlar; bu da eğitim verimliliğini ve model performansını doğrudan etkiler. Tokenizasyonun kalitesi aynı zamanda dilden dile de değişir: çoğu popüler tokenizatör İngilizce ağırlıklı veriyle optimize edildiğinden, Türkçe gibi eklemeli dillerdeki metinler genellikle daha fazla token'a bölünür; bu da hem maliyeti artırır hem de etkin bağlam penceresini daraltır.
İyi tasarlanmış bir tokenizasyon, modelin hem yaygın hem de nadir kelimeleri, hatta daha önce hiç görmediği kelimeleri (örneğin özel isimler veya teknik terimler) makul sayıda token ile temsil edebilmesini sağlar; bu da eğitim verimliliğini ve model performansını doğrudan etkiler. Tokenizasyonun kalitesi aynı zamanda dilden dile de değişir: çoğu popüler tokenizatör İngilizce ağırlıklı veriyle optimize edildiğinden, Türkçe gibi eklemeli dillerdeki metinler genellikle daha fazla token'a bölünür; bu da hem maliyeti artırır hem de etkin bağlam penceresini daraltır.
Etkileşimli deney hazırlanıyor…
