Q Harfi 👁 23 görüntülenme

Quantization

Model ağırlıklarının daha az bit ile temsil edilerek boyut ve hesaplama maliyetinin azaltılması.

Nicemleme, bir modelin ağırlıklarını normalde 32 bit gibi yüksek hassasiyetli kayan noktalı sayılarla tutmak yerine 8 bit ya da daha düşük hassasiyetli tam sayılarla temsil ederek modelin bellek ayak izini ve çıkarım süresini küçültme tekniğidir. Bu dönüşüm sayesinde büyük dil modelleri gibi devasa sistemler, güçlü sunucu donanımı olmadan dizüstü bilgisayarlarda veya hatta akıllı telefonlarda çalıştırılabilir hale gelir. Nicemleme genellikle küçük bir doğruluk kaybına yol açar, ancak dikkatli uygulandığında bu kayıp çoğu pratik kullanım için gözden kaçacak kadar sınırlı kalır. Özellikle açık kaynaklı modelleri yerel donanımda çalıştırmak isteyen geliştiriciler arasında yaygın bir uygulamadır.