KV Cache
Transformer modelinin önceki tokenlara ait anahtar ve değer tensörlerini yeniden hesaplamadan sakladığı hızlandırma belleği.
KV önbelleği, otoregresif üretimde daha önce işlenen tokenların dikkat hesaplarını bellekte tutar; böylece her yeni token için geçmiş dizinin tamamı yeniden çalıştırılmaz. Bu yaklaşım gecikmeyi düşürürken uzun konuşmalarda bellek tüketimini artırdığı için sıkıştırma ve sayfalama teknikleriyle birlikte yönetilir.

Üye yorumları