S Harfi 👁 4 views

Speculative Decoding

Büyük bir modelin yanıtını hızlandırmak için önce küçük, hızlı bir modelin taslak kelimeler önermesi ve büyük modelin bunları toplu halde doğrulaması tekniği.

Speculative decoding (tahmini kod çözme), büyük dil modellerinin token üretim hızını artırmak için kullanılan bir çıkarım (inference) optimizasyon tekniğidir. Küçük ve hızlı bir "taslak model" önce birkaç token'lık bir tahmin dizisi üretir; ardından asıl büyük model bu tahminleri tek tek değil toplu halde kontrol ederek hangilerinin kendi üreteceği çıktıyla örtüştüğünü doğrular. Örtüşen tokenlar kabul edilir, örtüşmeyen noktadan itibaren büyük model normal şekilde devam eder. Sonuç, çıktı kalitesinden ödün vermeden belirgin şekilde daha hızlı yanıt süreleridir.