💻
Kod & Geliştirme

LLM Sunucu Yığınlama Ayarı

Model sunucusunun verimini tek bir ortalama gecikmeye bakmadan optimize eder.

PROMPT
Sürekli yığınlama kullanan bir model sunucusu için ayar deneyi tasarla. Kısa sohbet, uzun belge ve toplu üretim trafiğini ayrı yük profilleriyle çalıştır. Token/saniye, ilk token süresi, p99 gecikme ve adalet metriklerine göre kuyruk politikasını seç.
1ÖZELLEŞTİR

Köşeli parantezli alanları kendi hedefin, kitlen ve bağlamınla değiştir.

2ÇALIŞTIR

Promptu önerilen araca yapıştır; ilk çıktıyı bir taslak olarak değerlendir.

3İYİLEŞTİR

Eksik noktaları belirt, örnek ekle ve istediğin çıktı biçimini daha kesin tanımla.

Önerilen araç: ChatGPT

Bu promptu ChatGPT ile kullanmanızı öneririz.

ChatGPT Sayfasına Git →