🎯
Veri & Analiz

Model Hakemi Kalibrasyon Testi

LLM tabanlı değerlendiricinin önyargılarını kontrollü deneyle ortaya çıkarır.

PROMPT
Bir model hakeminin puanlama güvenilirliğini ölçmek için deney tasarla. Aynı yanıt çiftlerini ters sıra, eşit uzunluk ve gizlenmiş model adı koşullarında yeniden değerlendir. Konum ve uzunluk önyargısını ayrı hesapla; insan uzmanlarla uyuşma oranı için güven aralığı ver. Sonuçta hakemin hangi görevlerde kullanılmaması gerektiğini yaz.
1ÖZELLEŞTİR

Köşeli parantezli alanları kendi hedefin, kitlen ve bağlamınla değiştir.

2ÇALIŞTIR

Promptu önerilen araca yapıştır; ilk çıktıyı bir taslak olarak değerlendir.

3İYİLEŞTİR

Eksik noktaları belirt, örnek ekle ve istediğin çıktı biçimini daha kesin tanımla.

Önerilen araç: ChatGPT

Bu promptu ChatGPT ile kullanmanızı öneririz.

ChatGPT Sayfasına Git →