Vision-Language Model / VLM
Hem görüntüleri hem metni anlayıp ilişkilendirebilen çok modlu model türü.
Görsel-dil modelleri, bir görseli tarif edebilir, görseldeki metni okuyabilir veya görsele dayalı sorulara cevap verebilir; GPT-4o ve Gemini örnek modellerdir.

Üye yorumları