Vision-Language Model / VLM
Hem görüntüleri hem metni anlayıp ilişkilendirebilen çok modlu model türü.
Görsel-dil modelleri (VLM), görüntü ve metni aynı anda işleyip aralarında anlamsal bağ kurabilen çok modlu (multimodal) yapay zeka modelleridir. Klasik dil modelleri yalnızca metin işlerken, VLM'ler bir görsel kodlayıcı (genellikle bir Vision Transformer) ile bir dil modelini ortak bir temsil uzayında birleştirir; böylece görseldeki nesneleri, sahneyi, yazıyı veya duygusal tonu metinle ilişkilendirebilir. Eğitim sırasında model, genellikle internetten toplanan milyonlarca görsel-metin çifti (örneğin bir fotoğraf ve onun açıklaması) üzerinde, görselin hangi kelimelerle eşleştiğini öğrenir; bu sayede yeni bir görsel gördüğünde onu tarif edebilir, içindeki metni okuyabilir veya görsele dayalı sorulara cevap verebilir.
VLM'ler bugün yapay zekanın en hızlı gelişen alanlarından biridir çünkü gerçek dünya çoğunlukla tek bir modaliteden ibaret değildir: bir fatura hem görsel hem metinsel bilgi taşır, bir ürün fotoğrafı hem şekil hem yazı içerir. GPT-4o, Google Gemini ve Claude gibi güncel büyük modeller görsel girdi kabul ederek grafik yorumlama, el yazısı okuma, diyagram analizi ve görsel muhakeme gibi görevlerde kullanılabilir hale gelmiştir. Bu yetenek, robotik, tıbbi görüntüleme, erişilebilirlik araçları ve otonom sürüş gibi alanlarda pratik uygulamalara zemin hazırlar.
VLM'ler bugün yapay zekanın en hızlı gelişen alanlarından biridir çünkü gerçek dünya çoğunlukla tek bir modaliteden ibaret değildir: bir fatura hem görsel hem metinsel bilgi taşır, bir ürün fotoğrafı hem şekil hem yazı içerir. GPT-4o, Google Gemini ve Claude gibi güncel büyük modeller görsel girdi kabul ederek grafik yorumlama, el yazısı okuma, diyagram analizi ve görsel muhakeme gibi görevlerde kullanılabilir hale gelmiştir. Bu yetenek, robotik, tıbbi görüntüleme, erişilebilirlik araçları ve otonom sürüş gibi alanlarda pratik uygulamalara zemin hazırlar.
