Metin, görsel, ses gibi farklı veri türlerini birlikte işleyebilen yapay zeka sistemi.
Çok modlu yapay zeka (multimodal AI), metin, görsel, ses, video gibi birden fazla farklı veri türünü (modaliteyi) aynı model içinde birlikte anlayabilen, ilişkilendirebilen ve üretebilen yapay zeka sistemlerini ifade eder. Geleneksel modeller genellikle tek bir modaliteye özelleşmişti: bir model yalnızca metni, başka bir model yalnızca görüntüyü işlerdi. Çok modlu modeller ise farklı modaliteleri ortak bir temsil (embedding) uzayında buluşturarak, örneğin bir görseli tarif eden metin üretebilir, bir metinden görsel oluşturabilir veya sesli bir soruyu görsel bir bağlamla ilişkilendirerek cevaplayabilir. Bu, farklı duyulardan gelen bilgiyi bütünleştiren insan bilişine kavramsal olarak daha yakın bir yaklaşımdır.
Teknik olarak çok modlu modeller genellikle her modalite için ayrı bir kodlayıcı (örneğin görüntüler için bir görsel Transformer, metin için bir dil modeli kodlayıcısı) kullanır ve bu kodlayıcıların çıktısını ortak bir uzayda birleştirerek işler. GPT-4o, Gemini ve Claude'un görsel anlama yetenekleri, CLIP gibi görsel-dil hizalama modelleri ve metinden görsel/video üreten Sora, Midjourney gibi sistemler bu kategoriye örnektir. Çok modlu yapay zeka, tıbbi görüntü ile hasta notlarını birlikte değerlendiren tanı sistemlerinden, görme engelli kullanıcılara ortamlarını sesli tarif eden asistanlara kadar gerçek dünya problemlerinin çözümünde giderek daha merkezi bir rol oynamaktadır.
ZncLabs temel özellikler için zorunlu çerezleri, isteğe bağlı analizleri ise yalnızca onayınızla kullanır. Ayrıntılar için Gizlilik sayfasını inceleyin.