LETTER M 👁 19 views

Multimodal learning

Metin, görüntü, ses veya video gibi birden fazla veri türünü birlikte işleyerek ortak temsil öğrenen artificial intelligence yaklaşımı.

Çok modlu öğrenme, farklı veri türlerinden gelen tamamlayıcı sinyalleri tek bir modelde birleştirir. Bir görseli metinle açıklama, videodaki konuşmayı ve hareketi birlikte anlama gibi görevlerde kullanılır. Modaliteler arasında zamanlama, ölçek ve anlam eşleştirmesi yapılmadığında model bir veri türünü diğerlerine göre aşırı baskın kullanabilir.