M Harfi 👁 23 görüntülenme

Mixture of Experts / MoE

Girdiye göre yalnızca ilgili 'uzman' alt ağların etkinleştirildiği verimli model mimarisi.

Karma Uzmanlar (Mixture of Experts, MoE) mimarisi, bir modelin çok sayıda "uzman" alt ağdan oluşup, her girdi için bu uzmanların tamamını değil yalnızca birkaçını devreye sokmasına dayanan verimli bir sinir ağı tasarımıdır. Modelin içinde bir "yönlendirici" (router) bulunur; bu bileşen gelen her token için hangi uzmanların en uygun olduğuna karar verir ve hesaplamayı yalnızca seçilen uzmanlar üzerinden yürütür. Böylece model toplamda milyarlarca parametreye sahip olsa bile, tek bir çıkarım (inference) sırasında bu parametrelerin yalnızca küçük bir kısmı aktif olarak kullanılır.

Bu yaklaşımın önemi, "yoğun" (dense) modellerde parametre sayısı arttıkça hesaplama maliyetinin de doğrusal olarak artmasına karşılık, MoE'nin kapasiteyi artırırken çıkarım maliyetini büyük ölçüde sabit tutabilmesinden gelir. Google'ın Switch Transformer'ı ve Mistral'in Mixtral modeli, MoE mimarisini popülerleştiren örnekler arasındadır; bazı üst düzey modellerin de bu mimariyi kullandığı düşünülmektedir. MoE, büyük ölçekli modelleri daha ekonomik biçimde eğitip çalıştırmayı mümkün kılarken, uzmanlar arası yük dengesizliği ve eğitim istikrarsızlığı gibi mühendislik zorlukları da beraberinde getirir.