Mixture of Experts / MoE
Girdiye göre yalnızca ilgili 'uzman' alt ağların etkinleştirildiği verimli model mimarisi.
Bu yaklaşımın önemi, "yoğun" (dense) modellerde parametre sayısı arttıkça hesaplama maliyetinin de doğrusal olarak artmasına karşılık, MoE'nin kapasiteyi artırırken çıkarım maliyetini büyük ölçüde sabit tutabilmesinden gelir. Google'ın Switch Transformer'ı ve Mistral'in Mixtral modeli, MoE mimarisini popülerleştiren örnekler arasındadır; bazı üst düzey modellerin de bu mimariyi kullandığı düşünülmektedir. MoE, büyük ölçekli modelleri daha ekonomik biçimde eğitip çalıştırmayı mümkün kılarken, uzmanlar arası yük dengesizliği ve eğitim istikrarsızlığı gibi mühendislik zorlukları da beraberinde getirir.
