D Harfi 👁 22 görüntülenme

Diffusion Model

Rastgele gürültüden başlayarak adım adım anlamlı görsel veya ses üreten üretici model türü.

Difüzyon modeli, rastgele gürültüden başlayarak, bu gürültüyü adım adım azaltarak anlamlı ve tutarlı bir görsel, ses veya video üreten bir üretici yapay zeka model türüdür. Eğitim süreci ilginç bir şekilde tersten işler: modele önce gerçek bir görüntü verilir ve bu görüntüye küçük adımlarla, giderek artan miktarda rastgele gürültü eklenir, ta ki görüntü tamamen anlamsız statik gürültüye dönüşene kadar. Model bu sürecin her adımında, o adımda eklenen gürültüyü tahmin etmeyi öğrenir. Eğitim tamamlandığında, bu süreç tersine çevrilebilir: modele saf rastgele gürültü verildiğinde, model öğrendiği gürültü giderme adımlarını tekrarlayarak gürültüyü kademeli olarak temizler ve sonunda tutarlı, gerçekçi bir görsel ortaya çıkar.

Bu yaklaşım, kendisinden önce popüler olan çekişmeli üretici ağlara (GAN) kıyasla genellikle daha kararlı bir eğitim süreci ve daha çeşitli, yüksek kaliteli çıktılar sunar; bu nedenle Stable Diffusion, Midjourney ve DALL-E gibi günümüzün en tanınmış metinden görsel üretme sistemlerinin temelini oluşturur. Bu sistemlerde metin girdisi genellikle bir metin kodlayıcı (örneğin CLIP benzeri bir model) aracılığıyla gürültü giderme sürecine dahil edilerek, üretilen görselin metinsel açıklamayla tutarlı olması sağlanır. Difüzyon modelleri görsel üretimin ötesinde ses sentezi ve video üretimi gibi alanlarda da giderek daha yaygın kullanılmaktadır.