Speech Recognition
Sesli konuşmayı yazılı metne dönüştüren teknoloji.
Konuşma tanıma (speech recognition), sesli konuşmayı otomatik olarak yazılı metne dönüştüren, İngilizce literatürde genellikle Automatic Speech Recognition (ASR) olarak da adlandırılan teknolojidir. Süreç teknik olarak, ham ses dalgasının önce spektrogram gibi bir sayısal temsile dönüştürülmesi, ardından bir modelin bu akustik sinyali fonemlere (dilin en küçük ses birimleri), bunları da kelimelere eşlemesi şeklinde işler. Erken dönem sistemler Gizli Markov Modelleri gibi istatistiksel yöntemlere dayanırken, günümüz sistemleri uçtan uca eğitilen derin sinir ağlarını, özellikle Transformer tabanlı mimarileri kullanır; bu sayede arka plan gürültüsü, farklı aksanlar ve konuşma hızındaki değişkenlikle çok daha iyi başa çıkılabilmektedir.
OpenAI'ın Whisper modeli gibi günümüzün önde gelen sistemleri, çok sayıda dilde ve gürültülü gerçek dünya koşullarında yüksek doğruluk sağlayarak alanı önemli ölçüde ilerletmiştir. Konuşma tanıma; Siri, Google Asistan ve Alexa gibi sesli asistanların, toplantı ve röportaj kayıtlarını otomatik yazıya döken transkripsiyon araçlarının, sesli komutla çalışan araç ve ev sistemlerinin ve işitme engelli kullanıcılar için gerçek zamanlı altyazı sistemlerinin temel teknolojisidir. Alan genellikle metinden sese (TTS) teknolojisiyle birlikte, uçtan uca sesli yapay zeka asistanlarının iki temel bileşenini oluşturur.
OpenAI'ın Whisper modeli gibi günümüzün önde gelen sistemleri, çok sayıda dilde ve gürültülü gerçek dünya koşullarında yüksek doğruluk sağlayarak alanı önemli ölçüde ilerletmiştir. Konuşma tanıma; Siri, Google Asistan ve Alexa gibi sesli asistanların, toplantı ve röportaj kayıtlarını otomatik yazıya döken transkripsiyon araçlarının, sesli komutla çalışan araç ve ev sistemlerinin ve işitme engelli kullanıcılar için gerçek zamanlı altyazı sistemlerinin temel teknolojisidir. Alan genellikle metinden sese (TTS) teknolojisiyle birlikte, uçtan uca sesli yapay zeka asistanlarının iki temel bileşenini oluşturur.
