Investigation of deep neural models for supervised emotional speech synthesis with limited data
2024
0 views
0 downloads
Advisor: Doç. Dr. Cenk Demiroğlu
Abstract (TR)
İnsan konuşması, konuşmacının kimliği, duyguları ve farklı konuşma stilleri gibi yalnızca kelimelerin ötesinde birçok bilgiyi ileten, zengin bir şekilde ifade edici bir ortam olarak hizmet eder. Günümüzün Derin Öğrenme ile güçlendirilmiş Metin-Konuşma (TTS) modelleri, doğallık ve anlaşılabilirlik açısından neredeyse insan benzeri konuşmalar üretecek kadar ilerlemiştir. Ancak, insan konuşmasının ifadesiyle kıyaslandığında ifade edici konuşma sentezi alanında hâlâ kat edilecek önemli bir yol bulunmaktadır. Çeşitli duygusal durumlarda konuşma üretebilen denetimli duygusal TTS modelleri (ETTS), öncelikle birden fazla duygu ile anotasyonlanmış eğitim verilerine dayanır. Bu tür veri setlerinin oluşturulması önemli zorluklar teşkil eder, bu da sınırlı kullanılabilirlik ve genellikle daha küçük boyutlarla sonuçlanır. Bu tezde, denetimli ETTS yaklaşımlarının duygu ifadesini geliştirmeyi amaçlayan çeşitli derin sinir modellerinin araştırılmasına dalıyoruz. Araştırmamızda incelenen modeller arasında ses dönüştürme modelleri, duygu sınıflandırıcılar ve adversarial eğitim ayırt edicileri yer almaktadır. İki genişletilmiş ETTS modeli öneriyoruz: ilki, ETTS modeline duygusal bir ses dönüştürücü entegre ederken, ikincisi, her biri bir duygu sınıflandırıcı ve bir ayırt edici içeren iki ensemble'ı ETTS mimarisine dahil eder. İlk modelde, iki farklı ses dönüştürme modelini inceliyoruz: MaskCycleGAN ve Seq2Seq ses dönüştürücüler. İkinci modelde, ensemble'lara giriş olarak iki tür duygu ifadesiyle ilgili özellik kullanılmaktadır: perde özellikleri ve bir varyasyonel otokodlayıcı tarafından oluşturulan duygu gömmeleri. Uygulanan bileşenlerin uygulanabilirliğini ve her bir önerilen modelin genel performansını değerlendirmek için birkaç değerlendirme testi gerçekleştirdik. Deneylerimiz, önerilen modellerin baz model üzerinde önemli iyileştirmeler sağladığını ortaya koydu.
Author
Dr. Huda Mohammed Mohammed Barakat
Institution
How to Cite
Huda Mohammed Mohammed Barakat (Doktora Tezi). Investigation of deep neural models for supervised emotional speech synthesis with limited data, 2024, Özyegin University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Özyegin University
- Robust whole-body control for legged robots(2022)
- An application for a particleboard plant: Web-based decision support system for quality prediction and digital transformation(2022)
- Performance evaluation and experimental verification of vehicular visible light communication(2022)
- Determinants of liquidity adequacy ratio: An empirical study on Turkish banks(2022)
- Experimental impact analysis of the refrigerator cable design on disturbance power test(2022)
- A performance based assesment of biological self-healing cement-based mortar(2022)
