DoctorateOpen Access

Konuşma seslerinden duyguları tanımak için yerel ikili ve üçlü örüntülere dayalı yeni bir modelin geliştirilmesi

2021
0 views
0 downloads
Advisor: Prof. Dr. Asaf Varol

Abstract (TR)

Konuşma seslerinden duygu tanıma, insan-bilgisayar etkileşiminin ve işbirliğinin en üst düzeyde olması için önemli bir disiplindir. Farklı frekans ve karakteristikler içeren konuşma sinyalinin analizi zordur, bu nedenle konuşma verilerinden duyguları tanımak makine öğrenmesi için karmaşık bir problemdir. Ses özniteliklerinin çıkarımında ve sınıflandırmada farklı yöntemler geliştirilse de başarı oranları, dillere, duygulara ve veri tabanlarına göre değişmektedir. Bu tez çalışmasında, farklı boyutlardaki veri setlerinde uygulanabilecek, düşük hesaplama karmaşıklığına sahip, maliyeti düşük ve sınıflandırma performansını arttıran yeni bir model sunulmuştur. Öznitelik çıkarım tekniğine katkıda bulunacak yerel özniteliklerden genel optimum özniteliklere ulaşan yeni bir strateji elde edilmiştir. Önerilen model üç ana aşamadan oluşmaktadır. Bu aşamalar, öznitelik çıkarma, öznitelik seçme ve sınıflandırmadır. Ham ses verilerine dokuz seviyeli 1B-ADD uygulanarak alçak-geçirgen filtre katsayıları elde edilmiştir. Daha sonra her bir alçak geçirgen filtreye 1B-YİÖ ve 1B-YÜÖ uygulanarak öznitelik çıkarma ve ardından öznitelik birleştirme gerçekleştirilmiştir. 1B-YİÖ ve 1B-YÜÖ kullanılarak yerel ve dokusal öznitelikler elde edilmiştir. Sıralı bir yapı oluşturan dokuz seviyeli 1B-ADD yöntemi ile konuşma sinyallerindeki gürültüler giderilmiş, ses sinyal boyutu indirgenmiş ve frekans bölgesinde yeni öznitelikler çıkarılmıştır. Öznitelik çıkarım aşamasında 1B-YİÖ, 1B-YÜÖ ve 1B-ADD birlikte kullanılarak çok seviyeli yeni bir elle öznitelik çıkarım süreci sunulmuştur. Uzaklık tabanlı KBA ile sınıflandırıcıya giriş olacak en etkili öznitelikler seçilmiş ve diğer öznitelikler elenmiştir. Sınıflandırma aşamasında, güçlü bir sınıflandırıcı olan DVM kullanılmıştır. Önerilen model konuşmacıdan ve metinden bağımsız olarak RAVDESS, EMODB, SAVEE ve EMOVO gibi farklı karşılaştırma veri tabanlarında test edilmiştir. Literatüre, konuşma seslerinden duygu tanıma alanında, sınıflandırma ortalama doğruluk değerini arttıran düşük hesaplama karmaşıklığına sahip yeni bir model kazandırılmıştır.

Author

Yeşim Ülgen Sönmez

How to Cite

Yeşim Ülgen Sönmez (Doktora Tezi). Konuşma seslerinden duyguları tanımak için yerel ikili ve üçlü örüntülere dayalı yeni bir modelin geliştirilmesi, 2021, Fırat University.

Keywords

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Fırat University