Konuşma seslerinden duyguları tanımak için yerel ikili ve üçlü örüntülere dayalı yeni bir modelin geliştirilmesi
2021
0 görüntülenme
0 i̇ndirme
Danışman: Prof. Dr. Asaf Varol
Özet (TR)
Konuşma seslerinden duygu tanıma, insan-bilgisayar etkileşiminin ve işbirliğinin en üst düzeyde olması için önemli bir disiplindir. Farklı frekans ve karakteristikler içeren konuşma sinyalinin analizi zordur, bu nedenle konuşma verilerinden duyguları tanımak makine öğrenmesi için karmaşık bir problemdir. Ses özniteliklerinin çıkarımında ve sınıflandırmada farklı yöntemler geliştirilse de başarı oranları, dillere, duygulara ve veri tabanlarına göre değişmektedir. Bu tez çalışmasında, farklı boyutlardaki veri setlerinde uygulanabilecek, düşük hesaplama karmaşıklığına sahip, maliyeti düşük ve sınıflandırma performansını arttıran yeni bir model sunulmuştur. Öznitelik çıkarım tekniğine katkıda bulunacak yerel özniteliklerden genel optimum özniteliklere ulaşan yeni bir strateji elde edilmiştir. Önerilen model üç ana aşamadan oluşmaktadır. Bu aşamalar, öznitelik çıkarma, öznitelik seçme ve sınıflandırmadır. Ham ses verilerine dokuz seviyeli 1B-ADD uygulanarak alçak-geçirgen filtre katsayıları elde edilmiştir. Daha sonra her bir alçak geçirgen filtreye 1B-YİÖ ve 1B-YÜÖ uygulanarak öznitelik çıkarma ve ardından öznitelik birleştirme gerçekleştirilmiştir. 1B-YİÖ ve 1B-YÜÖ kullanılarak yerel ve dokusal öznitelikler elde edilmiştir. Sıralı bir yapı oluşturan dokuz seviyeli 1B-ADD yöntemi ile konuşma sinyallerindeki gürültüler giderilmiş, ses sinyal boyutu indirgenmiş ve frekans bölgesinde yeni öznitelikler çıkarılmıştır. Öznitelik çıkarım aşamasında 1B-YİÖ, 1B-YÜÖ ve 1B-ADD birlikte kullanılarak çok seviyeli yeni bir elle öznitelik çıkarım süreci sunulmuştur. Uzaklık tabanlı KBA ile sınıflandırıcıya giriş olacak en etkili öznitelikler seçilmiş ve diğer öznitelikler elenmiştir. Sınıflandırma aşamasında, güçlü bir sınıflandırıcı olan DVM kullanılmıştır. Önerilen model konuşmacıdan ve metinden bağımsız olarak RAVDESS, EMODB, SAVEE ve EMOVO gibi farklı karşılaştırma veri tabanlarında test edilmiştir. Literatüre, konuşma seslerinden duygu tanıma alanında, sınıflandırma ortalama doğruluk değerini arttıran düşük hesaplama karmaşıklığına sahip yeni bir model kazandırılmıştır.
Yazar
Yeşim Ülgen Sönmez
Kurum
Bu Yayına Nasıl Atıf Yapılır
Yeşim Ülgen Sönmez (Doktora Tezi). Konuşma seslerinden duyguları tanımak için yerel ikili ve üçlü örüntülere dayalı yeni bir modelin geliştirilmesi, 2021, Fırat University.
Anahtar Kelimeler
Lisans
Tüm Hakları Saklıdır
Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.
Fırat University tezlerinden daha fazlası
- Bütünleşik pazarlama iletişimi aracı olarak sosyal medyanın kullanılması(2018)
- Hollanda Doğu Hindistan Şirketi'nin doğuşu ve XVII. yüzyıl Endonezyası'nda yükselişi(2013)
- Doğu Anadolu fay zonu'nun Doğanyol (Malatya) ile Çelikhan (Adıyaman) arasındaki gerilme durumunun incelenmesi(2020)
- Fuzûlî'nin Türkçe Divân'ında renklerin kullanımı(2013)
- Yavuzeli (Gaziantep) çevresinde yüzeyleyen volkanik kayaçların petrografik ve jeokimyasal özellikleri(2014)
- Hizbu't-Tahrir ve Ercümend Özkan'ın siyasi ve dini görüşleri(2008)
