Master'sOpen Access

Speech synthesis using long-term short memory and recurrent neural network (LTSM-RNN)

2023
0 views
0 downloads
Advisor: Prof. Dr. Galip Cansever

Abstract (TR)

Yapay zeka tekniklerinin geliştirilmesinde büyük ilerlemeler kaydedildi. bilgisayar tarafından üretilen multimedyanın yayılmasına ve yayılmasına yol açan son on yıl görüntü, ses ve videodan oluşan, gerçeğe çok yakın ve gerçekçi olması zor olan içerik aynı nitelikteki orijinal içerikten ayrı olarak anlatılmıştır. ilginç uygulamalar varken yapay zeka tarafından üretilen içerik, tehlikeli ve aldatıcı şekillerde de kullanılabilir. örneğin bir mahkemede kanıt olarak. Bu nedenle otomatik yöntemler bulmak giderek daha acil hale geliyor. yapay zeka konuşma sentezlenmiş içeriği orijinal içerikten ayırt eder. Bunda Araştırmada, işitsel içeriği ve özellikle kesinlikle tamamen gizli olan konuşmayı dikkate alıyoruz. sahtecilik söz konusu olduğunda hassas. alanında daha önce yapılan araştırmaları derinleştireceğiz. gerçek konuşmacıları tanımak için daha genel otomatik yöntemler oluşturmak amacıyla bi-spektral analiz yapay zekadan, Uzun-Süreli-Kısa Bellek Tekrarlayan kullanılarak sentezlenmiş konuşma Sinir Ağı (LTSM-RNN). Kullandığımız seslerin veri seti çok geniştir ve heterojen, hem gerçek seslerden hem de çeşitli farklı yöntemlerle sentezlenmiş seslerden oluşan yöntemler. Tüm konuşma kayıtlarından çift tutarlılığı çıkardık ve bazılarını gerçekleştirdik. sınıflandırmalar (her ikisi de çok etiketli sınıflandırmalar; tüm diğerlerinden gelen sesler ve gerçek ve sahte sesler arasındaki ikili sınıflandırmalar) çeşitli destek vektör makinesi, lojistik gibi makine öğrenimi ve derin öğrenme teknikleri regresyon ve evrişimli sinir ağı. Özellikle, çift tutarlılıklar bir kez ses dosyalarından hesaplanan aşağıdaki testleri gerçekleştirdik. Öncelikle şunu çoğalttık. ix iki tutarlılıktan oluşan bir dizi özellik çıkaran önceki çalışmalar üzerinde yapılan testler ikili eşevreliliğin hem modüllerinin hem de fazlarının ortalama, varyans, çarpıklık ve basıklık üzerinde basit çok sınıflı ve ikili sınıflandırmalar yaparak sınıflandırmaya çalışmak bir LTSM, bir dizi RNN ve biraz CNN kullanarak. Sonra açık bir set ortamını simüle ettik. modeli eğitim aşamasında henüz görülmemiş verilerle test etmek için bir dizi LTSM kullanmak. Ayrıca, yeni bir dizi özellik çıkarmak için bir dizi hibrit LTSM-RNN kullandık ve basit çok etiketli ve ikili sınıflandırmalar gerçekleştirerek bunları sınıflandırın. Son olarak, araştırma yukarıdaki iki özellik grubunu birleştirdi ve bunlarla daha fazla sınıflandırma gerçekleştirdi (bu açık küme ortamında da durum) ve bu yöntemle göstereceğiz %99,76 doğruluk oranı ile en iyi sonuçları elde etmiştir. Sonuçlar, gerçek ve sahte konuşma kayıtları veya sentezi arasında ayrım yapmada bispektral analizin rolünü daha iyi açıklığa kavuşturdu ve kurşun multimedya adli tıp alanında daha fazla araştırma yapmak.

Author

Dr. Arkan Adnan Imran Al-yasarı

How to Cite

Arkan Adnan Imran Al-yasarı (Yüksek Lisans Tezi). Speech synthesis using long-term short memory and recurrent neural network (LTSM-RNN), 2023, Altınbaş University.

Keywords

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Altınbaş University