Master'sOpen Access

Diacritic restoration of Turkish sentences

2021
0 views
0 downloads
Advisor: Dr. Öğr. Üyesi İsmail Burak Parlak ; Prof. Tankut Acarman ; Dr. Öğr. Üyesi Cemal Okan Şakar

Abstract (TR)

Bu proje, Türkçe 'deki fonetik harflerin düzeltilmesine odaklanmaktadır. Mobil ve masaüstü cihazlarda sanal klavye kullanımının artmasıyla birlikte Türkçe harflerin olmaması veya yazım hatası nedeniyle Türkçe kelime hata oranı önemli ölçüde artmıştır. Metin bazlı çalışan birçok sisteme hizmet eden verilerdeki bu sorunu kaldırmak ve temiz bir veri tabanı inşa edebilmek için fonetik harf düzeltmeleri büyük önem arz etmektedir. Çünkü Türkçe de dâhil olmak üzere Rumence, Arapça ve Vietnamca gibi dillerde bu harflerin oldukça yoğun bir kullanımı bulunmakta ve bu harflerin varlığı anlam açısından da büyük farklılık ortaya koymaktadır. Türkçe 'de bu konuya ait benzer çalışmalar mevcut lâkin bu çalışmanın ayrıştığı en önemli noktalardan biri fonetik harfler kümesine "â" ve "î" harflerinin de eklenmesidir. Bu çalışmada, bahsedilen sorunun üstesinden gelmek için öncelikle Türkçe 'ye dair hem çok çeşitli kelimeler barındıran hem de yazım kurallarına uygun bir şekilde yazılmış yaklaşık 5000 adet kitap ile ham bir veri kümesi hazırlandı . Bu ham veri kümesi, birkaç temizleme adımından geçirilerek incelemeye ve oluşturulacak sistemi eğitmeye hazır hale getirildi. İlk olarak bu veri kümeleri ile N-Gram modelleri oluşturuldu. Oluşturulan modeller üzerinde Zipf ve Mandelbrot dağılımları gözlemdi ve ne kadar iyi bir dil modeli tasarlandığını değerlendirmek için "perplexity (karışıklık)" değerleri hesaplandı. Burada elde edilen yüksek uyumluluk değerleri sonrası bu veriler bir sonraki olan öğrenme ve değerlendirme adımlarında kullanıldı. Projenin son adımı olan, modelin eğitimi ve değerlendirmesinde, "seq2seq" temelli öğrenme modeli kullanılarak, harf bazlı sistem eğitimi yapıldı. Veri kümesinden ayrıştırılan kontrol parçaları üzerindeki kelimelerde fonetik ve fonetik harflerin Latin karşılıkları rastgele olarak değiştirilerek yeni bir yapay girdi kümesi oluşturuldu. Eğitilen model, oluşturulan bu kontrol setiyle değerlendirildi ve %90 üzerinden başarımlar elde edildi.

Author

Dr. Hüseyin Ekici

How to Cite

Hüseyin Ekici (Yüksek Lisans Tezi). Diacritic restoration of Turkish sentences, 2021, Galatasaray University.

Keywords

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Galatasaray University