Diacritic restoration of Turkish sentences
2021
0 views
0 downloads
Advisor: Dr. Öğr. Üyesi İsmail Burak Parlak ; Prof. Tankut Acarman ; Dr. Öğr. Üyesi Cemal Okan Şakar
Abstract (TR)
Bu proje, Türkçe 'deki fonetik harflerin düzeltilmesine odaklanmaktadır. Mobil ve masaüstü cihazlarda sanal klavye kullanımının artmasıyla birlikte Türkçe harflerin olmaması veya yazım hatası nedeniyle Türkçe kelime hata oranı önemli ölçüde artmıştır. Metin bazlı çalışan birçok sisteme hizmet eden verilerdeki bu sorunu kaldırmak ve temiz bir veri tabanı inşa edebilmek için fonetik harf düzeltmeleri büyük önem arz etmektedir. Çünkü Türkçe de dâhil olmak üzere Rumence, Arapça ve Vietnamca gibi dillerde bu harflerin oldukça yoğun bir kullanımı bulunmakta ve bu harflerin varlığı anlam açısından da büyük farklılık ortaya koymaktadır. Türkçe 'de bu konuya ait benzer çalışmalar mevcut lâkin bu çalışmanın ayrıştığı en önemli noktalardan biri fonetik harfler kümesine "â" ve "î" harflerinin de eklenmesidir. Bu çalışmada, bahsedilen sorunun üstesinden gelmek için öncelikle Türkçe 'ye dair hem çok çeşitli kelimeler barındıran hem de yazım kurallarına uygun bir şekilde yazılmış yaklaşık 5000 adet kitap ile ham bir veri kümesi hazırlandı . Bu ham veri kümesi, birkaç temizleme adımından geçirilerek incelemeye ve oluşturulacak sistemi eğitmeye hazır hale getirildi. İlk olarak bu veri kümeleri ile N-Gram modelleri oluşturuldu. Oluşturulan modeller üzerinde Zipf ve Mandelbrot dağılımları gözlemdi ve ne kadar iyi bir dil modeli tasarlandığını değerlendirmek için "perplexity (karışıklık)" değerleri hesaplandı. Burada elde edilen yüksek uyumluluk değerleri sonrası bu veriler bir sonraki olan öğrenme ve değerlendirme adımlarında kullanıldı. Projenin son adımı olan, modelin eğitimi ve değerlendirmesinde, "seq2seq" temelli öğrenme modeli kullanılarak, harf bazlı sistem eğitimi yapıldı. Veri kümesinden ayrıştırılan kontrol parçaları üzerindeki kelimelerde fonetik ve fonetik harflerin Latin karşılıkları rastgele olarak değiştirilerek yeni bir yapay girdi kümesi oluşturuldu. Eğitilen model, oluşturulan bu kontrol setiyle değerlendirildi ve %90 üzerinden başarımlar elde edildi.
Author
Dr. Hüseyin Ekici
Institution
How to Cite
Hüseyin Ekici (Yüksek Lisans Tezi). Diacritic restoration of Turkish sentences, 2021, Galatasaray University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Galatasaray University
- Devletin yeni uzay faaliyetlerinden doğan uluslararası sorumluluğu(2025)
- Sermaye şirketlerinde ortakların ve organların kamu borçlarından sorumluluğu(2022)
- Le supporterisme comme une identite contre culturelle : etude des modes de construction identitaire dans et autour des stades de football a istanbul(2014)
- Le nouveau roman: claude simon et william faulkner(2014)
- Yöneticilerin sorumluluk sigortası(2015)
- Langlands functoriality principle(2021)
