Makine öğrenmesi kullanarak kurumsal verilere dayalı metin sınıflandırma
Is this your thesis?
This record came from a bulk archive import. If it’s yours, link it to your profile.
Abstract (TR)
Çevrim içi platformların kullanımının yaygınlaşması ile birlikte metin verilerinin artması ve bu verilere erişimin kolaylaşması metin sınıflandırma alanında yapılan çalışmaların sayısının çoğalmasına vesile olmuştur. İstenmeyen e-postaların tespiti ve duygu analizi gibi birçok alanda metin sınıflandırma tekniklerinin büyük katkısı bulunmaktadır. Bu tez kapsamında, Türkçe metin sınıflandırma üzerinde çalışılmıştır. Metin sınıflandırma ile ilgili İngilizce birçok araştırma olmasına karşın, bu alanda Türkçe veriler üzerinde yapılan çalışmalar oldukça azdır. Bu çalışmada, bir organizasyona gelen şikayet mektupları eğitim verisi olarak kullanılmıştır. Şikayet mektupları ilgili konular ile etiketli bir şekildedir. Bu konular verilerin alındığı organizasyonun kendi iç süreçlerinde tanımladığı konulardır. İncelenen şikayet mektupları direkt olarak kullanıcıdan geldiğinden dolayı çok fazla yazım yanlışı içermektedir. Bu yazım yanlışlarını düzeltmek için metin verileri üzerinde normalizasyon işlemi uygulanmıştır. Daha sonra veriler üzerinde biçimbilimsel analiz uygulanarak külliyat içerisinde bulunan kelimeler yalın hale getirilmiştir. Ayrıca en sık tekrar eden kelime gruplarına bakılarak etkisiz kelimeler listesi oluşturulmuş ve etkisiz kelime olarak görülen sözcükler temizlenmiştir. Son olarak ön işleme adımında veri kümesinde tekrar eden sınıflar K-Means algoritması ile sadeleştirilmiştir. Bu sayede daha dengeli ve mantıklı bir veri kümesi oluşturulmuştur. Gelen şikayet mektupları ön işlemeden önce ve sonra Naïve Bayes, SVM, Random Forest, Logistic Regression ve LSTM ile eğitilmiştir. Ön işleme öncesi ve sonrası algoritmaların performansları kıyaslanmıştır. Sonuç olarak, doğru tahmin etme açısından en verimli çalışan algoritmanın LSTM olduğu görülmüştür. Ayrıca kurumların geliştirilen modelden faydalanması ve verilerin arttırılması amacı ile SaaS modeli geliştirilmiştir.
Author
Ahmed Enis Erkaya
Institution
How to Cite
Ahmed Enis Erkaya (Yüksek Lisans Tezi). Makine öğrenmesi kullanarak kurumsal verilere dayalı metin sınıflandırma, 2019, Ankara Yıldırım Beyazıt University.
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Ankara Yıldırım Beyazıt University
- Akran zorbalığı ile ergenlerin algıladıkları aile işlevselliğinin incelenmesi(2019)
- Musul sâlnâmelerine göre şehir hayatı (1308-1330/1891-1912)(2025)
- Yemen'de e-devlet gelişiminin önündeki engeller(2022)
- Çocuk acile başvuran epilepsi tanılı hastaların özellikleri(2022)
- Twitter gündem ağları: Twitter Türkiye gündemlerinin ağ toplumu kavramı üzerinden incelenmesi(2022)
- Arap Baharının MENA bölgesindeki çatışmalar üzerindeki etkisi: Sayım veri analizinden bulgular(2022)