Makine öğrenmesi kullanarak kurumsal verilere dayalı metin sınıflandırma
Bu tez size mi ait?
Bu kayıt toplu arşivden geldi. Sizinse profilinize bağlayın.
Özet (TR)
Çevrim içi platformların kullanımının yaygınlaşması ile birlikte metin verilerinin artması ve bu verilere erişimin kolaylaşması metin sınıflandırma alanında yapılan çalışmaların sayısının çoğalmasına vesile olmuştur. İstenmeyen e-postaların tespiti ve duygu analizi gibi birçok alanda metin sınıflandırma tekniklerinin büyük katkısı bulunmaktadır. Bu tez kapsamında, Türkçe metin sınıflandırma üzerinde çalışılmıştır. Metin sınıflandırma ile ilgili İngilizce birçok araştırma olmasına karşın, bu alanda Türkçe veriler üzerinde yapılan çalışmalar oldukça azdır. Bu çalışmada, bir organizasyona gelen şikayet mektupları eğitim verisi olarak kullanılmıştır. Şikayet mektupları ilgili konular ile etiketli bir şekildedir. Bu konular verilerin alındığı organizasyonun kendi iç süreçlerinde tanımladığı konulardır. İncelenen şikayet mektupları direkt olarak kullanıcıdan geldiğinden dolayı çok fazla yazım yanlışı içermektedir. Bu yazım yanlışlarını düzeltmek için metin verileri üzerinde normalizasyon işlemi uygulanmıştır. Daha sonra veriler üzerinde biçimbilimsel analiz uygulanarak külliyat içerisinde bulunan kelimeler yalın hale getirilmiştir. Ayrıca en sık tekrar eden kelime gruplarına bakılarak etkisiz kelimeler listesi oluşturulmuş ve etkisiz kelime olarak görülen sözcükler temizlenmiştir. Son olarak ön işleme adımında veri kümesinde tekrar eden sınıflar K-Means algoritması ile sadeleştirilmiştir. Bu sayede daha dengeli ve mantıklı bir veri kümesi oluşturulmuştur. Gelen şikayet mektupları ön işlemeden önce ve sonra Naïve Bayes, SVM, Random Forest, Logistic Regression ve LSTM ile eğitilmiştir. Ön işleme öncesi ve sonrası algoritmaların performansları kıyaslanmıştır. Sonuç olarak, doğru tahmin etme açısından en verimli çalışan algoritmanın LSTM olduğu görülmüştür. Ayrıca kurumların geliştirilen modelden faydalanması ve verilerin arttırılması amacı ile SaaS modeli geliştirilmiştir.
Yazar
Ahmed Enis Erkaya
Bu Yayına Nasıl Atıf Yapılır
Ahmed Enis Erkaya (Yüksek Lisans Tezi). Makine öğrenmesi kullanarak kurumsal verilere dayalı metin sınıflandırma, 2019, Ankara Yıldırım Beyazıt University.
Anahtar Kelimeler
Lisans
Tüm Hakları Saklıdır
Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.
Ankara Yıldırım Beyazıt University tezlerinden daha fazlası
- Akran zorbalığı ile ergenlerin algıladıkları aile işlevselliğinin incelenmesi(2019)
- Musul sâlnâmelerine göre şehir hayatı (1308-1330/1891-1912)(2025)
- Yemen'de e-devlet gelişiminin önündeki engeller(2022)
- Çocuk acile başvuran epilepsi tanılı hastaların özellikleri(2022)
- Twitter gündem ağları: Twitter Türkiye gündemlerinin ağ toplumu kavramı üzerinden incelenmesi(2022)
- Arap Baharının MENA bölgesindeki çatışmalar üzerindeki etkisi: Sayım veri analizinden bulgular(2022)