Veri madenciliği sınıflandırma yöntemlerinin veri bilimi anketi veri seti ile karşılaştırmalı analizi
2021
0 görüntülenme
0 i̇ndirme
Danışman: Dr. Öğr. Üyesi Arafat Şentürk
Özet (TR)
Veri Madenciliği teknolojisi günden güne popülerliğini artıran bir teknoloji olmaktadır. Popülerliğinin artmasının en büyük sebeplerinden biri de çalışma alanı sınırının bulunmamasıdır. Teknik altyapı olarak bilişim sektörüne ait olan Veri Madenciliği teknolojisi, birçok sektöre kolaylık ve avantaj sağlamak için hizmet sunmaktadır. Çalışma kapsamında Veri Madenciliği teknolojisinde tercih edilen yazılım dili, kullanılan algoritma vb. kriterlerinin girdi olarak kabul edildiği, veri bilimcilerin tercih ettikleri bu teknik bilgilerden çıkarımla hangi sektörde çalıştıklarına dair çıktı bilgilerinin yer aldığı "Veri Bilimi Anketi" isimli veri seti kullanılmaktadır. Veri setinin Sınıflandırma Algoritmalarından C4.5 Algoritması, Rastgele Orman Algoritması ve K- En Yakın Komşu Algoritması ile modellenmesi sonucu başarı oranları değerlendirmelerine değinilmiştir. Modellerin başarı oranı kıyaslamaları gerçekleştirilirken, Sınıflandırma yöntemine ait olan algoritmalar hem orijinal hem de işlenmiş veri setini kullanmışlardır. Veri setleri bazında model başarı oranları değerlendirildiğinde, orijinal veri seti kullanılarak oluşturulan modellerin başarı oranları, veri ön işleme aşaması sonrasında oluşturulan işlenmiş veri seti kullanılarak da modellendiğinde başarı oranlarında %14-15 oranında artış olmaktadır. İşlenmiş veri seti, seçili sınıflandırma algoritmaları (C4.5, Rastgele Orman ve KNN) ve bu algoritmaların varsayılan algoritmik nitelikleri ile modellendiğinde elde edilen başarı oranları algoritmalar bazında kıyaslandığında sapma oranı çok düşük olmaktadır. Algoritmaların başarı oranları ön işleme öncesi kullanılan orijinal veri seti ve ön işleme sonrasında kullanılan işlenmiş veri seti ile algoritma bazında değerlendirildiğinde ise sapma değeri daha belirgin olmaktadır. Ayrıca KNN algoritmasına özgü olan "k" nitelik değerinin farklı değerler alması sonucu veya Eğitim-Test veri seti bölümleme seçenekleri gibi model başarı oranında sapma yaratacak durumlar için de başarı oranı değerleri gözlemlenmiştir. Ancak bahsedilen durumların model başarısına etkisi, ön işleme aşamasının model başarısına olan etkisi kadar belirgin değildir. Gerçekleştirilmiş olan bu kıyaslamalardan çıkarımla, başarılı modeller oluşturulabilmesi için Veri Madenciliği aşamalarının önem/etki seviyeleri değerlendirilmiş olup, Veri Madenciliği aşamaları "döngüsellik" ve "öznellik" kavramlarından faydalanılarak yorumlanmışlardır.
Yazar
Elvan Kübra Doğan
Bu Yayına Nasıl Atıf Yapılır
Elvan Kübra Doğan (Yüksek Lisans Tezi). Veri madenciliği sınıflandırma yöntemlerinin veri bilimi anketi veri seti ile karşılaştırmalı analizi, 2021, Düzce University.
Anahtar Kelimeler
Lisans
Tüm Hakları Saklıdır
Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.
Düzce University tezlerinden daha fazlası
- Cem Akaş'ın romanları üzerine bir inceleme(2021)
- Genelleştirilmiş kesirli integraller için yeni orta nokta tipli eşitsizlikler(2021)
- Mostarlı Hasan Ziyâ'î Divânı'nda maddi kültür(2021)
- Ebü'l-Hasen Alî b. Ahmed b. Muhammed en-Nîsâbûrî el-Vâhidî'nin hayatı ve "el-Vecîz fi Tefsîri'l-Kitab'il-'Azîz" isimli tefsirinin metodu(2021)
- Alev Alatlı'nın romanlarında metinlerarasılık(2022)
- Kara mizah üzerine görsel yorumlar(2022)
