Kategorik ve kategorik olmayan verilerden oluşan veri setleri için K-ortalama tabanlı bir yaklaşım
2014
0 views
0 downloads
Advisor: Doç. Dr. Gökhan Silahtaroğlu
Abstract (TR)
Günümüzde ilerleyen teknoloji ve bilgiye erişebilirliğin artması ile birlikte kurum ve kuruluşlar bu bilgilerden faydalanarak üretim, satış ve kaynakların yönetilmesi gibi konularda daha doğru, düzgün ve yeni kararlar verebilmek için önemli bir yol olarak veri medenciliğinden yararlanmanın faydalı olabileceğini düşünmüşlerdir. Bununla birlikte veri madenciliğinde yeni yöntemler, algoritmalar, düşünceler gelişmiş ve veri madenciliği sektörlerin olmazsa olmazı haline gelmiştir. Veri madenciliğinin yapı taşlarını veri tabanları, istatistik, görselleştirme, karar verme mekanizması ve makine öğrenmesi alanları oluşturur. Hepimizin çok duyduğu fakat çok yakından bilmediği makine öğrenmesi veri madenciliğinde vazgeçilemeyecek bir unsurdur çünkü makine öğrenmesi verilen bir problemi elde olan verilere göre şekillenen, bilgisayar algoritmalarının hepsini kapsayan bir yöntemdir. Bu tez çalışmasında veri madenciliği bölümlerinde olan makine öğrenmesi içerisindeki K-Means algoritması ve Jaccard benzerlik ölçütünden yaralanarak daha farklı bir çözüm üretmektir. Veri tabanlarında elde ettiğimiz veriler her zaman tam ihtiyaca göre olan veriler olmayabilir. Bu verilerin içerinde gereksiz veriler, eksik veriler, uyumsuz veri ölçekleri, kategorik ve kategorik olmayan veriler mevcuttur. Burada gereksiz veriler veri tabanı içerisinden çıkartılabilir, eksik veriler yok sayılabilir ya da gereksiz veriler gibi veri tanımından çıkartılabilir, verilerin arasındaki ölçeklemeler normalize edilebilir ve sonuç olarak bu sorunlar kolayca düzeltilebilir fakat her zaman kategorik ve kategorik olmayan verilerin bulunduğu veri tabanlarında makine öğrenmesinin algoritmaları kullanıldığı zaman özellikle kümelemelerde sorunlar yaşanmaktadır. Bir algoritma kategorik verilerde başarılı sonuçlar verirken kategorik olmayan verilerde başarısız, bir diğeri de kategorik olamayan verilerde başarısız sonuç verirken kategorik verilerde başarılı sonuçlar vermektedir. Bunun anlamı normal şartlar altında kategorik veriler kategorik veriler ile kategorik olmayan veriler ise kategorik olmayan veriler ile kümelenebilmektedir. Fakat bu iki tip veriler birlikte kümelenebilmelidirler. Bu hipotezde kategorik ve kategorik olmayan karışık veri kümeleri alınarak, ne oranda anlamlı, mantıklı ve doğru bir sonuç kümesi oluşturulabileceğine yönelik bir çalışma ele alınmıştır. Tezin içeriğinde de kategorik olmayan veri kümeleri için K-Means algoritması, kategorik veri kümeleri içinse Jaccard benzerlik ölçütünden yararlanılmış ve iki kümeleme yöntemi birleştirilip örnek veri setleri kullanılarak yepyeni anlamlı bir sonuç kümesi, kümeleme yöntemi oluşturulması anlatılmaya çalışılmıştır. Anahtar Kelimeler : K-Means, Jaccard Benzerlik Ölçütü, Kategorik Veri, Kategorik Olmayan Veri
Author
Dr. Mustafa Demirkan
How to Cite
Mustafa Demirkan (Yüksek Lisans Tezi). Kategorik ve kategorik olmayan verilerden oluşan veri setleri için K-ortalama tabanlı bir yaklaşım, 2014, İstanbul Beykent Üniversity.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from İstanbul Beykent Üniversity
- İpoteğin paraya çevrilmesi(2023)
- İç ve dış tehditler kapsamında ulusal güvenlik politikası oluşumu: Türkiye örneği(2019)
- Hedonik ve faydacı tüketim eğilimi ile tüketicilerin algıladığı kıtlığın plansız satın alma davranışı üzerindeki etkileri(2023)
- Hizmet sektöründe hibrit çalışanların iş aile yaşam dengesi ve motivasyon düzeyi arasındaki ilişkinin incelenmesi(2023)
- Toksik liderliğin örgütsel itaat aracılığıyla üretkenlik karşıtı iş davranışı ve işten ayrılma niyeti üzerine etkileri(2023)
- Örgütsel iletişimin ve algılanan örgütsel desteğin örgütsel değişime direnç üzerindeki etkisi(2023)