Master'sOpen Access

Tviter verileri üzerinde sınıflandırma algoritmaları kullanarak hisse senedi değerleri için yön tahmini

2019
0 views
0 downloads
Advisor: Doç. Dr. Barış Koçer

Abstract (TR)

Borsa, gerek hisselerin kolay alınıp satılması, gerek sağladığı gelir ve gerekse verilere kolay erişim bakımından sağladığı avantajlarla her zaman yatırımcıların gözde yatırım aracı olagelmiştir. Yatırımcılar da bu platformda daha fazla gelir elde edebilmek adına, hisse senetlerinin ileriye dönük yön tahmini ile sürekli ilgilenmişlerdir. Bunun için de çok farklı teknikler geliştirilmiştir. Biz de bu çalışmamızda, hisse senetlerinin fiyatlandırılmasında asıl kriter olarak düşündüğümüz "arz-talep" ilişkisinden yola çıkarak, hisseye olan talebin artması veya azalmasının önceden tahminini yapmak için, günümüzde en fazla kullanılan sosyal medya paylaşım platformlarından biri olan Twitter mesajlarının sınıflamasını yaptık. Araştırmamızda, Amerikan Dow Jones (DJIA) borsasında işlem gören Apple, Facebook, General Electric, General Motors, The Coca-Cola Company, McDonald's, Microsoft, Netflix, Pfizer Corporation, Tesla Motors gibi dünya çapında firmaların hisse senetleri için atılan tivitleri analiz ettik. Sınıflandırma işlemini, naive bayes, rastgele orman, destek vektör makinesi, karar ağacı, k-en yakın komşu ve yapay sinir ağları sınıflandırma algoritmalarını kullanarak gerçekleştirdik ve bu algoritmaların başarım sonuçlarını karşılaştırdık. İlgili hisse senetleri için Nisan 2019 – Mayıs 2019 tarihlerini kapsayacak şekilde iki aylık veri, twitter web arayüzü kullanılarak elde edildi. Benzer şekilde yön tahmini başarı seviyesinde test amacı ile kullanılan hisse senedi değerlerini içeren dosyalar da yine www.eoddata.com web adresi üzerinden elde edildi. Tivitleri etiketleme işlemi, borsa bilgileri birbirinden farklı, 75 farklı katılımcının tivitleri tek tek okuyup eli ile pozitif, negatif veya nötr olarak işaretlemesi ile yapıldı. Herhangi bir duygu belirtmeyen tivitlerin yanı sıra, anlaşılmayan, reklamdan ibaret olan, sadece bir link verilmiş olan v.b. tivitlerin tamamı nötr sınıfına dahil edildi. Algoritmaların sınıflandırma başarılarının ölçülmesinde değil ancak hisse senedinin yön tahmininin başarısı hesaplanırken, çok fazla çöp tivit içerdiği için nötr sınıfı göz ardı edilidi. Sınıflandırma için öncelikle tivitleri, noktalama işareleri, hyperlinkler ve web adresleri, "tab" karakteri, hashtaglar, retweetler, birbiri ile aynı olan tekrarlanmış tivitler v.b. fazlalıkları silerek temizledik. Temizlenen bu veri seti üzerinde sınıflandırma için, makine öğrenmesi teknikleri kullanılarak sınıflandırma yaptık. TF-IDF yöntemi kullanılarak her bir veri setinde her bir tivit için geçen tüm kelimelerin frekans ağırlıklarını hesaplayarak vektör haline dönüştürüp sayısallaştırdık. Sayısallaştırdığımız bu veriler üzerinde 6 farklı sınıflandırma algoritması kullanılarak başarım sonuçlarını elde ettik. Tivitlerin sınıfını tahmin etmek için yaptığımız sınıflandırma işlemi için belirlediğimiz algoritmaları kullanırken, homojenliği sağlamak için corss validation yöntemi ile veri setlerini 10 parçaya ayırdık. Bu parçalardan her birisini sıra ile doğrulama maksadı için kullandık, diğer parçaları ise sistemin eğitimde kullandık. En sonunda da tüm parçalar bittiği zaman, 10 parçanın ortalamasını alınarak genel tahmin başarısını elde ettik. Araştırma sonunda sınıflandırma işlemini gerçekleştirdiğimiz veri seti üzerinde %77,37 ile en başarılı sonucu rastgele orman algoritması verirken, %61,41 ile en kötü sonucu destek vektör makinesi verdi. Yine sınıflarını tahmin etmeye çalıştığımız hisse senetleri tivitleri için en iyi tahmin başarısı %83,3 ile GM'a ait iken en kötü tahmin başarısı ise %62,15 ile GE'ye ait olarak bulundu. Hisse senetlerinin yön tahmin başarı sonuçlarının değerlendirilmesinde ise en başarılı tahmin %96,5 ile KO için yapılırken, en kötü tahmin ise %66,7 ile TSLA için yapılmıştır. Bu tahmin başarılarının hesaplanmasında nötr tivitler göz ardı edilerek sadece pozitif ve negatif etiketli tivitler dikkate alınmıştır. Pozitif olarak işaretlenmiş olan bir tivit, ertesi gün hisse senedi negatif yönlü bir hareket yapmadıkça başarılı bir tahmin yapmış olarak alınmıştır, aynı şekilde negatif olarak işaretlenmiş olan bir tivit, ertesi gün ilgili hisse senedi yükselmemişse başarılı olarak alınmıştır. Elde edilen bulgular sonucu hisse senetlerinin yön tahminlerinin yapılmasında twitter verilerinin kullanılabileceği, gayet başarılı sonuçlar elde edilebileceği görülmüştür.

Author

Dr. Mustafa Vehbi Türkalp

How to Cite

Mustafa Vehbi Türkalp (Yüksek Lisans Tezi). Tviter verileri üzerinde sınıflandırma algoritmaları kullanarak hisse senedi değerleri için yön tahmini, 2019, Konya Technical University.

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Konya Technical University