Transformer tabanlı modellerle Türkçe tweetlerdeki argo dilin tespiti
2025
0 views
0 downloads
Advisor: Dr. Öğr. Üyesi Sinem Akyol
Abstract (TR)
Günümüzde dijital iletişimin en önemli kanallarından biri hâline gelen sosyal medya platformları, bireylerin düşüncelerini özgürce ifade edebildiği alanlar sunarken, aynı zamanda çeşitli sorunlu içeriklerin de hızla yayılmasına zemin hazırlamaktadır. Özellikle argo, küfür ve hakaret içeren söylemler, çevrim içi etkileşimlerde hem bireysel hem de toplumsal düzeyde olumsuz sonuçlar doğurmakta; nefret söyleminin, siber zorbalığın ve dijital şiddetin yaygınlaşmasına katkı sağlamaktadır. Bu çerçevede, sosyal medya ortamlarında kullanılan dilin otomatik olarak analiz edilmesi, zararlı içeriklerin tespit edilmesi ve gerektiğinde filtrelenmesi büyük bir ihtiyaç hâline gelmiştir. Bu bağlamda, yapay zekâ temelli doğal dil işleme yaklaşımları, sosyal medya metinleri gibi yapısı düzensiz, kısaltmalar ve deyimlerle zenginleştirilmiş veri kaynaklarında etkili bir çözüm sunmaktadır. Bu tez çalışmasında, Türkçe sosyal medya içeriklerinde yer alan hakaret ifadelerinin otomatik olarak tespit edilmesi hedeflenmiş ve bu kapsamda beş farklı transformer mimarisi kullanılarak kapsamlı bir karşılaştırmalı analiz gerçekleştirilmiştir. Değerlendirilen modeller arasında BERTurk, DeBERTa, RoBERTa, XLM-R ve ELECTRA yer almaktadır. Tezin temel araştırma hipotezi, bu modellerin aynı Türkçe veri kümesi üzerinde belirli sabit koşullar altında (aynı eğitim parametreleri, aynı epoch sayısı, aynı ön işleme adımları) eğitilmesi durumunda doğruluk (accuracy), eğitim süresi ve kayıp (loss) gibi metrikler üzerinden karşılaştırılarak en iyi performans gösteren modelin belirlenebileceği yönündedir. Bu amaç doğrultusunda kullanılan veri kümesi, Twitter'dan toplanmış ve manuel olarak etiketlenmiş toplam 13.000 Türkçe tweetten oluşmaktadır. Etiketleme sürecinde tweetler iki sınıfa ayrılmış; "pozitif" olarak sınıflandırılan örnekler hakaret içermeyen, "negatif" olanlar ise hakaret içeren ifadeleri temsil etmektedir. Çalışma kapsamında tüm modeller, 35 epoch boyunca aynı koşullarda eğitilmiştir. Model performansları; doğruluk oranı, eğitim süresi ve kayıp değeri gibi ölçütler üzerinden kıyaslanmıştır. Elde edilen bulgulara göre, BERT modeli %89,61 doğruluk oranı ile en yüksek başarıyı göstermiştir. BERTurk'ü sırasıyla XLM-R, ELECTRA, RoBERTa ve DeBERTa modelleri takip etmiştir. Bu sonuçlar, klasik derin öğrenme modellerinin ötesine geçen transformer mimarilerinin, Türkçe gibi eklemeli morfolojiye sahip dillerde dahi başarılı sonuçlar elde edebileceğini göstermektedir. Ayrıca, hakaret ve küfür gibi sosyal medyada sıklıkla karşılaşılan içeriklerin otomatik olarak tespit edilebilmesi adına transformer tabanlı yaklaşımların önemli bir potansiyel taşıdığı ortaya konmuştur. Elde edilen sonuçlar, Türkçe sosyal medya verilerinde argo ve saldırgan söylemlerin tespiti için geliştirilecek içerik filtreleme sistemlerine katkı sağlayabilecek niteliktedir.
Author
Zeynep Şebnem Üzmez
How to Cite
Zeynep Şebnem Üzmez (Yüksek Lisans Tezi). Transformer tabanlı modellerle Türkçe tweetlerdeki argo dilin tespiti, 2025, Fırat University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Fırat University
- Bütünleşik pazarlama iletişimi aracı olarak sosyal medyanın kullanılması(2018)
- Hollanda Doğu Hindistan Şirketi'nin doğuşu ve XVII. yüzyıl Endonezyası'nda yükselişi(2013)
- Doğu Anadolu fay zonu'nun Doğanyol (Malatya) ile Çelikhan (Adıyaman) arasındaki gerilme durumunun incelenmesi(2020)
- Fuzûlî'nin Türkçe Divân'ında renklerin kullanımı(2013)
- Yavuzeli (Gaziantep) çevresinde yüzeyleyen volkanik kayaçların petrografik ve jeokimyasal özellikleri(2014)
- Hizbu't-Tahrir ve Ercümend Özkan'ın siyasi ve dini görüşleri(2008)