DoctorateOpen Access

Ensurıng academıc ıntegrıty: transformer-based and ensemble machıne learnıng approaches for dıfferentıatıng human-wrıtten and aı-generated text

2025
0 views
0 downloads
Advisor: Doç. Dr. Oğuz Ata

Abstract (TR)

ChatGPT ve Bard gibi büyük dil modellerinin (LLM) patlayıcı gelişimi, metin oluşturmayı dönüştürerek akademik iletişim için yeni olanaklar sunmuş ve özgünlük ve yazarlık konusunda derin endişeler doğurmuştur. Yapay zeka tarafından oluşturulan içerik neredeyse insan yazısından ayırt edilemez hale geldiğinden, yazarlığı doğrulamak için açık ve güvenilir mekanizmalara duyulan ihtiyaç, akademik güveni sürdürmede hayati önem kazanmıştır. Bu çalışma, birbirini tamamlayan iki Doğal Dil İşleme (NLP) çerçevesini, Transformer Tabanlı Algılama Çerçevesi ve Topluluk Öğrenme Tabanlı Algılama Çerçevesini sunmakta ve bunları üç eşit dengeli veri kümesi üzerinde karşılaştırmaktadır: AI-GA, HWAI ve HAGT-1M. İlki, derin anlamsal ve sözdizimsel eğilimleri tespit etmek için Cümle-BERT (SBERT) ve RoBERTa gömülü vektörlerini Lojistik Regresyon (LR) ve İleri Beslemeli Sinir Ağları (FNN) ile birlikte kullanmaktadır. Veri kümeleri genelinde, transformatör konfigürasyonları güçlü performans sergiledi: SBERT+LR: %93,66 (AI-GA), %91,37 (HWAI), %99,64 (HAGT-1M); RoBERTa+FNN: %91,13 (AI-GA), %90,29 (HWAI), %99,95 (HAGT-1M), RoBERTa-FNN ise HAGT-1M'de %99,95'e ulaştı. Şeffaflığı sağlamak ve transformatörlerin "kara kutu" sınırlamasının üstesinden gelmek için, ikinci yöntem, TF-IDF ve dilsel özellik kümeleri (n-gramlar, sözcük çeşitliliği, cümle uzunluğu) üzerinde yumuşak oylama ile LR, SVM, Rastgele Orman, Son Derece Rastgele Ağaçlar, XGBoost, AdaBoost ve SGD'yi birleştirerek topluluk öğreniminden yararlanır. Bu topluluk, %99,88 (AI-GA), %99,37 (HWAI) ve %100 (HAGT-1M) başarı oranlarına ulaşarak önceki en iyi sonuçları geride bıraktı ve çeşitli akademik metinlerde artan sağlamlık sergiledi. Mevcut çalışma, özellikle anadili İngilizce olmayan araştırmacılar için hassasiyet ve adalet açısından tekrarlanabilir ön işleme, veri keşfi ve dikkatli eşik ayarlamasına odaklanmaktadır. Dilsel özgünlüğü, sözdizimi, anlambilim ve stilistik tutarlılıkta bulunan üç boyutlu bir özellik olarak modellemektedir. Üniversiteler, yayıncılar ve araştırma bütünlüğü ofisleri için uygun, açık, ölçeklenebilir ve şeffaf tespit protokolleri sunmaktadır. Gelecekteki araştırmalar, alanlar arası genelleme sağlamak için hibrit kuantum makine öğrenimi (HQML), daha ayrıntılı açıklanabilir yapay zeka araçları (örneğin, SHAP/LIME/dikkat görselleştirme) ve çok dilli genişletme konularını içerecektir.

Author

Dr. Layth Rafea Hazım Hazım

How to Cite

Layth Rafea Hazım Hazım (Doktora Tezi). Ensurıng academıc ıntegrıty: transformer-based and ensemble machıne learnıng approaches for dıfferentıatıng human-wrıtten and aı-generated text, 2025, Altınbaş University.

Keywords

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Altınbaş University