Türkçe metinler üzerinde doğal dil işleme teknikleriyle soru-cevap sistemi geliştirilmesi
Bu tez size mi ait?
Bu kayıt toplu arşivden geldi. Sizinse profilinize bağlayın.
Özet (TR)
Soru-cevap sistemleri, kullanıcıların doğal dilde ifade ettikleri sorulara hızlı ve doğru yanıtlar vererek bilgiye erişim süreçlerini kolaylaştırmaktadır. Günümüzde doğal dil işleme tekniklerindeki gelişmeler, bu tür sistemlerin etkinliğini artırmakta ve kullanıcı deneyimini iyileştirmektedir. Bununla birlikte, bu sistemlerin etkili bir şekilde çalışabilmesi için dilin yapısal özelliklerinin doğru bir şekilde anlaşılması gerekmektedir. Geleneksel kural tabanlı ve bilgi getirme tabanlı sistemler, soruların ve metinlerin bağlamsal anlamını yeterince derinlemesine analiz edememekte ve bu nedenle karmaşık sorulara tatmin edici yanıtlar üretememektedir. Bu nedenle dilin bağlamsal ve anlam bütünlüğünü daha iyi yakalayabilen Transformer tabanlı modeller geliştirilmiştir. Bu tez çalışmasında, Türkçe için yüksek performanslı bir soru-cevap sistemi geliştirmek amacıyla, Transformer tabanlı BERTurk, ELECTRA ve DistilBERTurk gibi ön eğitimli dil modelleri kullanılmıştır. Literatürde İngilizce olmak üzere birçok doğal dile özgü çalışmalar yapıldığı ancak Türkçe için yapılan çalışmaların sayısının sınırlı olduğu görülmüştür. Bu nedenle, çalışmanın hedef dili olarak Türkçe tercih edilmiştir. Deneylerin gerçekleştirilmesinde Türk & İslam Bilim Tarihi konulu TQuAD (Turkish Question Answering Dataset), Türk & İslam Bilim Tarihi ve Osmanlı Tarihi konulu THQuAD (Turkish Historic Question Answering Dataset), biyoloji dersindeki konulardan oluşan BQuAD( Biology Question Answering Dataset) kullanılmıştır. Her bir veri seti için aynı hiper parametrelerde deneyler gerçekleştirilmiş ve sonuçlar tam eşleşme ve F1 skor performans metrikleriyle karşılaştırılmıştır. Deneyler sonucunda, büyük-küçük harf duyarlılığına sahip modellerin daha yüksek tam eşleşme ve F1 skorları elde ettiği gözlemlenmiştir. Bunlara ek olarak THQuAD ile BQuAD birleştirilerek daha geniş kapsamlı bir veri seti oluşturulmuş ve bu veri seti üzerinde çeşitli hiper parametreler ile gerçekleştirilen deneyler sonucunda 63.99 tam eşleşme ve 80.84 F1 skor ile en iyi başarım BERTurk(Kasalı, 128k) modelinde elde edilmiştir. Soru-cevap uygulamasının tasarlanmasında ince ayar gerçekleştirilen bu model kullanılmıştır. Bu tez çalışmasıyla birlikte Türkçe doğal dil işleme çalışmalarına katkı sağlamak amacıyla 1 adet soru-cevap modeli oluşturulmuş ve kullanıma açık olarak paylaşılmıştır.
Yazar
Mehmet Arzu
Kurum
Bu Yayına Nasıl Atıf Yapılır
Mehmet Arzu (Yüksek Lisans Tezi). Türkçe metinler üzerinde doğal dil işleme teknikleriyle soru-cevap sistemi geliştirilmesi, 2024, Fırat University.
Anahtar Kelimeler
Lisans
Tüm Hakları Saklıdır
Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.
Fırat University tezlerinden daha fazlası
- Bütünleşik pazarlama iletişimi aracı olarak sosyal medyanın kullanılması(2018)
- Hollanda Doğu Hindistan Şirketi'nin doğuşu ve XVII. yüzyıl Endonezyası'nda yükselişi(2013)
- Fuzûlî'nin Türkçe Divân'ında renklerin kullanımı(2013)
- 317 Numaralı Midyat Şer'iyye Sicili'nin transkripsiyonu ve değerlendirilmesi (Hicri 1328-1334 / Miladi 1910-1916)(2018)
- Doğu Anadolu fay zonu'nun Doğanyol (Malatya) ile Çelikhan (Adıyaman) arasındaki gerilme durumunun incelenmesi(2020)
- Yavuzeli (Gaziantep) çevresinde yüzeyleyen volkanik kayaçların petrografik ve jeokimyasal özellikleri(2014)