Çok modlu (Metin + Görsel) veri ile rag destekli bilgi tabanlı soru-cevap sistemi
2025
0 views
0 downloads
Advisor: Dr. Öğr. Üyesi Volkan Altıntaş
Abstract (TR)
Geleneksel sistemlerin ve Büyük Dil Modellerinin (LLM) çok modlu verilerle (metin, tablolar, şekiller) ve gizlilik gerektiren karmaşık PDF belgeleriyle başa çıkmadaki yetersizliğini gidermek amacıyla, bu tez, mevcut çevrimiçi bağımlılıkları aşan, kapsamlı ve enerji verimli bir çevrimdışı RAG (Retrieval-Augmented Generation) çerçevesi sunmaktadır. Çalışmanın teknik ayırt edici özelliği, görsel (Image) verileri ayrı yapılar aracılığıyla işleyen çevrimdışı çift kanallı çok modlu mimarisinde yatmaktadır. Bu yaklaşım, Büyük Dil Modellerini (LLM'ler) harici bir API'ye ihtiyaç duymadan doğrudan cihaz üzerinde yerel olarak barındırarak (Edge AI) kapalı ve güvenilir bir çözüm sunmaktadır; geliştirilen bu Hibrit Sistem, temel VLM modellerinin (LLaVA ve VILA'nın yaklaşık 0.72-0.73 doğruluğu) performansını önemli ölçüde aşarak gerçek dünya testlerinde ortalama 0.8827'lik bir başarı (CheckAvail puanı) elde etmiş ve böylece çevrimiçi çalışan, yüksek performanslı XSum mimarisine (0.97 puan) karşı rekabetçi bir alternatif olduğunu kanıtlamıştır. XSum puanının metin odaklı metriklerle tutarlı olduğu görülmüştür. Özellikle kanıt yakalama başarısında (true0) diğer hibrit modellerle benzer başarı gösteren Hibrit Puan Modeli, ne yazık ki alakasız kanıtları hariç tutma (true1) metriklerinde en düşük değere (0.69) sahiptir; bu durum, modelin özgüllükten yoksun olduğunu ve yanlış pozitiflere (FP) eğilimli olduğunu göstermektedir. Yapılan detaylı analizler, true1 metriğindeki bu düşük performansın esas olarak görsel (Image) kanalından gelen kanıtların değerlendirilmesinden kaynaklandığını; metin (Text) kanalının ise tatmin edici sonuçlar ürettiğini ortaya koymuştur. Yapılan ek analizlerde, bu yanlış pozitiflerin çevrimdışı bir görsel LLM (Vision LLM) ile doğrulamasının yapılması sonucunda elendiği gözlemlenmiştir. İleride daha iyi bir çözüm bulunması için çalışmalar sürmektedir. Bu nedenle, gelecek çalışmalar, özellikle görsel kanaldaki bu sorunun üstesinden gelmek için modelin özgüllüğünü artıracak yeni nesil filtreleme mekanizmalarına, kaynak kısıtlı LLM'ler için mimari optimizasyonlara ve farklı PDF yapılarına uyum sağlayabilen sağlam görüntü/görsel çıkarma fonksiyonları geliştirmeye odaklanacaktır.
Author
Dr. Onur Yazıcı
Institution
How to Cite
Onur Yazıcı (Yüksek Lisans Tezi). Çok modlu (Metin + Görsel) veri ile rag destekli bilgi tabanlı soru-cevap sistemi, 2025, Manisa Celal Bayar University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Manisa Celal Bayar University
- Türkiye'de sürdürülebilir büyüme kaynakları açısından orta gelir tuzağı sorunu(2023)
- Yeşil lojistik kapsamında çevre etkinlik VZA yöntemleri ile AB ülkeleri ve Türkiye'nin lojistik-çevre etkileşimli performanslarının değerlendirilmesi(2023)
- Çerkes kültüründe gündelik hayat ve kadın(2023)
- Kurumsal sürdürülebilirlik anlayışı ve uygulamaları: Türkiye'nin en değerli markalarının sürdürülebilirlik raporlarının incelenmesi(2023)
- Çizgelerde eş bütünlük değerinin incelenmesi(2023)
- Yenilenebilir enerji, ekonomik büyüme ve rüzgar enerjisine ilişkin bir inceleme: Seçilmiş OECD ülkeleri örneği(2023)
