Çok modlu (Metin + Görsel) veri ile rag destekli bilgi tabanlı soru-cevap sistemi
2025
0 görüntülenme
0 i̇ndirme
Danışman: Dr. Öğr. Üyesi Volkan Altıntaş
Özet (TR)
Geleneksel sistemlerin ve Büyük Dil Modellerinin (LLM) çok modlu verilerle (metin, tablolar, şekiller) ve gizlilik gerektiren karmaşık PDF belgeleriyle başa çıkmadaki yetersizliğini gidermek amacıyla, bu tez, mevcut çevrimiçi bağımlılıkları aşan, kapsamlı ve enerji verimli bir çevrimdışı RAG (Retrieval-Augmented Generation) çerçevesi sunmaktadır. Çalışmanın teknik ayırt edici özelliği, görsel (Image) verileri ayrı yapılar aracılığıyla işleyen çevrimdışı çift kanallı çok modlu mimarisinde yatmaktadır. Bu yaklaşım, Büyük Dil Modellerini (LLM'ler) harici bir API'ye ihtiyaç duymadan doğrudan cihaz üzerinde yerel olarak barındırarak (Edge AI) kapalı ve güvenilir bir çözüm sunmaktadır; geliştirilen bu Hibrit Sistem, temel VLM modellerinin (LLaVA ve VILA'nın yaklaşık 0.72-0.73 doğruluğu) performansını önemli ölçüde aşarak gerçek dünya testlerinde ortalama 0.8827'lik bir başarı (CheckAvail puanı) elde etmiş ve böylece çevrimiçi çalışan, yüksek performanslı XSum mimarisine (0.97 puan) karşı rekabetçi bir alternatif olduğunu kanıtlamıştır. XSum puanının metin odaklı metriklerle tutarlı olduğu görülmüştür. Özellikle kanıt yakalama başarısında (true0) diğer hibrit modellerle benzer başarı gösteren Hibrit Puan Modeli, ne yazık ki alakasız kanıtları hariç tutma (true1) metriklerinde en düşük değere (0.69) sahiptir; bu durum, modelin özgüllükten yoksun olduğunu ve yanlış pozitiflere (FP) eğilimli olduğunu göstermektedir. Yapılan detaylı analizler, true1 metriğindeki bu düşük performansın esas olarak görsel (Image) kanalından gelen kanıtların değerlendirilmesinden kaynaklandığını; metin (Text) kanalının ise tatmin edici sonuçlar ürettiğini ortaya koymuştur. Yapılan ek analizlerde, bu yanlış pozitiflerin çevrimdışı bir görsel LLM (Vision LLM) ile doğrulamasının yapılması sonucunda elendiği gözlemlenmiştir. İleride daha iyi bir çözüm bulunması için çalışmalar sürmektedir. Bu nedenle, gelecek çalışmalar, özellikle görsel kanaldaki bu sorunun üstesinden gelmek için modelin özgüllüğünü artıracak yeni nesil filtreleme mekanizmalarına, kaynak kısıtlı LLM'ler için mimari optimizasyonlara ve farklı PDF yapılarına uyum sağlayabilen sağlam görüntü/görsel çıkarma fonksiyonları geliştirmeye odaklanacaktır.
Yazar
Dr. Onur Yazıcı
Bu Yayına Nasıl Atıf Yapılır
Onur Yazıcı (Yüksek Lisans Tezi). Çok modlu (Metin + Görsel) veri ile rag destekli bilgi tabanlı soru-cevap sistemi, 2025, Manisa Celal Bayar University.
Anahtar Kelimeler
Lisans
Tüm Hakları Saklıdır
Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.
Manisa Celal Bayar University tezlerinden daha fazlası
- Kurumsal sürdürülebilirlik anlayışı ve uygulamaları: Türkiye'nin en değerli markalarının sürdürülebilirlik raporlarının incelenmesi(2023)
- Çizgelerde eş bütünlük değerinin incelenmesi(2023)
- Yenilenebilir enerji, ekonomik büyüme ve rüzgar enerjisine ilişkin bir inceleme: Seçilmiş OECD ülkeleri örneği(2023)
- Kavşak tasarımında trafik simülasyonu uygulamaları: Bursa ili gürsu kavşağı örneği(2023)
- Üniversite öğrencilerinde anomi: MCBÜ örneği(2023)
- H. 1326-1329/ M. 1908-1911 tarihli 419 numaralı Manisa Şer'iyye Sicili transkripsiyonu ve değerlendirilmesi(2023)
