Yüksek LisansAçık Erişim

Çok modlu (Metin + Görsel) veri ile rag destekli bilgi tabanlı soru-cevap sistemi

2025
0 görüntülenme
0 i̇ndirme
Danışman: Dr. Öğr. Üyesi Volkan Altıntaş

Özet (TR)

Geleneksel sistemlerin ve Büyük Dil Modellerinin (LLM) çok modlu verilerle (metin, tablolar, şekiller) ve gizlilik gerektiren karmaşık PDF belgeleriyle başa çıkmadaki yetersizliğini gidermek amacıyla, bu tez, mevcut çevrimiçi bağımlılıkları aşan, kapsamlı ve enerji verimli bir çevrimdışı RAG (Retrieval-Augmented Generation) çerçevesi sunmaktadır. Çalışmanın teknik ayırt edici özelliği, görsel (Image) verileri ayrı yapılar aracılığıyla işleyen çevrimdışı çift kanallı çok modlu mimarisinde yatmaktadır. Bu yaklaşım, Büyük Dil Modellerini (LLM'ler) harici bir API'ye ihtiyaç duymadan doğrudan cihaz üzerinde yerel olarak barındırarak (Edge AI) kapalı ve güvenilir bir çözüm sunmaktadır; geliştirilen bu Hibrit Sistem, temel VLM modellerinin (LLaVA ve VILA'nın yaklaşık 0.72-0.73 doğruluğu) performansını önemli ölçüde aşarak gerçek dünya testlerinde ortalama 0.8827'lik bir başarı (CheckAvail puanı) elde etmiş ve böylece çevrimiçi çalışan, yüksek performanslı XSum mimarisine (0.97 puan) karşı rekabetçi bir alternatif olduğunu kanıtlamıştır. XSum puanının metin odaklı metriklerle tutarlı olduğu görülmüştür. Özellikle kanıt yakalama başarısında (true0) diğer hibrit modellerle benzer başarı gösteren Hibrit Puan Modeli, ne yazık ki alakasız kanıtları hariç tutma (true1) metriklerinde en düşük değere (0.69) sahiptir; bu durum, modelin özgüllükten yoksun olduğunu ve yanlış pozitiflere (FP) eğilimli olduğunu göstermektedir. Yapılan detaylı analizler, true1 metriğindeki bu düşük performansın esas olarak görsel (Image) kanalından gelen kanıtların değerlendirilmesinden kaynaklandığını; metin (Text) kanalının ise tatmin edici sonuçlar ürettiğini ortaya koymuştur. Yapılan ek analizlerde, bu yanlış pozitiflerin çevrimdışı bir görsel LLM (Vision LLM) ile doğrulamasının yapılması sonucunda elendiği gözlemlenmiştir. İleride daha iyi bir çözüm bulunması için çalışmalar sürmektedir. Bu nedenle, gelecek çalışmalar, özellikle görsel kanaldaki bu sorunun üstesinden gelmek için modelin özgüllüğünü artıracak yeni nesil filtreleme mekanizmalarına, kaynak kısıtlı LLM'ler için mimari optimizasyonlara ve farklı PDF yapılarına uyum sağlayabilen sağlam görüntü/görsel çıkarma fonksiyonları geliştirmeye odaklanacaktır.

Yazar

Dr. Onur Yazıcı

Bu Yayına Nasıl Atıf Yapılır

Onur Yazıcı (Yüksek Lisans Tezi). Çok modlu (Metin + Görsel) veri ile rag destekli bilgi tabanlı soru-cevap sistemi, 2025, Manisa Celal Bayar University.

Anahtar Kelimeler

Lisans

Tüm Hakları Saklıdır

Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.

Manisa Celal Bayar University tezlerinden daha fazlası