Rag supported knowledge-based question-answer system with multimodal (text + visual) data
Çok modlu (Metin + Görsel) veri ile rag destekli bilgi tabanlı soru-cevap sistemi
- Tez No: 989126
- Danışmanlar: DR. ÖĞR. ÜYESİ VOLKAN ALTINTAŞ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Manisa Celal Bayar Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Geleneksel sistemlerin ve Büyük Dil Modellerinin (LLM) çok modlu verilerle (metin, tablolar, şekiller) ve gizlilik gerektiren karmaşık PDF belgeleriyle başa çıkmadaki yetersizliğini gidermek amacıyla, bu tez, mevcut çevrimiçi bağımlılıkları aşan, kapsamlı ve enerji verimli bir çevrimdışı RAG (Retrieval-Augmented Generation) çerçevesi sunmaktadır. Çalışmanın teknik ayırt edici özelliği, görsel (Image) verileri ayrı yapılar aracılığıyla işleyen çevrimdışı çift kanallı çok modlu mimarisinde yatmaktadır. Bu yaklaşım, Büyük Dil Modellerini (LLM'ler) harici bir API'ye ihtiyaç duymadan doğrudan cihaz üzerinde yerel olarak barındırarak (Edge AI) kapalı ve güvenilir bir çözüm sunmaktadır; geliştirilen bu Hibrit Sistem, temel VLM modellerinin (LLaVA ve VILA'nın yaklaşık 0.72-0.73 doğruluğu) performansını önemli ölçüde aşarak gerçek dünya testlerinde ortalama 0.8827'lik bir başarı (CheckAvail puanı) elde etmiş ve böylece çevrimiçi çalışan, yüksek performanslı XSum mimarisine (0.97 puan) karşı rekabetçi bir alternatif olduğunu kanıtlamıştır. XSum puanının metin odaklı metriklerle tutarlı olduğu görülmüştür. Özellikle kanıt yakalama başarısında (true0) diğer hibrit modellerle benzer başarı gösteren Hibrit Puan Modeli, ne yazık ki alakasız kanıtları hariç tutma (true1) metriklerinde en düşük değere (0.69) sahiptir; bu durum, modelin özgüllükten yoksun olduğunu ve yanlış pozitiflere (FP) eğilimli olduğunu göstermektedir. Yapılan detaylı analizler, true1 metriğindeki bu düşük performansın esas olarak görsel (Image) kanalından gelen kanıtların değerlendirilmesinden kaynaklandığını; metin (Text) kanalının ise tatmin edici sonuçlar ürettiğini ortaya koymuştur. Yapılan ek analizlerde, bu yanlış pozitiflerin çevrimdışı bir görsel LLM (Vision LLM) ile doğrulamasının yapılması sonucunda elendiği gözlemlenmiştir. İleride daha iyi bir çözüm bulunması için çalışmalar sürmektedir. Bu nedenle, gelecek çalışmalar, özellikle görsel kanaldaki bu sorunun üstesinden gelmek için modelin özgüllüğünü artıracak yeni nesil filtreleme mekanizmalarına, kaynak kısıtlı LLM'ler için mimari optimizasyonlara ve farklı PDF yapılarına uyum sağlayabilen sağlam görüntü/görsel çıkarma fonksiyonları geliştirmeye odaklanacaktır.
Özet (Çeviri)
To address the inadequacy of traditional systems and Large Language Models (LLMs) in handling multimodal data (text, tables, figures) and complex PDF documents requiring privacy, this thesis presents a comprehensive and energy-efficient offline RAG (Retrieval-Augmented Generation) framework that overcomes existing online dependencies. The technical distinguishing feature of the work lies in its offline dual-channel multimodal architecture, which processes visual (Image) data through separate structures. This approach provides a closed and reliable solution by hosting Large Language Models (LLMs) locally on the device (Edge AI) without requiring an external API; this developed Hybrid System significantly outperforms the accuracy of basic VLM models (LLaVA and VILA's approximately 0.72-0.73 accuracy) in real-world tests, achieving an average success rate (CheckAvail score) of 0.8827. This proves it is a competitive alternative to the online, high-performance XSum architecture (0.97 score). The XSum score was found to be consistent with text-focused metrics. The Hybrid Score Model, which shows similar success to other hybrid models, particularly in evidence capture success (true0), unfortunately has the lowest value (0.69) in the metrics for excluding irrelevant evidence (true1); this indicates that the model lacks specificity and is prone to false positives (FP). Detailed analyses have revealed that this low performance in the true1 metric is primarily due to the evaluation of evidence from the visual (Image) channel, while the text channel produced satisfactory results. Additional analyses showed that these false positives were eliminated when verified using an offline visual LLM (Vision LLM). Work is ongoing to find a better solution in the future. Therefore, future work will focus on developing new-generation filtering mechanisms that will increase the model's specificity to overcome this problem, especially in the visual channel, architectural optimizations for resource-constrained LLMs, and robust image/visual extraction functions that can adapt to different PDF structures.
Benzer Tezler
- Enhancing human resource decision making with image-based OSMI data analysis: leveraging PIX2PIX for accurate workplace mental health insights
İş yeri mental sağlık incelemeleri için PIX2PIX kullanarak, görüntü tabanlı OSMI veri analiziyle insan kaynakları karar süreçlerini geliştirme
FARIBA FARID
Yüksek Lisans
İngilizce
2023
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
PROF. DR. NİZAMETTİN BAYYURT
- Evaluation of retrieval augmented generation on various types of large language models
Çeşitli büyük dil modelleri üzerinde bilgi getirme destekli üretimin değerlendirilmesi
ÖMER KARTLI
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Medipol ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. SELİM AKYOKUŞ
DR. ÖĞR. ÜYESİ SALİH SARP
- Sağlık verileri üzerinde büyük dil modeli ile yeni bir yaklaşım
A new large language model based approach on health data
BEHÇET ŞENTÜRK
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET SERDAR GÜZEL
- A hybrid LLM-driven decision support system for smart manufacturing: Integrating RAG and machine learning for industrial intelligence
Akıllı üretim için hibrit LLM tabanlı bir karar destek sistemi: Endüstriyel zekâ için RAG ve makine öğreniminin entegrasyonu
ASIF MD IMTIAZ
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÖzyeğin ÜniversitesiVeri Bilimi Ana Bilim Dalı
DOÇ. DR. ERİNÇ ALBEY
- A large language model based penetration test system implementation
Büyük dil modeli tabanlı sızma testi sistemi uygulaması
TUBA KINIK
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilişim Uygulamaları Ana Bilim Dalı (disiplinlerarası)
DR. ÖĞR. ÜYESİ SÜHA TUNA