Geri Dön

Büyük dil modelleri (LLM) ve almayla arttırılmış üretim (RAG) tabanlı yaklaşım ile insan kaynaklarında belgelerden bilgi çıkarımı

A large language model (LLM) and retrieval-augmented generation (RAG)-based approach for information extraction from human resources documents

  1. Tez No: 990444
  2. Yazar: EHLULLAH KARAKURT
  3. Danışmanlar: PROF. DR. AKHAN AKBULUT
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilgi ve Belge Yönetimi, Computer Engineering and Computer Science and Control, Information and Records Management
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: İstanbul Kültür Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Büyük Dil Modelleri (LLM) ve Almayla Arttırılmış Üretim (RAG) teknolojileri, İnsan Kaynakları departmanlarının belge yoğunluklu iş süreçlerini köklü bir biçimde dönüştürmektedir. Karmaşık formatlara sahip ve farklı dillerde yazılmış özgeçmişlerden (CV) saniyeler içinde anlamlı veri çıkarmayı mümkün kılan bu teknolojiler; beraberinde“halüsinasyon”(yanlış bilgi üretimi) ve veri mahremiyeti (KVKK) gibi kritik riskleri de getirmektedir. Bu tez çalışması, söz konusu riskleri minimize ederek karar destek süreçlerini daha güvenilir kılmayı ve literatürde genellikle ayrı ele alınan sıralama kalitesi (nDCG) ile operasyonel verimlilik (gecikme süresi) arasındaki dengeyi optimize etmeyi amaçlamaktadır. Çalışma kapsamında, 100.800 adet belge ve 154 doğal dil sorgusundan oluşan geniş ölçekli bir veri seti üzerinde; ColBERT, GraphRAG, Saf Vektör (Dense) ve BM25 mimarileri karşılaştırmalı olarak analiz edilmiştir. Deneysel bulgular, İK terminolojisinde vektör tabanlı modellerin“Semantik Kayma”(Semantic Drift) problemine yol açtığını; örneğin“Deneyimli”ve“Deneyimsiz”gibi zıt kavramlar arasında %86.4 oranında hatalı benzerlik kurduğunu ortaya koymuştur. Veri güvenliğini en üst düzeyde tutmak adına, bulut tabanlı API'ler yerine Docker üzerinde izole edilmiş yerel Ollama altyapısı ve Mistral 7B modeli tercih edilmiştir. Semantik kayma problemini aşmak için geliştirilen Ağırlıklı RRF (Weighted Reciprocal Rank Fusion, α=0.8) stratejisi, 0.654 nDCG@5 skoru ile saf vektör yaklaşımını (0.365) ve modern ColBERT mimarisini (0.318) geride bırakarak en yüksek başarıyı elde etmiştir. Sistemin en dikkat çekici yönü ise, Redis tabanlı semantik önbellekleme mekanizması sayesinde yanıt sürelerini 1550ms'den 50ms'ye düşürerek 31 kat hızlanma sağlamasıdır. Eklenen“konuşma geçmişi”özelliği ile bağlam koruma başarısı %95 seviyesine ulaşmış; sistem, operasyonel hedefleri tutturarak kurumsal ölçekte yüksek doğruluklu ve düşük maliyetli bir mimari sunmuştur. Gelecek çalışmalarda, özgeçmişlerdeki görsel içeriklerin de işlenebildiği çok modlu (multi-modal) bir yapıya geçilmesi hedeflenmektedir.

Özet (Çeviri)

Large Language Models (LLM) and Retrieval-Augmented Generation (RAG) technologies are radically transforming document-intensive business processes within Human Resources departments. While extracting meaningful data from complex, multilingual, and unstructured resumes (CVs) in seconds is now possible, this capability introduces critical risks such as“hallucination”(generation of false information) and data privacy (KVKK/GDPR) concerns. This study aims to minimize these risks to ensure reliable decision support processes and fills a gap in the literature by optimizing the balance between ranking quality (nDCG) and operational efficiency (latency). Within the scope of the study, a comparative analysis was conducted on a large-scale dataset comprising 100,800 documents and 154 natural language queries. The architectures evaluated included ColBERT, GraphRAG, Pure Vector (Dense), and BM25. To ensure maximum data security, an isolated local Ollama infrastructure running on Docker and the Mistral 7B model were preferred over cloud-based APIs. Experimental findings revealed that vector-based models in HR terminology lead to a“Semantic Drift”problem; for instance, opposing concepts such as“Experienced”and“Inexperienced”exhibited an erroneous similarity rate of 86.4%. To overcome this challenge, a Weighted Reciprocal Rank Fusion (Weighted RRF, $\alpha=0.8$) strategy was developed. This approach achieved an nDCG@5 score of 0.654, significantly outperforming both the pure vector approach (0.365) and the modern ColBERT architecture (0.318). Furthermore, thanks to the Redis-based semantic caching mechanism, response latency was reduced from 1550ms to 50ms, achieving a 31x speedup. With the addition of a conversation history feature, context preservation success reached 95%. Consequently, the system met operational targets, offering a high-accuracy, cost-effective, and secure architecture at an enterprise scale. Future steps aim to transition to a multi-modal structure capable of analyzing photos and graphics within CVs.

Benzer Tezler

  1. Optimizing retail decision-making with retrieval-augmented generation and chain of thought frameworks

    Almayla artırılmış üreti̇m ve düşünce zi̇nci̇ri̇ çerçeveleri̇yle perakende karar verme süreçleri̇ni̇n opti̇mi̇ze edi̇lmesi̇

    EMRE ULUÇAM

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGalatasaray Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    PROF. DR. SADETTİN EMRE ALPTEKİN

  2. Sağlık verileri üzerinde büyük dil modeli ile yeni bir yaklaşım

    A new large language model based approach on health data

    BEHÇET ŞENTÜRK

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. MEHMET SERDAR GÜZEL

  3. Identification of cyberbullying using machine learning techniques

    Makine öğrenmesi tekniklerini kullanarak siber zorbalığın tespiti

    ALI NAJIB

    Doktora

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÇukurova Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. SELMA AYŞE ÖZEL

  4. Savunma sanayi şirketlerinde web uygulama güvenliğinde geleneksel yöntemler ve büyük dil modelleri (LLM) üzerine bir çalışma

    A study of traditional methods vs. (LLM) agents results in web application security for defense industry companies

    AHMET TORTUMLU

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Savunma Teknolojileri Ana Bilim Dalı

    PROF. DR. KEMAL BIÇAKCI

  5. Otizm spektrum bozukluğu olan çocuklar için büyük dil modelleri tabanlı kişiselleştirilmiş sosyal öykü oluşturma asistanı

    Design of a large language model (llm) based personalized social story generation assistant for children with autism spectrum disorder

    SENA TINKIR

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSelçuk Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ADEM ALPASLAN ALTUN