Geri Dön

An adaptive and context-aware text segmentation method for information retrieval

Bilgi erişimi için veriye dayalı ve bağlama duyarlı metin segmentasyon yöntemi

  1. Tez No: 1002775
  2. Yazar: BURÇE ŞİRİN
  3. Danışmanlar: DR. ÖĞR. ÜYESİ SERDAR ARSLAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Çankaya Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Günümüzde dijital uygulamaların artmasıyla birlikte metinsel verilerin hacmi artmakta; ayrıca dil, yapı, içerik, uzunluk gibi özellikler bakımından giderek daha çeşitlenmekte ve karmaşıklaşmaktadır. Böyle geniş bir bilgi havuzunda bireylerin ihtiyaç duydukları bilgiye doğru ve etkin bir şekilde erişmeleri giderek zorlaşmakta; bu da bilgi erişim sistemlerini vazgeçilmez hale getirmektedir. Ancak bu sistemlerde, özellikle uzun ve içerik açısından zengin metinlerin tek parça halinde ele alınması anlamsal kayma ve işlem maliyetinin artması sorunlarına yol açabilmektedir. Bu sorunların çözümü için, metinlerin anlam bütünlüğü korunarak daha küçük parçalara ayrılmasını amaçlayan çeşitli metin segmentasyon yöntemleri geliştirilmiştir. Bununla birlikte, mevcut çalışmalar segmentasyon başarısının veri seti özellikleri ve görev gereksinimlerine bağlı olarak değiştiğini ve tüm senaryolar için geçerli tek bir yaklaşım bulunmadığını göstermektedir. Bu durum, yeni ve uyarlanabilir yöntemlere olan ihtiyacı ortaya koymaktadır. Bu tezde, bu ihtiyaçtan yola çıkarak, veriye ve bağlama duyarlı bir segmentasyon yöntemi önerilmekte ve bilgi erişimi açısından verimliliği ve etkinliği değerlendirilmektedir. Önerilen yöntemde öncelikle metinler cümlelere ayrılmakta ve her cümle için yoğun vektör temsilleri oluşturulmaktadır. Ardışık cümleler arasındaki anlamsal ilişkiler, bu vektörleri kullanan bir maliyet fonksiyonu ile modellenmekte ve dinamik programlama yaklaşımı ile küresel maliyeti en aza indiren segment sınırları belirlenmektedir. Önerilen yöntem, farklı veri kümeleri ve vektör temsili oluşturma stratejileri kullanılarak bir bilgi erişim hattı üzerinde bir referans yöntemle karşılaştırılmıştır. Değerlendirmeler, ortalama segment boyutlarına, segmentasyon süresine ve MRR, DCG ve nDCG bilgi erişim metriklerine göre yapılmıştır. Deneysel bulgular, önerilen yöntemin verimlilik açısından başarılı olduğunu ortaya koymaktadır. İyileşmeler sınırlı düzeyde olmakla birlikte, etkin bilgi erişimi konusunda da tutarlı kazanımlar sağlandığı gözlemlenmiştir.

Özet (Çeviri)

Today, with the rapid growth of digital applications, the volume of textual data has increased significantly and become more diverse and complex in language, structure, content, and length. In such a broad information environment, accurately and efficiently accessing required information has become more difficult for users, making information retrieval systems indispensable. However, processing long and content-rich documents as a single unit may cause semantic blurring and increased computational cost. To address these issues, different text segmentation approaches have been proposed to divide texts into smaller units while preserving semantic coherence. Nevertheless, existing studies show that the effectiveness of segmentation methods depends on dataset characteristics and task requirements, and there is no single approach that performs best in all scenarios. This highlights the need for more adaptable methods. In response, this thesis proposes an adaptive, context-aware segmentation method and evaluates its efficiency and effectiveness in information retrieval. In the method, documents are first divided into sentences, and dense vectors are generated for each sentence. Semantic relationships between adjacent sentences are modeled using a cost function based on these vectors, and dynamic programming is employed to determine the segment boundaries that minimize the global cost. The proposed method is compared with a baseline within a retrieval pipeline using different datasets and embedding strategies. The evaluation considers average segment length, segmentation time, retrieval metrics, including MRR, DCG, and nDCG. Experimental findings demonstrate that the proposed method is highly efficient. Although the observed improvements are modest, they consistently indicate its effectiveness in information retrieval.

Benzer Tezler

  1. Çok dilli ortamlarda gerçek zamanlı ses ve video konferans için ölçeklenebilir bir sistem tasarımı

    A scalable system design for real-time audio and video conferencing in multilingual environments

    EREN ÇAĞLAR

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Veri Bilimi ve Büyük Veri Ana Bilim Dalı

    PROF. DR. MEHMET SIDDIK AKTAŞ

  2. Promptshıeld: polıcy-aware data loss preventıon framework for generatıve AI prompts

    Promptshıeld: Politika farkındalıklı üretken yapay zekâ istemleri için veri kaybı önleme çerçevesi

    EZGİ KELEŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ŞERİF BAHTİYAR

  3. Tokenizasyon, veri kalitesi ve alan uyarlaması ekseninde Türkçe dil modellerinin geliştirilmesi ve değerlendirilmesi

    Developing and evaluating Turkish language models within a tokenization, data quality, and domain adaptation framework

    MEHMET ALİ BAYRAM

    Doktora

    Türkçe

    Türkçe

    2026

    DilbilimYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. BANU DİRİ

    DOÇ. DR. SAVAŞ YILDIRIM

  4. Nesnelerin interneti ağları için semantik ses haberleşme sistemlerinin tasarımı ve geliştirilmesi

    Design and development of semantic audio communication systems for iot networks

    MÜNİF ZEYBEK

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Elektrik ve Elektronik MühendisliğiEge Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ BİLGE KARTAL ÇETİN

    DOÇ. DR. ERKAN ZEKİ ENGİN

  5. Generative artificial intelligence cybersecurity risks

    Üretken yapay zekâ siber güvenlik riskleri

    NAINWA HAYAJNEH

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. DERYA YILTAŞ KAPLAN