Geri Dön

Etiketsiz metin verisinin analizinde derin öğrenme yaklaşımı

A deep learning approach for the analysis of unlabeled text data

  1. Tez No: 990674
  2. Yazar: BÜŞRA AYAN PARTAL
  3. Danışmanlar: PROF. DR. TUNÇHAN CURA
  4. Tez Türü: Doktora
  5. Konular: İşletme, Business Administration
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: İstanbul Üniversitesi
  10. Enstitü: Sosyal Bilimler Enstitüsü
  11. Ana Bilim Dalı: İşletme Ana Bilim Dalı
  12. Bilim Dalı: Sayısal Yöntemler Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez çalışması, etiketlenmemiş Türkçe sosyal medya metinlerinin analizi için geleneksel ve derin öğrenme tabanlı konu modellerinin performansını üç aşamalı kapsamlı bir ampirik çerçevede incelemektedir. Çalışmanın ilk aşaması, en verimli optimizasyon stratejisinin belirlenmesine odaklanmıştır. Bu kapsamda, literatürde standart (model-bağımsız) yöntemler olarak bilinen Kapsamlı Arama ve Rastgele Arama ile modern otomatik optimizasyon çerçevelerini temsilen Optuna (Bayesçi TPE), geleneksel modeller (LDA, LSA, NMF) üzerinde karşılaştırılmıştır. Analizler, çözüm kalitesi açısından stratejiler arasında istatistiksel olarak anlamlı bir fark bulunmadığını, ancak Optuna (TPE) yaklaşımının optimuma yakın çözümlere en hızlı ve verimli biçimde ulaştığını göstermiştir. Bu bulgu doğrultusunda, tezin ilerleyen aşamalarındaki optimizasyon süreçlerinde Optuna otomatik optimizasyon çerçevesi benimsenmiştir. İkinci ve en kapsamlı aşamada, konu modelleri, konu tutarlılığı ve konu çeşitliliği metriklerini eş zamanlı olarak optimize eden bir Çok Amaçlı Optimizasyon çerçevesinde değerlendirilmiştir. Optimizasyon süreci, problem yapısının değişmesi (tek amaçlıdan çok amaçlıya geçiş) nedeniyle, Optuna çerçevesinin bu tür problemler için standart olarak sunduğu evrimsel tabanlı NSGA-II algoritması ile yürütülmüştür. Bu çerçevede geleneksel modeller (LDA, LSA, NMF) ile Varyasyonel Otomatik Kodlayıcı (VAE) tabanlı (ProdLDA, DecTM), gömü uzayı tabanlı (ETM, ECRTM), kümeleme tabanlı (BERTopic, Top2Vec) ve alternatif bir mimari olan FASTopic'ten oluşan çok çeşitli derin öğrenme yaklaşımları incelenmiştir. Bu modeller, iki farklı sosyal medya platformundan (Twitter ve Ekşi Sözlük) derlenen ve her biri“minimal”ve“kapsamlı”olmak üzere iki ayrı ön işleme stratejisinden geçirilerek oluşturulan toplam dört veri setine uygulanmıştır. Bulgular, en iyi model seçiminin evrensel olmadığını; performansın büyük ölçüde veri setinin özelliklerine (metin uzunluğu, yapısal karmaşıklık) ve uygulanan ön işleme düzeyine bağlı olduğunu ortaya koymuştur. Uzun ve anlamsal olarak zengin metinlerden oluşan Ekşi Sözlük veri setinde gömü uzayı tabanlı ECRTM modeli en dengeli Pareto cephesini sunarken, kısa ve gürültülü metin yapısına sahip Twitter verilerinde kümeleme tabanlı BERTopic ve VAE tabanlı ProdLDA modelleri en yüksek performansı göstermiştir. Ayrıca, ön işlemenin etkisinin bağlama göre değiştiği; kapsamlı ön işlemenin Ekşi Sözlük verilerinde performansı artırırken, Twitter verilerinde minimal ön işlemenin daha iyi sonuçlar verdiği belirlenmiştir. Çalışmanın son aşaması, modellerin ürettiği konuların nitel kalitesini ve bu kaliteyi ölçmede kullanılan yöntemlerin güvenilirliğini incelemiştir.“Yargıç olarak LLM”yaklaşımıyla yapılan değerlendirmeler, Büyük Dil Modelleri'nin (LLM) konuların anlamsal tutarlılığını, yorumlanabilirliğini ve spesifikliğini tutarlı biçimde puanlayabildiğini göstermiştir. Ayrıca, insan yargısının altın standart kabul edildiği Kelime Sızıntı Testi görevinde, güncel bir LLM'nin (Gemini 2.5 Pro) insan performansına eşdeğer (%100 doğruluk) bir başarıya ulaştığı tespit edilmiştir. Bu bulgular, geleneksel olarak insan gücü gerektiren değerlendirme süreçlerinin otomasyonunda LLM'lerin güvenilir ve ölçeklenebilir bir alternatif olabileceğini ortaya koymaktadır.

Özet (Çeviri)

This dissertation examines the performance of traditional and deep learning-based topic modeling approaches for analyzing unlabeled Turkish social media text within a comprehensive three-stage empirical framework. The first stage focuses on identifying the most efficient optimization strategy. In this context, standard (model-independent) methods known in the literature as Grid Search and Random Search were compared with the Optuna (Bayesian TPE), representing modern automated optimization frameworks, on traditional models (LDA, LSA, NMF). The analyses revealed no statistically significant differences in solution quality among the strategies; however, the Optuna (TPE) approach demonstrated the most efficient convergence toward near-optimal solutions. Based on this finding, the Optuna automated optimization framework was adopted for the optimization processes in the subsequent stages of the thesis. In the second and most extensive stage, topic models were evaluated within a Multi-Objective Optimization framework that simultaneously optimizes topic coherence and topic diversity metrics. Due to the shift in problem structure (from single-objective to multi-objective), the optimization process was conducted using the evolutionary-based NSGA-II algorithm, which is the standard method provided by the Optuna framework for such problems. Within this framework, a diverse set of models was examined, including traditional approaches (LDA, LSA, NMF) as well as Variational Autoencoder (VAE) based models (ProdLDA, DecTM), embedding-based models (ETM, ECRTM), clustering-based models (BERTopic, Top2Vec), and an alternative architecture, FASTopic. These models were applied to four datasets constructed from two social media platforms (Twitter and Ekşi Sözlük), each processed using two distinct preprocessing strategies:“minimal”and“comprehensive”. The findings indicate that the selection of the best model is not universal and largely depends on dataset characteristics, such as text length and structural complexity, as well as the level of preprocessing applied. For the Ekşi Sözlük dataset, which contains long and semantically rich text, the embedding-based ECRTM model formed the most balanced and dominant Pareto front. In contrast, for the Twitter dataset, characterized by short and noisy text, the clustering-based BERTopic and the VAE-based ProdLDA models achieved the highest performance. Furthermore, the effect of preprocessing was found to be context-dependent: extensive preprocessing enhanced performance in the Ekşi Sözlük dataset, whereas minimal preprocessing yielded superior results for Twitter data. The final stage of the study examined the qualitative validity of the topics generated by the models and the reliability of the evaluation methods used to assess them. Using an“LLM-as-a-judge”approach, Large Language Models (LLMs) were found to consistently rate the semantic coherence, interpretability, and specificity of topics. Moreover, in the Word Intrusion Test, where human judgment is considered the gold standard, a state-of-the-art LLM (Gemini 2.5 Pro) achieved human-equivalent performance (100% accuracy). These results provide strong evidence that LLMs can serve as a reliable and scalable alternative for automating traditionally human-intensive topic evaluation processes.

Benzer Tezler

  1. Derin öğrenme modelleri ile sosyal medya üzerinde duygu analizi

    Sentiment analysis on social media using deep learning models

    HAZAL GİZEM DÖNMEZ

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKocaeli Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. YAŞAR BECERİKLİ

  2. Comparison of some physical and physiological parameters of Ethiopian and Turkish elite distance athletes

    Etiyopya ve Türk elit mesafe sporcularinin bazi fiziksel ve fizyolojik parametrelerinin karşilaştirilmasi

    GETAYE FISSEHA GELAW

    Doktora

    İngilizce

    İngilizce

    2022

    SporGazi Üniversitesi

    Beden Eğitimi ve Spor Ana Bilim Dalı

    PROF. DR. HALİL İBRAHİM CİCİOĞLU

  3. Recombinant production and biochemical analysis of 1-deoxy-D-xylulose 5-phosphate reductoisomerase for drug development studies

    İlaç gelıştirme çalışmaları için 1-deoksi-D-selüloz 5-fosfat redüktoizomerazın rekombinant üretimi ve biyokimyasal analizi

    MARIA ORLENCO

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    BiyomühendislikYıldız Teknik Üniversitesi

    Biyomühendislik Ana Bilim Dalı

    PROF. DR. DİLEK BALIK

    PROF. DR. BJÖRN WINDSHÜGEL

  4. Çizge ve içerik verilerinde kolektif sınıflandırma algoritmalarının karşılaştırılması

    A comparison of collective classification techniques on network and content data

    ÖZGE ATASEVEN

    Yüksek Lisans

    Türkçe

    Türkçe

    2017

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. YUSUF YASLAN

  5. Metinlerde duygu analizi ve sınıflandırma için yeni yöntemler

    New techniques for sentiment analysis and classification in texts

    MUHAMMET YASİN PAK

    Yüksek Lisans

    Türkçe

    Türkçe

    2015

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnadolu Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. SERKAN GÜNAL