Topluluk öğrenme modelini kullanarak optimum özellik seçimine dayalı duygu analizi
Sentiment analysis based on optimal feature selection using an ensemble learning model
- Tez No: 989940
- Danışmanlar: DOÇ. DR. ZEYNEP GARİP, DOÇ. DR. EKİN EKİNCİ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Sakarya Uygulamalı Bilimler Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Duygu sınıflandırması, doğal dil işleme yoluyla tespit edilen duygusal görüşlere göre değerlendirmeleri olumlu, nötr veya olumsuz olarak sınıflandıran bir yapay zeka disiplinidir. Pazarlama alanında tüketici davranışlarının anlaşılması, siyaset ve kamuoyu araştırmalarında seçmen tepkilerinin ölçülmesi, medya ve habercilikte haberlerin okuyucu üzerindeki etkilerinin incelenmesi ve eğitim gibi hizmet alımlarına yönelik memnuniyetin değerlendirilmesi gibi birçok alanda duygu analizi fayda sağlayabilmektedir. Doğal dildeki metinler üzerinden yapay zeka teknikleriyle sınıflandırma, üretim veya değer tahmini gibi çıkarımlar yapılmak istendiğinde karşılaşılan temel zorluklardan biri, doğal dildeki verinin yapay zeka yaklaşımlarına uygun bir formata dönüştürülmesidir. Özellik çıkarımı olarak adlandırılan bu süreç, modelin başarısını doğrudan etkileyen kritik bir aşamadır. Zorluklardan bir diğeri, yüksek boyutluluktur, çünkü bu durum genellikle gereksiz veya alakasız özellikler nedeniyle model performansının düşmesine neden olur. Bu nedenle, doğal dildeki verinin anlamlı bir şekilde temsil edilmesi kadar, bu temsilin etkin ve optimize edilmiş bir yapıda sunulması da yapay zeka tabanlı uygulamaların başarısı açısından büyük önem arz etmektedir. Makine öğrenimi ve veri işlemede yaygın bir uygulama olan bu tür özelliklerin kaldırılması, girdi değişkenlerinin sayısını azaltarak optimum özellik alanı oluşturulmasına yardımcı olur. Bu çalışma, ElasticNetCV tabanlı özellik seçimini TF-IDF, DistilBERT ve GloVe ile birden fazla metin temsilinde entegre eden yeni bir çoklu görünümlü topluluk öğrenme modeli önermektedir. TF-IDF yöntemi, kelime frekanslarını dikkate alan istatistiksel bir yaklaşım sunarken, GloVe kelimeler arası semantik ilişkileri vektörler aracılığıyla temsil eder. DistilBERT ise, Transformer mimarisi temelli, bağlamları da dikkate alarak cümle düzeyinde anlam bütünlüğünü de hesaba katarak özellik çıkarımı yapabilmektedir. Bu farklı noktalara odaklanan tekniklerle oluşturulan vektör temsilleri ile her bir yöntemin güçlü yönlerinden faydalanılması ve metinlerin çok boyutlu bir yaklaşımla incelenmesi amaçlanmıştır. Bildiğimiz kadarıyla bu, ElasticNetCV'nin birleşik bir model içinde hem geleneksel hem de bağlamsal gömme özelliklere uygulandığı ilk sistematik değerlendirmedir. Seçilen özellikler, temel sınıflandırıcılar olarak Random Forest (RF), Logistic Regression (LR) ve Artifical Neural Networks (ANN) içeren çoklu görünümlü ağırlıklı topluluk oylama modelini eğitmek için kullanılır. Yelp, Amazon ve IMDB veri kümeleri üzerinde yapılan deneyler, sırasıyla %97.1, %91.2, ve %95.4 gibi dikkate değer F1 puanları ortaya koyarak, önerilen yaklaşımın etkinliğini vurgulamaktadır.
Özet (Çeviri)
Sentiment classification is an artificial intelligence discipline that categorizes evaluations as positive, neutral, or negative based on emotional outputs detected through natural language processing. Sentiment analysis can be beneficial in many areas, such as understanding consumer behavior in marketing, measuring voter reactions in politics and public opinion research, examining the impact of news on readers in media and journalism, and evaluating satisfaction with services such as education. One of the fundamental challenges encountered when attempting to make inferences such as classification, generation, or value estimation using artificial intelligence techniques on natural language texts is converting natural language data into a format suitable for artificial intelligence algorithms. This process, known as feature extraction, is a critical stage that directly affects the model's success. Another challenge is high dimensionality, as this often leads to a decline in model performance due to unnecessary or irrelevant features. Therefore, presenting this representation in an efficient and optimized structure is as important as meaningfully representing natural language data for the success of AI-based applications. Removing such features, a common practice in machine learning and data processing, helps create an optimal feature space by reducing the number of input variables. This study proposes a new multi-view ensemble learning model that integrates ElasticNetCV-based feature selection with TF-IDF, DistilBERT, and GloVe across multiple text representations. The TF-IDF method offers a statistical approach that takes word frequencies into account, while GloVe represents semantic relationships between words through vectors. DistilBERT, based on the Transformer architecture, can determine features by considering contexts and taking sentence-level semantic coherence into account. By capitalizing vector representations created with these techniques, which focus on different aspects, the aim is to leverage the strengths of each method and examine texts using a multidimensional approach. To our knowledge, this is the first systematic evaluation where ElasticNetCV is applied to both traditional embedding and contextual embedding features within a unified model. The selected features are used to train a multi-view weighted ensemble voting model that includes Random Forest (RF), Logistic Regression (LR), and Artificial Neural Networks (ANN) as base classifiers. Experiments conducted on Yelp, Amazon, and IMDB datasets highlight the effectiveness of the proposed approach, yielding noteworthy F1 scores of 97.1%, 91.2%, and 95.4%, respectively.
Benzer Tezler
- Improved extreme learning machines and applications
Geliştirilmiş aşırı öğrenme makineleri ve uygulamaları
MOHANAD ABD SHEHAB AL KARAWI
Doktora
İngilizce
2018
Elektrik ve Elektronik MühendisliğiYıldız Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ NİHAN KAHRAMAN
- Medical dataset classification based on different deep learning techniques and meta-heuristic algorithms
Farklı derin öğrenme teknikleri ve meta-sezgisel algoritmalara dayalı tıbbi veri kümesi sınıflandırması
YEZI ALI KADHIM
Doktora
İngilizce
2023
Elektrik ve Elektronik MühendisliğiAtılım ÜniversitesiMühendislik Sistemlerinin Modellenmesi ve Tasarımı Ana Bilim Dalı
PROF. DR. ALOK MISHRA
PROF. DR. REŞAT ÖZGÜR DORUK
- Veri güdümlü dijital ikiz modeli ile freze takım tezgahı takım aşınma tahminlemesi ve kesme parametreleri optimizasyonu
Prediction of tool wear and cutting parameter optimization of milling machine tool with data-driven digital twin model
GİZEM BURUN
Yüksek Lisans
Türkçe
2024
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
PROF. DR. ALP ÜSTÜNDAĞ
- Fuzzy clustering based ensemble learning approach: Applications in digital advertising
Bulanık kümeleme tabanlı topluluk öğrenmesi yaklaşımı: Dijital reklam alanında uygulamalar
AHMET TEZCAN TEKİN
Doktora
İngilizce
2021
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesiİşletme Mühendisliği Ana Bilim Dalı
PROF. DR. FERHAN ÇEBİ
PROF. DR. TOLGA KAYA
- Makina öğrenmesi teknikleri ile hukuki alacak tahsilat kuruluşu dosya kapatılabilirlik tahmini ve atama modeli ile dosya ataması: Telekomünikasyon sektörü örneği
Predicting case closeability of legal debt collecti̇on agency with machine learni̇ng teqniques and assignment of cases with closibility based assignment model: A case study on telecomunication sector
NİLÜFER ALTINOK
Yüksek Lisans
Türkçe
2022
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
PROF. DR. BAŞAR ÖZTAYŞİ