Comparison of information theory metrics on a time series dataset and introduction of a noval feature selection method: Jensen-Gini-Simpson index
Bilgi teorisi ölçümlerinin makine öğrenme algoritmaları kullanılarak karşılaştırılması ve yeni bir özellik seçim yöntemi olarak Jensen-Gini-Simpson endeksi'nin tanıtılması
- Tez No: 985261
- Danışmanlar: PROF. DR. FEMİN YALÇIN KÜÇÜKBAYRAK
- Tez Türü: Yüksek Lisans
- Konular: İstatistik, Maliye, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Statistics, Finance, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İzmir Katip Çelebi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Özellik seçimi, özellikle çok sayıda ilgisiz veya tekrarlayan değişken içeren finansal veri kümelerinde öngörücü modellerin kurulmasında kritik bir süreçtir. Bu tezde, finansal bir veri kümesi üzerinde karşılıklı bilgi, entropi ve Gini indeksi gibi bilgi teorisine dayalı metrikler karşılaştırmalı olarak incelenmiş; bu yöntemlerin finansal tahminlerde en ilgili özellikleri belirlemedeki etkinliği değerlendirilmiştir. Buna ek olarak, tezde Jensen-Gini-Simpson İndeksi (JGSI) adı verilen yeni bir özellik seçimi metriği tanıtılmaktadır. Bu yöntem, Jensen-Shannon ayrışımı, Gini safsızlığı ve Simpson çeşitlilik indeksinin prensiplerini birleştirerek özellik önemini daha sağlam bir şekilde ölçmeyi amaçlamaktadır. JGSI, yalnızca bireysel özelliklerin önemini değil, aynı zamanda bunların etkileşimlerini ve çeşitliliğini de daha kapsamlı bir biçimde yakalamayı hedeflemektedir. JGSI'nin performansı, geleneksel metriklerle karşılaştırmalı olarak finansal bir veri kümesi üzerinde test edilmiştir. Elde edilen bulgular, JGSI'nin özellikle yüksek boyutlu verilerde hem özellik seçiminin kalitesi hem de model performansı açısından mevcut yöntemleri geride bıraktığını göstermektedir. Bu araştırma, Jensen-Gini-Simpson İndeksi'nin finansal modelleme ve karmaşık veri kümelerini içeren diğer alanlarda gelişmiş bir özellik seçimi aracı olarak potansiyelini ortaya koymaktadır.
Özet (Çeviri)
Feature selection is a critical step in building predictive models, especially in domains like finance where datasets often contain numerous variables, many of them irrelevant or redundant. This thesis conducts a comparative analysis of information theory-based feature selection metrics—mutual information, entropy, and the Gini index—applied to a financial dataset. The aim is to assess the effectiveness of these traditional metrics in identifying the most relevant features for financial prediction. In addition to this comparative study, the thesis introduces a novel feature selection metric: the Jensen-Gini-Simpson Index (JGSI). This new method integrates principles from the Jensen-Shannon divergence, the Gini impurity, and the Simpson diversity index to provide a more robust measure of feature relevance. By combining these metrics, the JGSI aims to capture not only the individual importance of features but also their interactions and diversity in a more comprehensive manner. The performance of JGSI is evaluated against traditional metrics on a financial dataset, aiming to enhance predictive accuracy while reducing computational complexity. Results show that JGSI outperforms existing methods in both feature selection quality and model performance, particularly with high-dimensional data. This study underscores the potential of the Jensen-Gini-Simpson Index as an advanced tool for feature selection in financial modeling and other complex domains.
Benzer Tezler
- Transformer tabanlı öznitelik bütünleştirme ile eksik veriye dayanıklı tahminsel model geliştirilmesi
Development of a predictive model robust to missing data via transformer-based feature integration
DUYGU BAYRAK GÜMÜŞ
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilişim Sistemleri Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MUHAMMED KOTAN
- Derin öğrenme yöntemleri ile zaman serisi tahmini
Time series classification with deep learning methods
HAKAN GÜNDÜZ
Doktora
Türkçe
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. ZEHRA ÇATALTEPE
- Borsa istanbul (BIST) hisse fiyat değişim yönünün ilişkisel borsa ağı kullanılarak tahmin edilmesi
Forecasting stock price change direction using relational stock market network on borsa Istanbul (BIST)
BİRCAN ERGÜR
Yüksek Lisans
Türkçe
2014
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. ZEHRA ÇATALTEPE
- Rethinking the line: Computational and critical approaches to motion-based drawing
Çizgiyi yeniden düşünmek: Hareket tabanlı çizime hesaplamalı ve eleştirel yaklaşımlar
GÖRKEY GÜREL
Yüksek Lisans
İngilizce
2026
Mimarlıkİstanbul Teknik ÜniversitesiBilişim Ana Bilim Dalı
DOÇ. DR. SEMA ALAÇAM
DR. ÖĞR. ÜYESİ ÇAĞIN TANRIVERDİ ÇETİN
- Design and implementation of a lightweight Bloom filter accelerator for internet of things applications
Nesneleriın interneti uygulamalarına yönelik kaynak verimli bir Bloom filtre hızlandırıcısı tasarımı ve gerçeklemesi
HÜSEYİN AYDIN SEYMEN
Yüksek Lisans
İngilizce
2024
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
PROF. DR. MÜŞTAK ERHAN YALÇIN