Yeni önerilen sayma regresyon modellerinin geleneksel ve makine öğrenmesi yöntemleriyle karşılaştırmalı analizi
Comparative analysis of new proposed count regression models with traditional and machine learning methods
- Tez No: 1019759
- Danışmanlar: PROF. DR. NİMET YAPICI PEHLİVAN
- Tez Türü: Doktora
- Konular: İstatistik, Statistics
- Anahtar Kelimeler: Negatif binomial regresyon, Poisson regresyon analizi, Veri yorumlama-istatistiksel, Çok değişkenli istatistik, Negative binomial regression, Poisson regression analysis, Data interpretation-statistical, Multivariate statistic
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Selçuk Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: İstatistik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
İstatistiksel analizlerde veri yapısına uygun model seçimi, elde edilecek çıkarımların güvenilirliği açısından önemlidir. Özellikle bağımlı değişkenin sayma tipinde olduğu veri kümelerinde aşırı yayılım ve yüksek sıfır yığılması gibi durumlarla sıklıkla karşılaşılmaktadır. Bu tür veri yapılarında, normal dağılım ve varyans homojenliği varsayımlarına dayalı klasik doğrusal regresyon modellerinin kullanılması yanlı, etkin olmayan ve yetersiz tahmin sonuçlarına yol açabilmektedir. Sayma verilerinin analizinde yaygın olarak kullanılan Poisson ve Negatif Binom regresyon modellerinin yanı sıra bu modellerin sıfır yığılmalı ve Hurdle modelleri de geliştirilmiştir. Ancak, veri kümelerinde gözlenen aşırı yayılım, sıfır yığılması gibi karmaşık yapıların varlığında bu modeller yetersiz kalabilmektedir. Bu nedenle literatürde, Yeni Kesikli Lindley, Conway–Maxwell Poisson ve Kesikli Burr Hatke gibi alternatif kesikli olasılık dağılımlarına dayalı yeni sayma regresyon modelleri önerilmiştir. Verilerdeki karmaşık ve doğrusal olmayan ilişkileri çözümleyebilen parametrik olmayan makine öğrenmesi algoritmaları, bu parametrik modellere güçlü bir alternatif olarak öne çıkmaktadır. Bununla birlikte, farklı veri karakteristikleri (örneklem büyüklüğü, aşırı yayılım düzeyi, sıfır yığılma düzeyi, bağımsız değişken türleri ve değişkenler arası ilişki yapısı) altında hangi modellerin daha iyi performans gösterdiğinin belirlenmesi önemli bir araştırma konusudur. Bu tez çalışmasının temel amacı, klasik sayma regresyon modellerinin sınırlılıklarını aşmaya yönelik olarak, mevcut ve/veya yeni önerilen kesikli olasılık dağılımlarına dayalı alternatif sayma regresyon modelleri geliştirmek ve bu modellerin performanslarını makine öğrenmesi algoritmaları ile karşılaştırmaktır. Bu kapsamda, gerçek veri kümeleri ve Monte Carlo simülasyonları ile elde edilen sentetik veri kümeleri üzerinde ele alınan modeller uygulanmıştır. Modellere ilişkin performans değerlendirmesi, hata kareler ortalaması karekökü ve ortalama mutlak hata metrikleri ile gerçekleştirilmiştir. Sayma regresyon modellerine ilişkin uyum iyiliği ise Akaike Bilgi Kriteri ve Bayesci Bilgi Kriteri kullanılarak incelenmiştir.
Özet (Çeviri)
The selection of a model that is appropriate for the data structure in statistical analyses is crucial for the reliability of the inferences obtained. In particular, in datasets where the dependent variable is the count type, issues such as overdispersion and excessive zero inflation are frequently encountered. In such data structures, the use of classical linear regression models based on the assumptions of normal distribution and homogeneity of variance may lead to biased, inefficient, and inadequate estimation results. In addition to the Poisson and Negative Binomial regression models commonly used in the analysis of count data, zero-inflated and Hurdle models of these models have also been developed. However, these models may prove inadequate in the presence of complex structures such as overdispersion and zero-inflation observed in datasets. Therefore, new count regression models based on alternative discrete probability distributions such as the New Discrete Lindley, Conway–Maxwell Poisson, and Discrete Burr Hatke, have been proposed in the literature. Nonparametric machine learning algorithms, which are capable of capturing complex and nonlinear relationships in data, have emerged as strong alternatives to these parametric models. Nevertheless, determining which models perform better under different data characteristics, such as sample size, overdispersion, zero inflation, types of independent variables, and the structure of relationships among variables, remains an important research question. The main objective of this thesis is to develop alternative count regression models based on existing and/or newly proposed discrete probability distributions in order to overcome the limitations of classical count regression models, and to compare their performance with machine learning algorithms. In this context, the models are applied to both real datasets and synthetic datasets generated through Monte Carlo simulations. Model performance is evaluated using Root Mean Squared Error (RMSE) and Mean Absolute Error (MAE) metrics, while goodness-of-fit for the count regression models is assessed using the Akaike Information Criterion (AIC) and the Bayesian Information Criterion (BIC).
Benzer Tezler
- Efficient estimation of Shrinkage parameters in fuzzy Ridge and fuzzy Liu regression models using α-cut-based methods under multicollinearity
Çoklu bağıntı durumunda bulanık Ridge ve bulanık Liu regresyon modellerinde α-kesim tabanlı yöntemler kullanılarak Shrinkage parametrelerinin etkin tahmini
AMMAR HOMAIDA
- Penalized stable regression
Cezalandırılmış stabil regresyon
İREM SARIBAŞ
Yüksek Lisans
İngilizce
2024
Matematikİstanbul Teknik ÜniversitesiMatematik Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÜL İNAN
- Çift makine öğrenmesi çerçevesinde fiyat esnekliği analizi: Geliştirilmiş yöntemsel bir model
Price elasticity analysis in a double machine learning framework: An improved methodological model
İREM ODABAŞI
Yüksek Lisans
Türkçe
2025
Endüstri ve Endüstri MühendisliğiYıldız Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. BAHADIR GÜLSÜN
DOÇ. DR. İREM OTAY
- Development of high fidelity aerospace digital twins for improving operational performance
Operasyonel performansı iyileştirmek için yüksek doğruluklu havacılık dijital ikizlerinin geliştirilmesi
MUSTAFA KAYMAZ
Yüksek Lisans
İngilizce
2026
Uçak Mühendisliğiİstanbul Teknik ÜniversitesiSavunma Teknolojileri Ana Bilim Dalı
PROF. DR. GÖKHAN İNALHAN
- Tsallis entropy based feature extraction from insole force sensor data to diagnose vestibular system disorders
Vestibüler sistem bozukluklarının tanısı için tabanlık kuvvet algılayıcıları verilerinden tsallis entropisi tabanlı öznitelik çıkarımı
HARUN YAŞAR KÖSE
Yüksek Lisans
İngilizce
2023
Mekatronik Mühendisliğiİstanbul Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. SERHAT İKİZOĞLU