Geri Dön

Hybrid machine learning approach for scrap prediction: An xgboost and catboost integration

Hurda tahmini için makine öğrenmesi yaklaşımı: Xgboost ve catboost entegrasyonu

  1. Tez No: 985179
  2. Yazar: EMİNE NUR NACAR
  3. Danışmanlar: PROF. DR. ERGÜN ERASLAN
  4. Tez Türü: Doktora
  5. Konular: Endüstri ve Endüstri Mühendisliği, Industrial and Industrial Engineering
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Ankara Yıldırım Beyazıt Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Endüstri Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Endüstriyel üretimde hurda miktarının doğru bir şekilde tahmin edilmesi, israfın azaltılması, maliyetlerin düşürülmesi ve ürün kalitesinin korunması açısından kritik öneme sahiptir; ancak hem sayısal hem de kategorik değişkenler içeren yüksek boyutlu, karma veri yapıları ve süreç değişkenleri ile kalite çıktıları arasındaki karmaşık doğrusal olmayan ilişkiler bunu güçleştirmektedir. Bu tez, büyük ölçekli gerçek bir üretim verisi üzerinde çalışan, uçtan uca bir veri hazırlama ve modelleme hattı geliştirmekte; bu kapsamda alan bilgisine dayalı özellik seçimi, eksik değerlerin ele alınması ve yorumlanabilirliği artırmak amacıyla Local Outlier Factor (LOF) temelli aykırı değer baskılama adımları kullanılmaktadır. Çalışmanın merkezinde, önerilen yöntem olarak adlandırılan özgün bir hibrit tahmin çerçevesi bulunmaktadır; bu çerçevede, ayarlanmış CatBoost ve XGBoost modelleri, meta-sezgisel yöntemlerle optimize edilen ve düşük güven düzeyine sahip örnekler için bir yedek modelle desteklenen, güven düzeyi duyarlı bir harmanlama mekanizması ile birleştirilmektedir. Temel öğrenicilerin kritik hiperparametrelerinin ayarlanmasında Genetik Algoritma kullanılırken, Parçacık Sürü Optimizasyonu harmanlama aşamasını yapılandırarak modellerin katkısını örnek bazında uyarlamaktadır. Önerilen yöntem; klasik regresörler, ağaç tabanlı ansambllar, tek başına gradyan artırmalı modeller, bir sinir ağı ve sabit ağırlıklı bir ortalama ansamblı da dâhil olmak üzere geniş bir ayarlanmış rakip model kümesine karşı, çeşitli regresyon ölçütleri (MAE, MSE, RMSE, R2, RAE, RSE) kullanılarak değerlendirilmiştir. Sonuçlar, önerilen yöntemin en düşük hata değerlerini ve en yüksek açıklama gücünü (R^2≈0.84) elde ettiğini ve zaman serisi analizlerinde tahminlerinin hurda miktarlarının zamana bağlı seyrini yakından izlediğini göstermektedir. Genel olarak tez, sağlam bir veri hazırlama hattına gömülü, özellik farkında ve meta-sezgisel olarak kalibre edilmiş CatBoost–XGBoost harmanlamasının, karma tipteki endüstriyel veri kümelerinde hurda tahmini için ölçeklenebilir ve yorumlanabilir bir çözüm sunduğunu ortaya koymaktadır.

Özet (Çeviri)

Accurate prediction of scrap in industrial production is critical for reducing waste, lowering costs, and sustaining product quality, yet it is challenging due to high dimensional, mixed-type datasets and complex nonlinear relationships between process variables and quality outcomes. This thesis develops an end-to-end data preparation and modelling pipeline for a large real world manufacturing dataset that includes domain informed feature selection, handling of missing values, and Local Outlier Factor (LOF) based outlier suppression for improved interpretability. At its core, the study introduces an original hybrid prediction framework, referred to as the proposed method, in which tuned CatBoost and XGBoost models are combined through a metaheuristic-optimised, confidence-aware blending mechanism equipped with a backup model for low confidence instances. Genetic Algorithms are used to tune key hyperparameters of the base learners, while Particle Swarm Optimization configures the blending stage so that the contribution of each base model is adapted on a per instance basis. The proposed method is evaluated against a broad set of tuned competitors including classical regressors, tree based ensembles, stand-alone gradient boosting models, a neural network, and a fixed weighted average baseline using multiple regression metrics (MAE, MSE, RMSE, R^2, RAE, RSE). Results show that the proposed method achieves the lowest error values and the highest explanatory power (R^2≈0.84), and that its predictions closely follow the temporal evolution of scrap amounts in time series analyses. Overall, the thesis demonstrates that feature aware, metaheuristic calibrated blending of CatBoost and XGBoost, embedded in a robust data preparation pipeline, offers a scalable and interpretable solution for scrap prediction in mixed-type industrial datasets.

Benzer Tezler

  1. Kuraklık tahmininde veri ön işleme adımlarıyla güçlendirilmiş makine öğrenmesi yöntemleri

    Machine learning methods enhanced with data preprocessing steps in drought prediction

    SERAP ERÇEL

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFırat Üniversitesi

    Yazılım Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ SİNEM AKYOL

  2. Fanuc işletim sistemine sahip CNC makinelerinden veri toplama ve veri analizi le üretim süreçlerinin optimizasyonu

    Optimization of production processes through data acquisition and analysis from fanuc CNC machines

    DENİZ TURAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİzmir Bakırçay Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ORHAN ER

  3. Türkçe metinlerde şartlı rastgele alanlarla varlık ismi tanıma

    Named entity recognition by conditional random fields from Turkish informal texts

    SERAP ÖZKAYA

    Yüksek Lisans

    Türkçe

    Türkçe

    2013

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. BANU DİRİ

  4. A K-means clustering and machine learning enhanced hybrid optimization approach for large-scale container loading problems

    Büyük ölçekli konteyner yükleme problemleri için K-means kümeleme ve makine öğrenmesi destekli hibrit bir optimizasyon yaklaşımı

    SEZGİ TEKİL ERGÜN

    Doktora

    İngilizce

    İngilizce

    2026

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    İşletme Mühendisliği Ana Bilim Dalı

    PROF. DR. FERHAN ÇEBİ

  5. A hybrid approach for data classification based on mathematical modelling and improved online learning algorithm for general fuzzy min-max neural network

    Genel bulanık min-maks sinir ağları için gelişmiş çevrimiçi öğrenme algoritmasına ve matematiksel modellemeye dayalı veri sınıflandırması için hibrit bir yaklaşım

    ÖMER NEDİM KENGER

    Doktora

    İngilizce

    İngilizce

    2023

    Endüstri ve Endüstri MühendisliğiGaziantep Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. EREN ÖZCEYLAN