Geri Dön

Insurance fraud detection via machine learning and explainable artificial intelligence (XAI)

Makine öğrenmesi ve açıklanabilir yapay zeka (XAI) ile sigorta sahtekarlığının tespiti

  1. Tez No: 974871
  2. Yazar: CİHAN TEZEL
  3. Danışmanlar: DR. ÖĞR. ÜYESİ BÜŞRA ZEYNEP TEMOÇİN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Aktüerya Bilimleri, Actuarial Sciences
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Orta Doğu Teknik Üniversitesi
  10. Enstitü: Uygulamalı Matematik Enstitüsü
  11. Ana Bilim Dalı: Aktüerya Bilimleri Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tezde, sigorta sahtekârlığının tespiti makine öğrenmesi (ML) yöntemleri ve açıklanabilir yapay zekâ (XAI) araçlarıyla incelenir. Veri seti, sigorta poliçeleri ve bunlara bağlı taleplerden oluşur ve sahtekârlık ikili bir değişken olarak tanımlanır. Ön işleme süreci eksik verilerin giderilmesini, kategorik alanların kodlanmasını ve çeşitli öznitelik mühendisliği adımlarını kapsar. Sahtekârlık vakalarının azlığı nedeniyle SMOTE (Synthetic Minority Oversampling Technique) yöntemi uygulanır ve modeller hem orijinal hem de dengelenmiş veriler üzerinde eğitilir. Test edilen algoritmalar arasında Lojistik Regresyon, Rassal Orman, Destek Vektör Makineleri (SVM), En Yakın Komşular (KNN), LightGBM ve XGBoost yer alır. XGBoost için iki varyant değerlendirilir: ilki mevsimsellik, polinom terimleri ve etkileşimler gibi elle tasarlanmış özniteliklere dayanır; ikincisi ise çapraz doğrulama AUC'sine göre ayarlanmış otomatik öznitelik mühendisliğini içerir. Model performansı ROC-AUC, doğruluk, duyarlılık, özgüllük ve dengeli doğruluk ölçütleri üzerinden, ROC analiziyle optimize edilen eşikler kullanılarak değerlendirilir. Ayrıca, modeller arasındaki AUC farklarının istatistiksel olarak anlamlı olup olmadığını test etmek için DeLong testleri uygulanır. Açıklanabilirlik için SHAP (SHapley Additive exPlanations) yöntemi kullanılır. Sonuçlar, sorumluluk kapsamı ve kusur durumunun sahtekârlık tespitinde en belirleyici unsurlar olduğunu gösteriyor. Talep ayı ve adres değişikliği gibi zamanlama ve poliçe sahibine ilişkin değişkenler de daha düşük düzeyde ancak anlamlı katkılar sağlıyor. Bulgular, boosting yöntemlerinin en iyi genel performansı elde ettiğini ortaya koyuyor. LightGBM ve XGBoost diğer modelleri geride bırakıyor; özellikle SMOTE ile dengelenmiş verilerde XGBoost biraz daha öne çıkıyor (AUC ≈0.85, duyarlılık ≈%90). Hem manuel hem de otomatik öznitelik mühendisliği, hatırlama oranını artırarak daha fazla sahtekârlık vakasının yakalanmasına katkı sağlıyor. Bu bulgular, güçlü tahmin performansıyla birlikte kararların nasıl verildiğini de şeffaf biçimde ortaya koyan sahtekârlık tespit modellerinin geliştirilmesinin önemini vurguluyor.

Özet (Çeviri)

This thesis studies insurance fraud detection with machine learning (ML) methods and explainable artificial intelligence (XAI) tools. The dataset contains insurance policies and their related claims, where fraud is marked as a binary variable. The preparation stage covers missing data handling, encoding of categorical fields, and several feature engineering steps. Since fraud cases are rare, the Synthetic Minor- ity Oversampling Technique (SMOTE) is employed, and models are trained on both the original and the balanced data. The algorithms tested include Logistic Regres- sion, Random Forest, Support Vector Machines (SVM), k-Nearest Neighbors (KNN), LightGBM, and XGBoost. For XGBoost, two variants are considered: one with man- ually designed features such as seasonality, polynomial terms, and interactions, and another with automated feature engineering tuned by cross-validated AUC. Model performance is evaluated with ROC-AUC, accuracy, recall, specificity, and balanced accuracy, with thresholds optimized via ROC analysis. In addition, DeLong tests are applied to assess whether the observed differences in AUC across models are statistically significant. For interpretability, SHAP (SHapley Additive exPlanations) is utilized. The results indicate that liability coverage and fault assignment are the strongest drivers of fraud detection. Timing and policyholder features, such as claim month and address changes, also contribute meaningfully, though at a lower level. The findings showed that boosting methods achieved the best overall performance. viiLightGBM and XGBoost outperformed the other models, with XGBoost slightly ahead on the SMOTE-balanced data (AUC ≈0.85, recall ≈90%). Both manual and automated feature engineering improved recall, thereby shifting the trade-off toward catching more fraud cases. These findings emphasized the importance of designing fraud detection models that combined strong predictive accuracy with transparent and interpretable decision-making.

Benzer Tezler

  1. Prescription fraud detection via data mining: A methodology proposal

    Veri madenciliği teknikleri ile reçete usulsüzlüklerinin tespiti: Bir yöntem önerisi

    KARCA DURU ARAL

    Yüksek Lisans

    İngilizce

    İngilizce

    2009

    Endüstri ve Endüstri Mühendisliğiİhsan Doğramacı Bilkent Üniversitesi

    Endüstri Mühendisliği Bölümü

    PROF. DR. ALTAY GÜVENİR

    PROF. DR. İHSAN SABUNCUOĞLU

  2. A policy analysis and recommendation for combating against the VAT fraud problem in Turkey

    Başlık çevirisi yok

    ERTAN GÜVENDİ

    Yüksek Lisans

    İngilizce

    İngilizce

    2019

    EkonomiDuke Unıversıty

    PROF. GANGADHAR PRASAD SHUKLA

    DOÇ. DR. SANDEEP BHATTACHARYA

  3. A data-mining based fraud detection system for health insurance companies

    Sağlık sigortası şirketleri için veri madenciliği tabanlı suistimal tespit sistemi

    CÜNEYT AŞUK

    Yüksek Lisans

    İngilizce

    İngilizce

    2010

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MELİH KIRLIDOĞ

  4. Machine learning based for insurance claims fraud detection technique for safeguarding the health industry

    Sağlık sektörünü koruma amaçlı makine eğitimi tabanlı sigorta talep dolandırıcılığı tespit tekniği

    GHİNA ÖZDEMİR

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Aydın Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. RAFET AKDENİZ

  5. Makine öğrenmesi ile sigorta sektöründe sahte hasar tespiti

    Fraud detection in the insurance sector with machine learning

    YAŞAR GEREN

    Yüksek Lisans

    Türkçe

    Türkçe

    2020

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Aydın Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ AHMET GÜRHANLI