Insurance fraud detection via machine learning and explainable artificial intelligence (XAI)
Makine öğrenmesi ve açıklanabilir yapay zeka (XAI) ile sigorta sahtekarlığının tespiti
- Tez No: 974871
- Danışmanlar: DR. ÖĞR. ÜYESİ BÜŞRA ZEYNEP TEMOÇİN
- Tez Türü: Yüksek Lisans
- Konular: Aktüerya Bilimleri, Actuarial Sciences
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Uygulamalı Matematik Enstitüsü
- Ana Bilim Dalı: Aktüerya Bilimleri Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tezde, sigorta sahtekârlığının tespiti makine öğrenmesi (ML) yöntemleri ve açıklanabilir yapay zekâ (XAI) araçlarıyla incelenir. Veri seti, sigorta poliçeleri ve bunlara bağlı taleplerden oluşur ve sahtekârlık ikili bir değişken olarak tanımlanır. Ön işleme süreci eksik verilerin giderilmesini, kategorik alanların kodlanmasını ve çeşitli öznitelik mühendisliği adımlarını kapsar. Sahtekârlık vakalarının azlığı nedeniyle SMOTE (Synthetic Minority Oversampling Technique) yöntemi uygulanır ve modeller hem orijinal hem de dengelenmiş veriler üzerinde eğitilir. Test edilen algoritmalar arasında Lojistik Regresyon, Rassal Orman, Destek Vektör Makineleri (SVM), En Yakın Komşular (KNN), LightGBM ve XGBoost yer alır. XGBoost için iki varyant değerlendirilir: ilki mevsimsellik, polinom terimleri ve etkileşimler gibi elle tasarlanmış özniteliklere dayanır; ikincisi ise çapraz doğrulama AUC'sine göre ayarlanmış otomatik öznitelik mühendisliğini içerir. Model performansı ROC-AUC, doğruluk, duyarlılık, özgüllük ve dengeli doğruluk ölçütleri üzerinden, ROC analiziyle optimize edilen eşikler kullanılarak değerlendirilir. Ayrıca, modeller arasındaki AUC farklarının istatistiksel olarak anlamlı olup olmadığını test etmek için DeLong testleri uygulanır. Açıklanabilirlik için SHAP (SHapley Additive exPlanations) yöntemi kullanılır. Sonuçlar, sorumluluk kapsamı ve kusur durumunun sahtekârlık tespitinde en belirleyici unsurlar olduğunu gösteriyor. Talep ayı ve adres değişikliği gibi zamanlama ve poliçe sahibine ilişkin değişkenler de daha düşük düzeyde ancak anlamlı katkılar sağlıyor. Bulgular, boosting yöntemlerinin en iyi genel performansı elde ettiğini ortaya koyuyor. LightGBM ve XGBoost diğer modelleri geride bırakıyor; özellikle SMOTE ile dengelenmiş verilerde XGBoost biraz daha öne çıkıyor (AUC ≈0.85, duyarlılık ≈%90). Hem manuel hem de otomatik öznitelik mühendisliği, hatırlama oranını artırarak daha fazla sahtekârlık vakasının yakalanmasına katkı sağlıyor. Bu bulgular, güçlü tahmin performansıyla birlikte kararların nasıl verildiğini de şeffaf biçimde ortaya koyan sahtekârlık tespit modellerinin geliştirilmesinin önemini vurguluyor.
Özet (Çeviri)
This thesis studies insurance fraud detection with machine learning (ML) methods and explainable artificial intelligence (XAI) tools. The dataset contains insurance policies and their related claims, where fraud is marked as a binary variable. The preparation stage covers missing data handling, encoding of categorical fields, and several feature engineering steps. Since fraud cases are rare, the Synthetic Minor- ity Oversampling Technique (SMOTE) is employed, and models are trained on both the original and the balanced data. The algorithms tested include Logistic Regres- sion, Random Forest, Support Vector Machines (SVM), k-Nearest Neighbors (KNN), LightGBM, and XGBoost. For XGBoost, two variants are considered: one with man- ually designed features such as seasonality, polynomial terms, and interactions, and another with automated feature engineering tuned by cross-validated AUC. Model performance is evaluated with ROC-AUC, accuracy, recall, specificity, and balanced accuracy, with thresholds optimized via ROC analysis. In addition, DeLong tests are applied to assess whether the observed differences in AUC across models are statistically significant. For interpretability, SHAP (SHapley Additive exPlanations) is utilized. The results indicate that liability coverage and fault assignment are the strongest drivers of fraud detection. Timing and policyholder features, such as claim month and address changes, also contribute meaningfully, though at a lower level. The findings showed that boosting methods achieved the best overall performance. viiLightGBM and XGBoost outperformed the other models, with XGBoost slightly ahead on the SMOTE-balanced data (AUC ≈0.85, recall ≈90%). Both manual and automated feature engineering improved recall, thereby shifting the trade-off toward catching more fraud cases. These findings emphasized the importance of designing fraud detection models that combined strong predictive accuracy with transparent and interpretable decision-making.
Benzer Tezler
- Prescription fraud detection via data mining: A methodology proposal
Veri madenciliği teknikleri ile reçete usulsüzlüklerinin tespiti: Bir yöntem önerisi
KARCA DURU ARAL
Yüksek Lisans
İngilizce
2009
Endüstri ve Endüstri Mühendisliğiİhsan Doğramacı Bilkent ÜniversitesiEndüstri Mühendisliği Bölümü
PROF. DR. ALTAY GÜVENİR
PROF. DR. İHSAN SABUNCUOĞLU
- A policy analysis and recommendation for combating against the VAT fraud problem in Turkey
Başlık çevirisi yok
ERTAN GÜVENDİ
Yüksek Lisans
İngilizce
2019
EkonomiDuke UnıversıtyPROF. GANGADHAR PRASAD SHUKLA
DOÇ. DR. SANDEEP BHATTACHARYA
- A data-mining based fraud detection system for health insurance companies
Sağlık sigortası şirketleri için veri madenciliği tabanlı suistimal tespit sistemi
CÜNEYT AŞUK
Yüksek Lisans
İngilizce
2010
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MELİH KIRLIDOĞ
- Machine learning based for insurance claims fraud detection technique for safeguarding the health industry
Sağlık sektörünü koruma amaçlı makine eğitimi tabanlı sigorta talep dolandırıcılığı tespit tekniği
GHİNA ÖZDEMİR
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Aydın ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. RAFET AKDENİZ
- Makine öğrenmesi ile sigorta sektöründe sahte hasar tespiti
Fraud detection in the insurance sector with machine learning
YAŞAR GEREN
Yüksek Lisans
Türkçe
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Aydın ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ AHMET GÜRHANLI