Geri Dön

Statistical report generation for predictive maintenance: A benchmark of large language models

Öngörülebilir bakım analitiklerinin raporlanması: Büyük dil modelleri için bir benchmark çalışması

  1. Tez No: 1019588
  2. Yazar: HÜSEYİN HALİD ÖZKILIÇ
  3. Danışmanlar: PROF. DR. ÜMİT DENİZ ULUŞAR
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Akdeniz Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Öngörücü bakım, endüstriyel sistemlerde plansız duruş sürelerini azaltmak ve operasyonel verimliliği artırmak açısından önemli bir alan haline gelmiştir. Modern makine öğrenmesi yöntemleri doğru tahminler ve zengin analitik kanıtlar üretebilmesine rağmen, bu çıktılar genellikle uzman olmayan paydaşlar tarafından doğrudan yorumlanması zor bilgiler içermektedir. Bu durum, öngörücü analitik ile bakım karar verme süreçleri arasında bir iletişim boşluğu oluşturmaktadır. Bu bağlamda, Büyük Dil Modelleri (LLM'ler), yapılandırılmış analitik çıktıları okunabilir bakım raporlarına dönüştürerek potansiyel bir çözüm sunmaktadır. Ancak bu görev için uygunlukları, özellikle olgusal temellendirme, sayısal tutarlılık, açıklanabilirlik kanıtlarına bağlılık ve tekrarlanabilirlik açısından hâlâ belirsizdir. Bu tez, öngörücü bakım için istatistiksel rapor üretimini yerel Büyük Dil Modelleri açısından bir karşılaştırma problemi olarak incelemektedir. Çalışma, görevi yapılandırılmış bir veriden metne üretim problemi olarak ele almaktadır. Bu problemde LLM'lere ham sensör verileri değil, yapılandırılmış bir analitik nesne sunulmaktadır. Amaç, tahmine dayalı bulguları özetleyen ve aynı zamanda kaynak kanıtlara sadık kalan standartlaştırılmış bakım raporları üretmektir. Ampirik çalışma, ikili hedef değişken olarak makine arızasının kullanıldığı AI4I 2020 Predictive Maintenance veri seti üzerinde gerçekleştirilmiştir. Karşılaştırmanın analitik temelini oluşturmak amacıyla üç temel tahmin modeli — Random Forest, Support Vector Machine ve XGBoost — eğitilmiştir. Bu modeller arasında Random Forest, en güçlü tahmin dengesini sağlamış ve bu nedenle rapor üretim aşaması için temel model olarak seçilmiştir. SHAP analizi, en önemli değişkenleri tork, takım aşınması, hava sıcaklığı, dönme hızı ve proses sıcaklığı olarak belirlemiştir. Ardından üç yerel LLM ailesi — Qwen, Mistral ve Llama — iki farklı istem varyantı altında değerlendirilmiştir. Üretilen raporlar, yapay zekâ destekli çok boyutlu bir değerlendirme çerçevesi aracılığıyla incelenmiştir. Bulgular, test edilen tüm yerel LLM'lerin okunabilir bakım raporları üretebildiğini göstermektedir. Ancak sonuçlar aynı zamanda akıcılığın tek başına rapor kalitesinin yeterli bir göstergesi olmadığını ortaya koymaktadır. Qwen2.5:7b en yüksek genel kontrol listesi puanını elde etmiş, onu Llama3.1:8b ve Mistral:7b takip etmiştir. Tüm modellerde en güçlü performans tutarlılık ve akıcılık ölçütlerinde gözlemlenirken, en zorlayıcı ölçütler desteklenmeyen bilgiden kaçınma ve analitik kanıtların önemini koruma ile ilgili olmuştur. Bu tez literatüre dört temel şekilde katkı sunmaktadır. İlk olarak, öngörücü bakım rapor üretimini; öngörücü bakım, açıklanabilir yapay zekâ ve veriden metne üretim alanlarının kesişiminde karşılaştırılabilir yapılandırılmış bir üretim görevi olarak çerçevelemektedir. İkinci olarak, bu bağlamda yerel LLM'lerin değerlendirilmesi için uygulanabilir birdeneysel süreç önermektedir. Üçüncü olarak, yalnızca biçimsel kaliteye değil, temellendirme ve kanıt koruma unsurlarına odaklanan bir değerlendirme bakış açısı sunmaktadır. Dördüncü olarak ise hem istem tasarımının hem de model seçiminin, üretilen bakım raporlarının güvenilirliğini güçlü biçimde etkilediğini göstermektedir. Genel olarak tez, yerel LLM'lerin öngörücü bakım raporlamasını destekleyebileceği sonucuna varmaktadır. Ancak bu modeller otomatik olarak güvenilir rapor üreticileri olarak değerlendirilmemelidir. Operasyonel kullanımdan önce çıktıları dikkatli bir şekilde karşılaştırılmalı ve değerlendirilmelidir.

Özet (Çeviri)

Predictive maintenance become an important to reduce unplanned downtime and improving operational efficiency in industrial systems. Although modern machine learning methods can generate accurate predictions and rich analytical evidence, these outputs are often difficult for non-specialist stakeholders to interpret directly. This creates a communication gap between predictive analytics and maintenance decision-making. In this context, Large Language Models (LLMs) offer a potential solution by transforming structured analytical outputs into readable maintenance reports. However, their suitability for this task remains unclear, especially in terms of factual groundedness, numerical consistency, explainability faithfulness, and repeatability. This thesis investigates statistical report generation for predictive maintenance as a benchmark problem for local Large Language Models. The study frames the task as a structured data-to-text generation problem in which LLMs receive not raw sensor data but a structured analytics object. The goal is to generate standardized maintenance reports that summarize predictive findings while remaining faithful to the source evidence. The empirical study is conducted on the AI4I 2020 Predictive Maintenance Dataset using machine failure as the binary target variable. Three baseline predictive models—Random Forest, Support Vector Machine, and XGBoost—are trained to establish the analytical foundation of the benchmark. Among them, Random Forest provides the strongest predictive balance and is therefore selected as the core model for the report-generation stage. SHAP analysis identifies these as most important variables torque, tool wear, air temperature, rotational speed, and process temperature. Three local LLM families—Qwen, Mistral, and Llama—are then evaluated under two prompt variants. The generated reports are assessed through a multi-dimensional evaluation framework with AI. The findings show that all tested local LLMs can generate readable maintenance reports but the results also shows that fluency is not a sufficient indicator of report quality alone. Qwen2.5:7b achieved the highest overall checklist score, followed by Llama3.1:8b and Mistral:7b. The strongest performance across all models was observed in coherence and fluency, whereas the most challenging criteria were related to avoiding unsupported information and preserving the importance of analytical evidence. The thesis contributes to literature in four main ways. First, it frames predictive maintenance report generation as a benchmarkable structured-generation task at the intersection of predictive maintenance, explainable AI, and data-to-text generation. Second, it proposes a practical experimental pipeline for evaluating local LLMs in this setting. Third, it introduces an evaluation perspective centered on groundedness and evidence preservation rather than stylistic quality alone. Fourth, its showing that both prompt design and model selection strongly influence the trustworthiness of generated maintenance reports. Overall, the thesis concludes that local LLMs can support predictive maintenance reporting, but they should not be treated as automatically trustworthy report generators. Their outputs must be benchmarked carefully before operational use.

Benzer Tezler

  1. Lityum iyon bataryalarda parça ömür kestirimi

    Calculating remaining useful life of lithium-ion batteries

    FERHAT MAÇİN

    Yüksek Lisans

    Türkçe

    Türkçe

    2019

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Kontrol ve Otomasyon Mühendisliği Ana Bilim Dalı

    PROF. DR. SALMAN KURTULAN

  2. Makine öğrenmesi tabanlı akıllı şehir çözümleri: Bina türü tanıma, su tüketimi öngörüsü ve sızıntı tespiti

    Machine learning-based smart city solutions: Building type identification, water consumption forecasting, and leak detection

    RAUF YASİN

    Doktora

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ SEÇKİN ARI

  3. Hydips: A Hybrid neural network based diagnostic tool for perinatal surveillance

    Perinatal takipte bir hibrit nöron ağına dayanan tanı aracı

    NAZİFE BAYKAL

    Doktora

    İngilizce

    İngilizce

    1996

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. NEŞE YALABIK

  4. Yeni ve eski kanama skorlama sistemlerinin yeni oral antikoagülan kullanan hastalardaki kanama öngördürücülüğü

    Predictive value of new and old bleeding risk scores in patients using novel oral anticoagulants

    YUSUF İNCİ

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2020

    Kardiyolojiİstanbul Üniversitesi-Cerrahpaşa

    Kardiyoloji Ana Bilim Dalı

    PROF. SAİT MESUT DOĞAN

  5. Evaluating travel mode decisions and transport models in understanding transit equity: The case of greater Toronto and Hamilton area

    Toplu taşımada eşitliği anlamaya yönelik olarak yolculuk türü kararlarının ve ulaşım modellerının değerlendirilmesi: Büyük Toronto alanı ve Hamilton bölgesi vaka çalışması

    ELNAZ YOUSEFZADEH BARRİ

    Doktora

    İngilizce

    İngilizce

    2022

    Şehircilik ve Bölge Planlamaİstanbul Teknik Üniversitesi

    Şehir ve Bölge Planlama Ana Bilim Dalı

    DOÇ. DR. EDA BEYAZIT İNCE

    DOÇ. DR. STEVEN FARBER