Statistical report generation for predictive maintenance: A benchmark of large language models
Öngörülebilir bakım analitiklerinin raporlanması: Büyük dil modelleri için bir benchmark çalışması
- Tez No: 1019588
- Danışmanlar: PROF. DR. ÜMİT DENİZ ULUŞAR
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Akdeniz Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Öngörücü bakım, endüstriyel sistemlerde plansız duruş sürelerini azaltmak ve operasyonel verimliliği artırmak açısından önemli bir alan haline gelmiştir. Modern makine öğrenmesi yöntemleri doğru tahminler ve zengin analitik kanıtlar üretebilmesine rağmen, bu çıktılar genellikle uzman olmayan paydaşlar tarafından doğrudan yorumlanması zor bilgiler içermektedir. Bu durum, öngörücü analitik ile bakım karar verme süreçleri arasında bir iletişim boşluğu oluşturmaktadır. Bu bağlamda, Büyük Dil Modelleri (LLM'ler), yapılandırılmış analitik çıktıları okunabilir bakım raporlarına dönüştürerek potansiyel bir çözüm sunmaktadır. Ancak bu görev için uygunlukları, özellikle olgusal temellendirme, sayısal tutarlılık, açıklanabilirlik kanıtlarına bağlılık ve tekrarlanabilirlik açısından hâlâ belirsizdir. Bu tez, öngörücü bakım için istatistiksel rapor üretimini yerel Büyük Dil Modelleri açısından bir karşılaştırma problemi olarak incelemektedir. Çalışma, görevi yapılandırılmış bir veriden metne üretim problemi olarak ele almaktadır. Bu problemde LLM'lere ham sensör verileri değil, yapılandırılmış bir analitik nesne sunulmaktadır. Amaç, tahmine dayalı bulguları özetleyen ve aynı zamanda kaynak kanıtlara sadık kalan standartlaştırılmış bakım raporları üretmektir. Ampirik çalışma, ikili hedef değişken olarak makine arızasının kullanıldığı AI4I 2020 Predictive Maintenance veri seti üzerinde gerçekleştirilmiştir. Karşılaştırmanın analitik temelini oluşturmak amacıyla üç temel tahmin modeli — Random Forest, Support Vector Machine ve XGBoost — eğitilmiştir. Bu modeller arasında Random Forest, en güçlü tahmin dengesini sağlamış ve bu nedenle rapor üretim aşaması için temel model olarak seçilmiştir. SHAP analizi, en önemli değişkenleri tork, takım aşınması, hava sıcaklığı, dönme hızı ve proses sıcaklığı olarak belirlemiştir. Ardından üç yerel LLM ailesi — Qwen, Mistral ve Llama — iki farklı istem varyantı altında değerlendirilmiştir. Üretilen raporlar, yapay zekâ destekli çok boyutlu bir değerlendirme çerçevesi aracılığıyla incelenmiştir. Bulgular, test edilen tüm yerel LLM'lerin okunabilir bakım raporları üretebildiğini göstermektedir. Ancak sonuçlar aynı zamanda akıcılığın tek başına rapor kalitesinin yeterli bir göstergesi olmadığını ortaya koymaktadır. Qwen2.5:7b en yüksek genel kontrol listesi puanını elde etmiş, onu Llama3.1:8b ve Mistral:7b takip etmiştir. Tüm modellerde en güçlü performans tutarlılık ve akıcılık ölçütlerinde gözlemlenirken, en zorlayıcı ölçütler desteklenmeyen bilgiden kaçınma ve analitik kanıtların önemini koruma ile ilgili olmuştur. Bu tez literatüre dört temel şekilde katkı sunmaktadır. İlk olarak, öngörücü bakım rapor üretimini; öngörücü bakım, açıklanabilir yapay zekâ ve veriden metne üretim alanlarının kesişiminde karşılaştırılabilir yapılandırılmış bir üretim görevi olarak çerçevelemektedir. İkinci olarak, bu bağlamda yerel LLM'lerin değerlendirilmesi için uygulanabilir birdeneysel süreç önermektedir. Üçüncü olarak, yalnızca biçimsel kaliteye değil, temellendirme ve kanıt koruma unsurlarına odaklanan bir değerlendirme bakış açısı sunmaktadır. Dördüncü olarak ise hem istem tasarımının hem de model seçiminin, üretilen bakım raporlarının güvenilirliğini güçlü biçimde etkilediğini göstermektedir. Genel olarak tez, yerel LLM'lerin öngörücü bakım raporlamasını destekleyebileceği sonucuna varmaktadır. Ancak bu modeller otomatik olarak güvenilir rapor üreticileri olarak değerlendirilmemelidir. Operasyonel kullanımdan önce çıktıları dikkatli bir şekilde karşılaştırılmalı ve değerlendirilmelidir.
Özet (Çeviri)
Predictive maintenance become an important to reduce unplanned downtime and improving operational efficiency in industrial systems. Although modern machine learning methods can generate accurate predictions and rich analytical evidence, these outputs are often difficult for non-specialist stakeholders to interpret directly. This creates a communication gap between predictive analytics and maintenance decision-making. In this context, Large Language Models (LLMs) offer a potential solution by transforming structured analytical outputs into readable maintenance reports. However, their suitability for this task remains unclear, especially in terms of factual groundedness, numerical consistency, explainability faithfulness, and repeatability. This thesis investigates statistical report generation for predictive maintenance as a benchmark problem for local Large Language Models. The study frames the task as a structured data-to-text generation problem in which LLMs receive not raw sensor data but a structured analytics object. The goal is to generate standardized maintenance reports that summarize predictive findings while remaining faithful to the source evidence. The empirical study is conducted on the AI4I 2020 Predictive Maintenance Dataset using machine failure as the binary target variable. Three baseline predictive models—Random Forest, Support Vector Machine, and XGBoost—are trained to establish the analytical foundation of the benchmark. Among them, Random Forest provides the strongest predictive balance and is therefore selected as the core model for the report-generation stage. SHAP analysis identifies these as most important variables torque, tool wear, air temperature, rotational speed, and process temperature. Three local LLM families—Qwen, Mistral, and Llama—are then evaluated under two prompt variants. The generated reports are assessed through a multi-dimensional evaluation framework with AI. The findings show that all tested local LLMs can generate readable maintenance reports but the results also shows that fluency is not a sufficient indicator of report quality alone. Qwen2.5:7b achieved the highest overall checklist score, followed by Llama3.1:8b and Mistral:7b. The strongest performance across all models was observed in coherence and fluency, whereas the most challenging criteria were related to avoiding unsupported information and preserving the importance of analytical evidence. The thesis contributes to literature in four main ways. First, it frames predictive maintenance report generation as a benchmarkable structured-generation task at the intersection of predictive maintenance, explainable AI, and data-to-text generation. Second, it proposes a practical experimental pipeline for evaluating local LLMs in this setting. Third, it introduces an evaluation perspective centered on groundedness and evidence preservation rather than stylistic quality alone. Fourth, its showing that both prompt design and model selection strongly influence the trustworthiness of generated maintenance reports. Overall, the thesis concludes that local LLMs can support predictive maintenance reporting, but they should not be treated as automatically trustworthy report generators. Their outputs must be benchmarked carefully before operational use.
Benzer Tezler
- Lityum iyon bataryalarda parça ömür kestirimi
Calculating remaining useful life of lithium-ion batteries
FERHAT MAÇİN
Yüksek Lisans
Türkçe
2019
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiKontrol ve Otomasyon Mühendisliği Ana Bilim Dalı
PROF. DR. SALMAN KURTULAN
- Makine öğrenmesi tabanlı akıllı şehir çözümleri: Bina türü tanıma, su tüketimi öngörüsü ve sızıntı tespiti
Machine learning-based smart city solutions: Building type identification, water consumption forecasting, and leak detection
RAUF YASİN
Doktora
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SEÇKİN ARI
- Hydips: A Hybrid neural network based diagnostic tool for perinatal surveillance
Perinatal takipte bir hibrit nöron ağına dayanan tanı aracı
NAZİFE BAYKAL
Doktora
İngilizce
1996
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. NEŞE YALABIK
- Yeni ve eski kanama skorlama sistemlerinin yeni oral antikoagülan kullanan hastalardaki kanama öngördürücülüğü
Predictive value of new and old bleeding risk scores in patients using novel oral anticoagulants
YUSUF İNCİ
Tıpta Uzmanlık
Türkçe
2020
Kardiyolojiİstanbul Üniversitesi-CerrahpaşaKardiyoloji Ana Bilim Dalı
PROF. SAİT MESUT DOĞAN
- Evaluating travel mode decisions and transport models in understanding transit equity: The case of greater Toronto and Hamilton area
Toplu taşımada eşitliği anlamaya yönelik olarak yolculuk türü kararlarının ve ulaşım modellerının değerlendirilmesi: Büyük Toronto alanı ve Hamilton bölgesi vaka çalışması
ELNAZ YOUSEFZADEH BARRİ
Doktora
İngilizce
2022
Şehircilik ve Bölge Planlamaİstanbul Teknik ÜniversitesiŞehir ve Bölge Planlama Ana Bilim Dalı
DOÇ. DR. EDA BEYAZIT İNCE
DOÇ. DR. STEVEN FARBER