Sıfırıncı Gün Zafiyetlerinin Geliştirici ve Kullanıcı Deneyimi Metinleri Üzerinden Kestirimi
Forecasting of Zero-Day Vulnerabilities from Developer and User Experience Texts
- Tez No: 1024640
- Danışmanlar: PROF. DR. AYDIN ÇETİN
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Siber güvenlik, Cyber security
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Gazi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Yazılım sistemlerinde ortaya çıkan ve çökmeye (crash) sebep olan her işlevsel hata (error), bir güvenlik açığı barındırma potansiyeli taşımaktadır. Bu hatalara ilişkin teknik sorular, Stack Overflow gibi kamuya açık soru-cevap platformlarında teknoloji geliştiricileri ve kullanıcıları tarafından sıklıkla paylaşılmaktadır. Bu tez, söz konusu platformlardan elde edilen büyük ölçekli teknik metinlerin Doğal Dil İşleme (Natural Language Processing, NLP) yöntemleriyle analiz edilmesine odaklanmaktadır. Çalışmada, bu metinlerin işlenmesiyle potansiyel sıfırıncı gün (zero-day) zafiyetlerinin kestirilmesi araştırılmıştır. Bu kapsamda, yazılım varlıkları (software entities) için 70.000'den fazla girdi birimi (token) içeren özgün bir İsimlendirilmiş Varlık Tanıma (Named Entity Recognition, NER) veri seti ile çökme olayları için 40.000'den fazla girdi birimi içeren özgün bir Olay Çıkarımı (Event Extraction, EE) veri seti oluşturulmuştur. Belirlenen Dönüştürücülerden Çift Yönlü Kodlayıcı Temsilleri (Bidirectional Encoder Representations from Transformers, BERT) tabanlı modeller, hazırlanan veri setleri kullanılarak denetimli ince ayar (supervised fine-tuning) yöntemiyle eğitilmiştir. NER görevinde Damıtılmış Güçlü Şekilde Optimize Edilmiş BERT Yaklaşımı (Distilled Robustly Optimized BERT Approach, DistilRoBERTa) base (temel), EE görevinde ise Güçlü Şekilde Optimize Edilmiş BERT Yaklaşımı (Robustly Optimized BERT Approach, RoBERTa) base en iyi doğrulama (validation) sonuçlarını vermiştir. İnce ayarlı DistilRoBERTa-base, NER test veri setinin tüm etiketlerinde %99,109 doğruluk (accuracy) ve %92,221 F1 makro skoru, yazılım varlığı tespiti özelinde ise %88,568 F1 makro skoru elde etmiştir. İnce ayarlı RoBERTa-base, EE test veri setinin tüm etiketlerinde %96,849 doğruluk ve %83,875 F1 makro skoru, çökme olayı tespiti özelinde ise %80,270 F1 makro skoru elde etmiştir. Olay tetikleyicisi tespiti ve olay argümanı tespiti F1 makro skorları sırasıyla %88,072 ve %72,469'dur. Bu testlerde ulaşılan F1 makro skorları, güncel ticari Büyük Dil Modelleri (Large Language Models, LLM) ile yapılan Bağlam-içi Öğrenme (In-context Learning) testlerinde ulaşılan F1 makro skorlarından daha yüksektir. Ayrıca, bir“pasif zafiyet keşfi uygulaması”geliştirilerek, teorik çıktılar somut bir çözüme dönüştürülmüştür.
Özet (Çeviri)
Every functional error that occurs in software systems and causes a crash has the potential to contain a security vulnerability. Technical questions regarding these errors are frequently shared by technology developers on public question-and-answer platforms such as Stack Overflow. This thesis focuses on analyzing large-scale technical texts obtained from these platforms using Natural Language Processing (NLP) methods. The study investigates the forecasting of potential zero-day vulnerabilities by processing these texts. In this context, a unique Named Entity Recognition (NER) dataset containing over 70,000 tokens for software entities and a unique Event Extraction (EE) dataset containing over 40,000 tokens for crash events, were created. The selected Bidirectional Encoder Representations from Transformers (BERT) based models were trained using the prepared datasets via supervised fine-tuning. The Distilled Robustly Optimized BERT Approach (DistilRoBERTa) base yielded the best validation results for the NER task, while the Robustly Optimized BERT Approach (RoBERTa) base yielded the best validation results for the EE task. The fine-tuned DistilRoBERTa-base achieved 99.109% accuracy and a 92.221% F1 macro score across all labels in the NER test dataset, and an 88.568% F1 macro score specifically for software entity detection. The fine-tuned RoBERTa-base achieved 96.849% accuracy and an F1 macro score of 83.875% across all labels in the EE test dataset, and an F1 macro score of 80.270% specifically for crash event detection. The F1 macro scores for event trigger detection and event argument detection were 88.072% and 72.469%, respectively. These F1 macro scores are higher than those achieved in In-context Learning tests using current proprietary Large Language Models (LLM). Furthermore, a“passive vulnerability discovery application”was developed, transforming the theoretical outputs into a concrete solution.
Benzer Tezler
- Penetration tests and security solutions for corporate networks
Kurumsal ağlarda sızma testleri ve güvenlik çözümleri
ÇAĞRI POLAT
Yüksek Lisans
İngilizce
2016
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDokuz Eylül ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. YALÇIN ÇEBİ
- Zero-day attack detection with deep learning
Derin öğrenmeyle sıfırıncı gün saldırı tespiti
BERNA ÇAKIR
Yüksek Lisans
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ PELİN ANGIN
- A robust gradient boosting model based on smote and near miss methods for intrusion detection in imbalanced data sets
Saldırı tespit sistemleri için dengesiz veri setlerinde smote ve near mıss metotlarına dayalı güçlü gradyan artırma modeli
AHMET OKAN ARIK
Yüksek Lisans
İngilizce
2022
Bilim ve TeknolojiIşık ÜniversitesiBilgi Teknolojileri Ana Bilim Dalı
DR. ÖĞR. ÜYESİ GÜLSÜM ÇİĞDEM ÇAVDAROĞLU
- Derin öğrenme tabanlı regresyon problemlerinin başarımlarının incelenmesi
Investigation of the performance of deep learning based regression problems
NİSANUR ÇAKAN
Yüksek Lisans
Türkçe
2025
Elektrik ve Elektronik MühendisliğiFırat ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. DUYGU KAYA
- Artificial intelligence in cyber security
Başlık çevirisi yok
SAJJAD KHAN
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÜsküdar ÜniversitesiSiber Güvenlik Ana Bilim Dalı
PROF. DR. FATİH TEMİZ