Geri Dön

Sıfırıncı Gün Zafiyetlerinin Geliştirici ve Kullanıcı Deneyimi Metinleri Üzerinden Kestirimi

Forecasting of Zero-Day Vulnerabilities from Developer and User Experience Texts

  1. Tez No: 1024640
  2. Yazar: KÜBRA NİLGÜN KARACA
  3. Danışmanlar: PROF. DR. AYDIN ÇETİN
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Siber güvenlik, Cyber security
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Gazi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Yazılım sistemlerinde ortaya çıkan ve çökmeye (crash) sebep olan her işlevsel hata (error), bir güvenlik açığı barındırma potansiyeli taşımaktadır. Bu hatalara ilişkin teknik sorular, Stack Overflow gibi kamuya açık soru-cevap platformlarında teknoloji geliştiricileri ve kullanıcıları tarafından sıklıkla paylaşılmaktadır. Bu tez, söz konusu platformlardan elde edilen büyük ölçekli teknik metinlerin Doğal Dil İşleme (Natural Language Processing, NLP) yöntemleriyle analiz edilmesine odaklanmaktadır. Çalışmada, bu metinlerin işlenmesiyle potansiyel sıfırıncı gün (zero-day) zafiyetlerinin kestirilmesi araştırılmıştır. Bu kapsamda, yazılım varlıkları (software entities) için 70.000'den fazla girdi birimi (token) içeren özgün bir İsimlendirilmiş Varlık Tanıma (Named Entity Recognition, NER) veri seti ile çökme olayları için 40.000'den fazla girdi birimi içeren özgün bir Olay Çıkarımı (Event Extraction, EE) veri seti oluşturulmuştur. Belirlenen Dönüştürücülerden Çift Yönlü Kodlayıcı Temsilleri (Bidirectional Encoder Representations from Transformers, BERT) tabanlı modeller, hazırlanan veri setleri kullanılarak denetimli ince ayar (supervised fine-tuning) yöntemiyle eğitilmiştir. NER görevinde Damıtılmış Güçlü Şekilde Optimize Edilmiş BERT Yaklaşımı (Distilled Robustly Optimized BERT Approach, DistilRoBERTa) base (temel), EE görevinde ise Güçlü Şekilde Optimize Edilmiş BERT Yaklaşımı (Robustly Optimized BERT Approach, RoBERTa) base en iyi doğrulama (validation) sonuçlarını vermiştir. İnce ayarlı DistilRoBERTa-base, NER test veri setinin tüm etiketlerinde %99,109 doğruluk (accuracy) ve %92,221 F1 makro skoru, yazılım varlığı tespiti özelinde ise %88,568 F1 makro skoru elde etmiştir. İnce ayarlı RoBERTa-base, EE test veri setinin tüm etiketlerinde %96,849 doğruluk ve %83,875 F1 makro skoru, çökme olayı tespiti özelinde ise %80,270 F1 makro skoru elde etmiştir. Olay tetikleyicisi tespiti ve olay argümanı tespiti F1 makro skorları sırasıyla %88,072 ve %72,469'dur. Bu testlerde ulaşılan F1 makro skorları, güncel ticari Büyük Dil Modelleri (Large Language Models, LLM) ile yapılan Bağlam-içi Öğrenme (In-context Learning) testlerinde ulaşılan F1 makro skorlarından daha yüksektir. Ayrıca, bir“pasif zafiyet keşfi uygulaması”geliştirilerek, teorik çıktılar somut bir çözüme dönüştürülmüştür.

Özet (Çeviri)

Every functional error that occurs in software systems and causes a crash has the potential to contain a security vulnerability. Technical questions regarding these errors are frequently shared by technology developers on public question-and-answer platforms such as Stack Overflow. This thesis focuses on analyzing large-scale technical texts obtained from these platforms using Natural Language Processing (NLP) methods. The study investigates the forecasting of potential zero-day vulnerabilities by processing these texts. In this context, a unique Named Entity Recognition (NER) dataset containing over 70,000 tokens for software entities and a unique Event Extraction (EE) dataset containing over 40,000 tokens for crash events, were created. The selected Bidirectional Encoder Representations from Transformers (BERT) based models were trained using the prepared datasets via supervised fine-tuning. The Distilled Robustly Optimized BERT Approach (DistilRoBERTa) base yielded the best validation results for the NER task, while the Robustly Optimized BERT Approach (RoBERTa) base yielded the best validation results for the EE task. The fine-tuned DistilRoBERTa-base achieved 99.109% accuracy and a 92.221% F1 macro score across all labels in the NER test dataset, and an 88.568% F1 macro score specifically for software entity detection. The fine-tuned RoBERTa-base achieved 96.849% accuracy and an F1 macro score of 83.875% across all labels in the EE test dataset, and an F1 macro score of 80.270% specifically for crash event detection. The F1 macro scores for event trigger detection and event argument detection were 88.072% and 72.469%, respectively. These F1 macro scores are higher than those achieved in In-context Learning tests using current proprietary Large Language Models (LLM). Furthermore, a“passive vulnerability discovery application”was developed, transforming the theoretical outputs into a concrete solution.

Benzer Tezler

  1. Penetration tests and security solutions for corporate networks

    Kurumsal ağlarda sızma testleri ve güvenlik çözümleri

    ÇAĞRI POLAT

    Yüksek Lisans

    İngilizce

    İngilizce

    2016

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDokuz Eylül Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. YALÇIN ÇEBİ

  2. Zero-day attack detection with deep learning

    Derin öğrenmeyle sıfırıncı gün saldırı tespiti

    BERNA ÇAKIR

    Yüksek Lisans

    İngilizce

    İngilizce

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ PELİN ANGIN

  3. A robust gradient boosting model based on smote and near miss methods for intrusion detection in imbalanced data sets

    Saldırı tespit sistemleri için dengesiz veri setlerinde smote ve near mıss metotlarına dayalı güçlü gradyan artırma modeli

    AHMET OKAN ARIK

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilim ve TeknolojiIşık Üniversitesi

    Bilgi Teknolojileri Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ GÜLSÜM ÇİĞDEM ÇAVDAROĞLU

  4. Derin öğrenme tabanlı regresyon problemlerinin başarımlarının incelenmesi

    Investigation of the performance of deep learning based regression problems

    NİSANUR ÇAKAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Elektrik ve Elektronik MühendisliğiFırat Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. DUYGU KAYA

  5. Artificial intelligence in cyber security

    Başlık çevirisi yok

    SAJJAD KHAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÜsküdar Üniversitesi

    Siber Güvenlik Ana Bilim Dalı

    PROF. DR. FATİH TEMİZ