Geri Dön

AI-driven cyber threat hunting assistant: NL-to-query translation

Yapay zeka destekli siber tehdit avlanma asistanı: Doğal dilden sorguya çeviri

  1. Tez No: 1013951
  2. Yazar: HAMROZ GAVHAROV
  3. Danışmanlar: PROF. DR. REİNER CREUTZBURG
  4. Tez Türü: Yüksek Lisans
  5. Konular: Yönetim Bilişim Sistemleri, Management Information Systems
  6. Anahtar Kelimeler: Siber güvenlik, Veri gizliliği, Cyber security, Data privacy
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Kadir Has Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Yönetim Bilişim Sistemleri Ana Bilim Dalı
  12. Bilim Dalı: Siber Güvenlik Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez, doğal dil (NL) tabanlı araştırma niyetlerinin siber güvenlik günlük analizi için güvenli ve etkili Elasticsearch DSL sorgularına çevrilmesi sorununu ele almaktadır. Operasyonel kısıtlar (zaman pencereleri, alan tipleri, maliyet sınırları) altında doğru DSL yazmak, Güvenlik Operasyon Merkezleri (SOC) için kalıcı bir engel oluşturmaktadır ve kısıtlanmamış NL→DSL üretimi güvensiz ya da aşırı kapsamlı sorgulara yol açma riski taşımaktadır. Bu çalışma, çok sağlayıcılı büyük dil modellerini (yerel ve bulut) şema farkındalıklı istemlerle, JSON-Schema tabanlı filtreleme ile ve alan beyaz listelerini, zamansal sınırları ve maliyet limitlerini uygulayan çok katmanlı bir doğrulayıcıyla birleştiren ES-NL2DSL adlı kısıtlı üretim çerçevesini sunmaktadır. Ek bir güvenlik katmanı, düşmanca istem filtreleme işlevi görerek belirsiz veya riskli girdilerde çekimser kalmakta, canlı yürütme kontrolleri ise sorgu uygulanabilirliğini doğrulamaktadır. Değerlendirme, standart bir ağ günlükleri dizini ile CIC-IDS2017 veri seti üzerinde, yaygın SOC görevlerini kapsayan 12 senaryoluk bir test bankası aracılığıyla gerçekleştirilmiştir. Çalışmada geliştirilmiş kısıtlı yöntem, kurala dayalı ve sıfır-atış (zero-shot) yaklaşımlarla karşılaştırılmıştır; karşılaştırma, yapısal metrikler (AST benzerliği) ve yürütme metrikleri (Jaccard, kesinlik/geri çağırma/F1), güvenlik metrikleri (doğrulayıcı geçiş oranı, reddetme taksonomisi, düşmanca engelleme oranı) ve performans metrikleri (gecikme, ilk denemede başarı, yeniden deneme sayısı) üzerinden yapılmıştır. Dayanıklılık, alan yeniden adlandırmaları yoluyla şema kayması altında incelenmiş, gizlilik–yarar dengesi ise sayısal özelliklere ve zaman damgalarına uygulanan diferansiyel gizlilik (DP, ε-ızgara) aracılığıyla değerlendirilmiştir. Sonuçlar, kısıtlı üretimin yürütme doğruluğunu ve doğrulayıcı geçiş oranını sürekli olarak iyileştirdiğini, düşmanca filtrelemenin kötü niyetli istemlerin büyük çoğunluğunu düşük yanlış pozitif oranıyla engellediğini, şema kaymasının ölçülebilir fakat yönetilebilir bir bozulmaya yol açtığını ve gizlilik–yarar eğrisinin beklendiği gibi davrandığını (daha güçlü gizlilik, daha düşük yarar sağlamaktadır) göstermektedir. Hibrit yerel/bulut kurulumu, gecikme, maliyet ve doğruluk arasında öngörülebilir takaslar sunmaktadır. Tüm yapılar—haritalamalar, kurallar, istemler, altın standart ve betikler—yeniden üretilebilirlik amacıyla paylaşılmakta, ES-NL2DSL'i siber güvenlik analitiği için doğal dil sorgu üretiminde açık ve güvenlik-öncelikli bir yaklaşım olarak konumlandırmaktadır.

Özet (Çeviri)

This thesis addresses the problem of translating natural-language (NL) investigative intents into safe, effective Elasticsearch DSL for cybersecurity log analysis. Writing correct DSL under operational constraints (time windows, field types, cost limits) is a persistent barrier in SOCs, and unconstrained NL→DSL generation risks unsafe or over-broad queries. This work presents ES-NL2DSL, a constrained generation framework that combines multi-provider LLMs (local and cloud) with schema-aware prompting, JSON-Schema gating, and a multi-layer validator that enforces field whitelists, temporal bounds, and cost caps. A security layer performs adversarial prompt filtering with abstention on ambiguous or risky inputs, and live execution checks verify query viability. The evaluation spans a standard network-log index and the CIC-IDS2017 dataset, using a 12-scenario test bank covering common SOC tasks. The study compares an enhanced constrained method against rules-based and zero-shot baselines across structural (AST similarity) and execution metrics (Jaccard, precision/recall/F1), safety metrics (validator pass-rate, reject taxonomy, adversarial block-rate), and performance metrics (latency, first-pass success, retries). Robustness is assessed under schema drift via field renaming, and privacy–utility is studied with DP (ε-grid) applied to numeric features and timestamp jitter. Results show that constrained generation consistently improves execution accuracy and validator pass-rate over baselines, the adversarial filter blocks the vast majority of malicious prompts with low false positives, schema drift causes measurable but manageable degradation, and the privacy–utility curve behaves as expected (stronger privacy yields lower utility). A hybrid local/cloud setup trades latency, cost, and accuracy in predictable ways. All artifacts—mappings, rules, prompts, ground truth, and scripts—are released for reproducibility, positioning ES-NL2DSL as an open, security-first approach to NL query generation for cybersecurity analytics.

Benzer Tezler

  1. Applications of artificial intelligence for the security of networks

    Ağ güvenliği için yapay zeka uygulamalari

    SELEN GEÇGEL ÇETİN

    Doktora

    İngilizce

    İngilizce

    2025

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    PROF. DR. GÜNEŞ ZEYNEP KARABULUT KURT

  2. Next generation security operation center

    Yeni nesil güvenlik operasyon merkezi

    BARIŞ KARAAĞAÇ

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Mühendislik BilimleriBahçeşehir Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ SELİN NACAKLI

  3. A novel artificial intelligence approach to strengthen intrusion detection system for internet of medical things

    Medikal nesnelerin interneti için ağa sızmayı algılama sistemini güçlendirmeye yönelik yeni bir yapay zeka yaklaşımı

    GÖKHAN AKAR

    Doktora

    İngilizce

    İngilizce

    2025

    Elektrik ve Elektronik MühendisliğiMarmara Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. MUSTAFA ONAT

    DOÇ. DR. ÜNAL ÇAVUŞOĞLU

  4. Kamuya açık büyük dil modelleri ile bağlam duyarlı siber risk değerlendirmesi: Uzman doğrulamalı bir çerçeve ve insan–yapay zekâ karşılaştırması

    LLM-assisted context-aware cyber risk assessment: an expert-calibrated framework and scoring

    NEZİH MAHMUT ÜNAL

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolIşık Üniversitesi

    Bilgisayar Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ BARIŞ ÇELİKTAŞ

  5. Yapay zeka tabanlı davranışsal veri analizi ile siber güvenlik tehditlerin önlenmesi

    Preventing cybersecurity threats with artificial intelligence-based behavioral data analysis

    MUHAMMED İKBAL KARADELİ

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    PROF. DR. NİHAN KAHRAMAN