AI-driven cyber threat hunting assistant: NL-to-query translation
Yapay zeka destekli siber tehdit avlanma asistanı: Doğal dilden sorguya çeviri
- Tez No: 1013951
- Danışmanlar: PROF. DR. REİNER CREUTZBURG
- Tez Türü: Yüksek Lisans
- Konular: Yönetim Bilişim Sistemleri, Management Information Systems
- Anahtar Kelimeler: Siber güvenlik, Veri gizliliği, Cyber security, Data privacy
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Kadir Has Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Yönetim Bilişim Sistemleri Ana Bilim Dalı
- Bilim Dalı: Siber Güvenlik Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez, doğal dil (NL) tabanlı araştırma niyetlerinin siber güvenlik günlük analizi için güvenli ve etkili Elasticsearch DSL sorgularına çevrilmesi sorununu ele almaktadır. Operasyonel kısıtlar (zaman pencereleri, alan tipleri, maliyet sınırları) altında doğru DSL yazmak, Güvenlik Operasyon Merkezleri (SOC) için kalıcı bir engel oluşturmaktadır ve kısıtlanmamış NL→DSL üretimi güvensiz ya da aşırı kapsamlı sorgulara yol açma riski taşımaktadır. Bu çalışma, çok sağlayıcılı büyük dil modellerini (yerel ve bulut) şema farkındalıklı istemlerle, JSON-Schema tabanlı filtreleme ile ve alan beyaz listelerini, zamansal sınırları ve maliyet limitlerini uygulayan çok katmanlı bir doğrulayıcıyla birleştiren ES-NL2DSL adlı kısıtlı üretim çerçevesini sunmaktadır. Ek bir güvenlik katmanı, düşmanca istem filtreleme işlevi görerek belirsiz veya riskli girdilerde çekimser kalmakta, canlı yürütme kontrolleri ise sorgu uygulanabilirliğini doğrulamaktadır. Değerlendirme, standart bir ağ günlükleri dizini ile CIC-IDS2017 veri seti üzerinde, yaygın SOC görevlerini kapsayan 12 senaryoluk bir test bankası aracılığıyla gerçekleştirilmiştir. Çalışmada geliştirilmiş kısıtlı yöntem, kurala dayalı ve sıfır-atış (zero-shot) yaklaşımlarla karşılaştırılmıştır; karşılaştırma, yapısal metrikler (AST benzerliği) ve yürütme metrikleri (Jaccard, kesinlik/geri çağırma/F1), güvenlik metrikleri (doğrulayıcı geçiş oranı, reddetme taksonomisi, düşmanca engelleme oranı) ve performans metrikleri (gecikme, ilk denemede başarı, yeniden deneme sayısı) üzerinden yapılmıştır. Dayanıklılık, alan yeniden adlandırmaları yoluyla şema kayması altında incelenmiş, gizlilik–yarar dengesi ise sayısal özelliklere ve zaman damgalarına uygulanan diferansiyel gizlilik (DP, ε-ızgara) aracılığıyla değerlendirilmiştir. Sonuçlar, kısıtlı üretimin yürütme doğruluğunu ve doğrulayıcı geçiş oranını sürekli olarak iyileştirdiğini, düşmanca filtrelemenin kötü niyetli istemlerin büyük çoğunluğunu düşük yanlış pozitif oranıyla engellediğini, şema kaymasının ölçülebilir fakat yönetilebilir bir bozulmaya yol açtığını ve gizlilik–yarar eğrisinin beklendiği gibi davrandığını (daha güçlü gizlilik, daha düşük yarar sağlamaktadır) göstermektedir. Hibrit yerel/bulut kurulumu, gecikme, maliyet ve doğruluk arasında öngörülebilir takaslar sunmaktadır. Tüm yapılar—haritalamalar, kurallar, istemler, altın standart ve betikler—yeniden üretilebilirlik amacıyla paylaşılmakta, ES-NL2DSL'i siber güvenlik analitiği için doğal dil sorgu üretiminde açık ve güvenlik-öncelikli bir yaklaşım olarak konumlandırmaktadır.
Özet (Çeviri)
This thesis addresses the problem of translating natural-language (NL) investigative intents into safe, effective Elasticsearch DSL for cybersecurity log analysis. Writing correct DSL under operational constraints (time windows, field types, cost limits) is a persistent barrier in SOCs, and unconstrained NL→DSL generation risks unsafe or over-broad queries. This work presents ES-NL2DSL, a constrained generation framework that combines multi-provider LLMs (local and cloud) with schema-aware prompting, JSON-Schema gating, and a multi-layer validator that enforces field whitelists, temporal bounds, and cost caps. A security layer performs adversarial prompt filtering with abstention on ambiguous or risky inputs, and live execution checks verify query viability. The evaluation spans a standard network-log index and the CIC-IDS2017 dataset, using a 12-scenario test bank covering common SOC tasks. The study compares an enhanced constrained method against rules-based and zero-shot baselines across structural (AST similarity) and execution metrics (Jaccard, precision/recall/F1), safety metrics (validator pass-rate, reject taxonomy, adversarial block-rate), and performance metrics (latency, first-pass success, retries). Robustness is assessed under schema drift via field renaming, and privacy–utility is studied with DP (ε-grid) applied to numeric features and timestamp jitter. Results show that constrained generation consistently improves execution accuracy and validator pass-rate over baselines, the adversarial filter blocks the vast majority of malicious prompts with low false positives, schema drift causes measurable but manageable degradation, and the privacy–utility curve behaves as expected (stronger privacy yields lower utility). A hybrid local/cloud setup trades latency, cost, and accuracy in predictable ways. All artifacts—mappings, rules, prompts, ground truth, and scripts—are released for reproducibility, positioning ES-NL2DSL as an open, security-first approach to NL query generation for cybersecurity analytics.
Benzer Tezler
- Applications of artificial intelligence for the security of networks
Ağ güvenliği için yapay zeka uygulamalari
SELEN GEÇGEL ÇETİN
Doktora
İngilizce
2025
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
PROF. DR. GÜNEŞ ZEYNEP KARABULUT KURT
- Next generation security operation center
Yeni nesil güvenlik operasyon merkezi
BARIŞ KARAAĞAÇ
Yüksek Lisans
İngilizce
2024
Mühendislik BilimleriBahçeşehir ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SELİN NACAKLI
- A novel artificial intelligence approach to strengthen intrusion detection system for internet of medical things
Medikal nesnelerin interneti için ağa sızmayı algılama sistemini güçlendirmeye yönelik yeni bir yapay zeka yaklaşımı
GÖKHAN AKAR
Doktora
İngilizce
2025
Elektrik ve Elektronik MühendisliğiMarmara ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. MUSTAFA ONAT
DOÇ. DR. ÜNAL ÇAVUŞOĞLU
- Kamuya açık büyük dil modelleri ile bağlam duyarlı siber risk değerlendirmesi: Uzman doğrulamalı bir çerçeve ve insan–yapay zekâ karşılaştırması
LLM-assisted context-aware cyber risk assessment: an expert-calibrated framework and scoring
NEZİH MAHMUT ÜNAL
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolIşık ÜniversitesiBilgisayar Ana Bilim Dalı
DR. ÖĞR. ÜYESİ BARIŞ ÇELİKTAŞ
- Yapay zeka tabanlı davranışsal veri analizi ile siber güvenlik tehditlerin önlenmesi
Preventing cybersecurity threats with artificial intelligence-based behavioral data analysis
MUHAMMED İKBAL KARADELİ
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
PROF. DR. NİHAN KAHRAMAN