Avoiding attacks in wireless communications using reinforcement learning
Pekiştirmeli öğrenme kullanarak kablosuz haberleşmede saldırılardan kaçınma
- Tez No: 1003683
- Danışmanlar: PROF. DR. TÜLAY YILDIRIM
- Tez Türü: Yüksek Lisans
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Elektronik Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Kablosuz haberleşme sistemleri, elektromanyetik spektrumun açık doğası nedeniyle kritik güvenlik zorluklarıyla karşı karşıyadır ve karıştırma (jamming) saldırıları haberleşme erişilebilirliği için önemli tehditler oluşturmaktadır. Frekans Atlamalı Yayılmış Spektrum (FHSS) gibi geleneksel savunma mekanizmaları, akıllı karıştırıcıların öğrenip istismar edebileceği önceden belirlenmiş dizilere dayanmaktadır. Bu tez, durağan olmayan karıştırma saldırılarına karşı uyarlanabilir bir önlem olarak pekiştirmeli öğrenme tabanlı dinamik spektrum erişimini araştırmaktadır. Çalışma, Q-öğrenme çerçevesinde üç temel keşif stratejisinin karşılaştırmalı analizini sunmaktadır: Epsilon-Greedy, Üst Güven Sınırı (UCB) ve Thompson Örneklemesi. Her algoritma, karıştırma örüntülerinin periyodik olarak değiştiği durağan olmayan ortamlar için özel olarak tasarlanmış uyarlama mekanizmalarıyla geliştirilmiştir. Epsilon-Greedy ajanı, karıştırma geçmişine dayalı bilinçli keşif ile örüntü tetiklemeli yeniden başlatma ve üstel azalma kullanmaktadır. UCB ajanı, örüntü değişikliklerinde kısmi sayaç sıfırlama ile keşif katsayısı azalması uygulamaktadır. Thompson Örneklemesi ajanı, zaman dilimi bazlı başarı takibi ile indirimli Beta-Bernoulli sonsal güncellemeleri gerçekleştirmektedir. Deneysel değerlendirme için her 200 bölümde değişen 10 farklı karıştırma örüntüsü içeren 9 × 12 frekans-zaman dilimi ızgarasına sahip bir simülasyon ortamı geliştirilmiştir. Eğitim, zaman dilimi başına 4 karıştırıcı ile 2000 bölüm boyunca gerçekleştirilmiştir. Ardından kolay (3 karıştırıcı), orta (4 karıştırıcı) ve zor (5 karıştırıcı) koşullar altında her biri 1000 bölümlük çapraz senaryo testleri uygulanmıştır. Test sırasında çevrimiçi öğrenme etkinleştirilerek ajanların yeni koşullara uyarlanmaya devam etmesi sağlanmıştır. Deneysel sonuçlar, Thompson Örneklemesinin hem eğitim (%76,2) hem de çapraz senaryo test aşamalarında üstün performans elde ettiğini göstermektedir. Eşleşen test senaryosunda (4 karıştırıcı), Thompson Örneklemesi %62,5 başarı oranına ulaşarak UCB'yi (%35,6) ve Epsilon-Greedy'yi (%32,4) önemli ölçüde geride bırakmıştır. Çapraz senaryo değerlendirmesi, Thompson Örneklemesinin güçlü genelleme kapasitesini ortaya koymuş; kolay, orta ve zor koşullarda sırasıyla %71,3, %62,5 ve %56,7 başarı oranları elde edilmiştir. Kümülatif pişmanlık analizi, Thompson Örneklemesinin üstünlüğünü doğrulamış; alternatiflere kıyasla %40-50 daha düşük toplam pişmanlık ile doğrusal altı pişmanlık artışı sergilemiştir. UCB, zorluk seviyeleri arasında en düşük performans düşüşünü sergilemiştir (kolaydan zora 6,4 yüzde puanı), bu durum en yüksek performans yerine kararlılığa öncelik veren uygulamalar için uygunluğunu göstermektedir. Epsilon-Greedy, uyarlanabilir mekanizmalar kullanmasına rağmen en düşük genel performansı sergilemiştir. Bulgular, Thompson Örneklemesini periyodik örüntü değişikliklerinin ve değişen karıştırma yoğunluklarının olduğu ortamlarda çalışan karıştırma önleme sistemleri için en uygun keşif stratejisi olarak ortaya koymaktadır. Belirsizlik modellemesine Bayesci yaklaşım, açık değişiklik algılama mekanizmaları gerektirmeden doğal uyarlama sağlayarak pratik dağıtım senaryoları için özellikle uygun hale gelmektedir. Bu tez, keşif stratejilerini değerlendirmek için karşılaştırmalı bir çerçeve, durağan olmayan karıştırma için uyarlama mekanizmaları, genelleme kapasitesini değerlendirmek için çapraz senaryo değerlendirme metodolojisi ve dinamik spektrum erişimi uygulamalarında algoritma seçimini destekleyen kapsamlı deneysel kanıtlar sunmaktadır.
Özet (Çeviri)
Wireless communication systems face critical security challenges due to the open nature of the electromagnetic spectrum, with jamming attacks posing significant threats to communication availability. Traditional defense mechanisms such as Frequency Hopping Spread Spectrum (FHSS) rely on predetermined sequences that intelligent jammers can learn and exploit. This thesis investigates reinforcement learning-based dynamic spectrum access as an adaptive countermeasure against non-stationary jamming attacks. The study presents a comparative analysis of three fundamental exploration strategies within a Q-learning framework: Epsilon-Greedy, Upper Confidence Bound (UCB), and Thompson Sampling. Each algorithm is enhanced with adaptation mechanisms specifically designed for non-stationary environments where jamming patterns change periodically. The Epsilon-Greedy agent employs exponential decay with pattern-triggered restart and informed exploration based on jamming history. The UCB agent utilizes exploration coefficient decay with partial count reset upon pattern changes. The Thompson Sampling agent implements discounted Beta-Bernoulli posterior updates with timeslot-specific success tracking. A simulation environment featuring a 9×12 frequency-timeslot grid with 10 distinct jamming patterns changing every 200 episodes was developed for experimental evaluation. Training was conducted over 2000 episodes with 4 jammers per slot, followed by cross-scenario testing with 1000 episodes each under easy (3 jammers), medium (4 jammers), and hard (5 jammers) conditions. Online learning was enabled during testing, allowing agents to continue adapting to new conditions. Experimental results demonstrate that Thompson Sampling achieves superior performance in both training (76.2%) and cross-scenario testing phases. In the matched test scenario (4 jammers), Thompson Sampling achieved 62.5%, significantly outperforming UCB (35.6%) and Epsilon-Greedy (32.4%). Cross-scenario evaluation revealed Thompson Sampling's robust generalization capability, achieving 71.3%, 62.5%, and 56.7% success rates across easy, medium, and hard conditions respectively. Cumulative regret analysis confirmed Thompson Sampling's superiority, exhibiting sublinear regret growth with 40-50% lower total regret compared to alternatives. UCB exhibited the smallest performance degradation across difficulty levels (6.4 percentage points from easy to hard), suggesting suitability for applications prioritizing stability over peak performance. Epsilon-Greedy showed the lowest overall performance despite employing adaptive mechanisms. The findings establish Thompson Sampling as the most suitable exploration strategy for anti-jamming systems operating in environments with periodic pattern changes and varying jamming intensities. The Bayesian approach to uncertainty modeling provides natural adaptation without requiring explicit change detection mechanisms, making it particularly well-suited for practical deployment scenarios.This thesis contributes a comparative framework for evaluating exploration strategies, adaptation mechanisms for non-stationary jamming, a cross-scenario evaluation methodology for assessing generalization capability, and comprehensive experimental evidence supporting algorithm selection in dynamic spectrum access applications.
Benzer Tezler
- Resilient ultra dense networks under UAV coverage for disaster management
Afet yönetiminde İHA'lar ile dayanıklı ultra yoğun ağlar
ELİF BOZKAYA
Doktora
İngilizce
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. BERK CANBERK
- Physical layer techniques for 5G and beyond wireless systems
5G ve ötesi kablosuz sistemler için fiziksel katman teknikleri
ABUU BAKARI KIHERO
Doktora
İngilizce
2024
İletişim Bilimleriİstanbul Medipol ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. HÜSEYİN ARSLAN
- Küreselleşen medya anlayışında, aktüel informasyondan desinformasyona yöneliş sorunu (savaş ve kriz dönemlerinde)
From actual information to disinformation in globalizing media
NURHAYAT YOLOĞLU
- Cyber security awareness policy in small business using machine learning
Makine öğrenimini kullanan küçük işletmelerde siber güvenlik farkındalığı politikası
MUSTAFA KHALID ABDULATEEF AL-GBURI
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş ÜniversitesiElektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ HAKAN KOYUNCU
- Ağ güvenliği ve akıllı saldırılar
Network security and intelligent attacks
GÜZİN MUSAOĞLU
Yüksek Lisans
Türkçe
2004
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKaradeniz Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ.DR. VASİF V. NABİYEV