Behavioral classification of malware via windows api call sequences using large language models
Büyük dıl modellerı kullanarak wındows apı çağrı dızılerıyle kötü amaçlı yazılımların davranışsal sınıflandırması
- Tez No: 972467
- Danışmanlar: DR. FEYZULLAH ORÇUN ÇETİN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Sabancı Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Siber Güvenlik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Kötü amaçlı yazılımların artan ölçeği, karmaşıklığı ve otomasyonu, küresel siber güvenliğe ciddi bir tehdit oluşturmaktadır. 2024 itibariyle, dünya çapında 6,2 mil- yardan fazla kötü amaçlı yazılım enfeksiyonu tespit edilmiş olup, bu rakamın 2025 yılına kadar 6,5 milyara ulaşacağı tahmin edilmektedir. Siber güvenlik sistemleri her gün yaklaşık 560.000 yeni tehdit tespit etmektedir ve bu da modern siber suçların endüstriyel ölçeğini yansıtmaktadır. Bu bağlamda, kötü amaçlı yazılım- ların yürütme sırasındaki davranışlarını anlamak, etkili tespit ve sınıflandırma için çok önemlidir. Dinamik analiz teknikleri arasında, bir program ile kurban ortamı arasındaki etkileşimleri yakalayan API çağrılarının izlenmesi, kötü amaçlı yazılım- ların temel davranış kalıpları hakkında değerli bilgiler sunar. Ancak, bu uzun, kar- maşık ve genellikle gürültülü dizileri modellemek önemli bir zorluk teşkil etmektedir. Bu sorunu çözmek için, uzun, sıralı verileri işlemekte üstün olan, doğal dil işleme için geliştirilmiş Büyük Dil Modellerinin (LLM) kullanımını araştırıyoruz. Uzun giriş pencereleri üzerinden bağlamsal kalıpları öğrenme kapasiteleri, onları davranış tabanlı kötü amaçlı yazılım sınıflandırması için umut verici bir araç haline getiriyor. Bu tez, modern Windows sistemlerinden elde edilen dinamik yürütme izlerini kul- lanarak davranış tabanlı kötü amaçlı yazılım sınıflandırması için ince ayarlı büyük dil modellerinin (LLM'ler) kullanımını araştırmaktadır. Geleneksel statik analiz teknikleri sınırlamalarla karşı karşıya kaldığından, dinamik analiz daha dayanıklı bir alternatif olarak ortaya çıkmıştır. Ancak, API çağrı dizilerini modellemek, sıralı karmaşıklıkları ve kötü amaçlı yazılım türleri arasındaki davranışsal örtüşmeler ne- deniyle zorlu olmaya devam etmektedir. Çalışmamızda, mevcut kamuya açık depolardan seçilen ve API çağrı izlerini çıkar- mak için Windows 10 sanal ortamında çalıştırılan 10.371 Windows taşınabilir yürütülebilir (PE) kötü amaçlı yazılım örneğinden oluşan dengeli bir veri kümesi oluşturduk. Her örnek, dokuz davranış tanımlı kötü amaçlı yazılım türünden biriyle etiketlendi, böylece çalışma zamanı davranışına dayalı denetimli çok sınıflı sınıflandırma mümkün oldu. Bu izleri metin dizileri olarak kullandık ve iki ince ayar aşaması gerçekleştirdik. İlk aşama, 4k'dan başlayıp 8k ve 16k'ya kadar artan ve 32k token'a kadar uzanan bir dizi bağlam uzunluğu boyunca dört açık kaynaklı LLM'nin (Llama-3.1-8B, Mistral-7B v0.3, Qwen3-8B ve GLM-4-9B-0414) ince ayarını içeriyor. İkinci aşamada, ilk ince ayar aşamasından en iyi performans gösteren model ve bağlam uzunluğu kombinasyonunu seçtik ve performansı daha da optimize etmek için daha yoğun hesaplama gerektiren ince ayar işlemine tabi tuttuk. İlk aşamada, Mistral-7B-v0.3, Llama-3.1-8B ve Qwen3-8B olmak üzere üç model, sınıflandırma görevini yerine getirme kapasitesini gösterdi. Bağlam uzunluğu açısın- dan, Mistral-8B-v0.3 ve Llama-3.1-8B modelleri, alternatif eğitim uzunluklarına kıyasla 8k bağlam uzunluğunda üstün performans gösterdi. Öte yandan, Qwen3- 8B modeli 8k ve 16k bağlam uzunluklarında en iyi sonuçları verdi ve eşdeğer sonuçlar elde etti. Modellerin ilk aşamadaki en iyi performanslarının karşılaştırıl- ması, Mistral-7B-v0.3'ün %84,1 ile en yüksek genel doğruluğu elde ettiğini, onu %79,1 ile Llama-3.1-8B ve %74,4 ile Qwen3-8B'nin izlediğini ortaya koydu. En iyi performans gösteren model olan Mistral-7B-v0.3'ün ikinci aşamadaki ince ayarları, performansın daha da artmasını sağladı ve nihai model %88,7 doğruluk, makro ve ağırlıklı F1 puanları sırasıyla 0,886 ve 0,887 olarak gerçekleşti. Flooder, Crypto-miner ve Ransomware gibi belirgin ve yüksek hacimli davranışlara sahip kötü amaçlı yazılım ailelerinde özellikle güçlü sonuçlar gösterdi. Öte yandan, genellikle örtüşen veya daha ince API çağrı kalıpları sergileyen Adware, Spyware ve Dropper gibi aileler için sınıflandırma doğruluğu daha düşüktü. Bu bulgular, API çağrı izlerinden zengin davranış kalıplarını öğrenmede modern LLM'lerin etkinliğini vurgulamakta ve davranışsal kötü amaçlı yazılım sınıflandır- masına ölçeklenebilir ve özellik içermeyen bir yaklaşım sunmaktadır.
Özet (Çeviri)
The growing scale, sophistication, and automation of malicious software pose a crit- ical challenge to global cybersecurity. As of 2024, over 6.2 billion malware infections were detected worldwide, with projections reaching 6.5 billion by 2025. Every day, cybersecurity systems detect approximately 560,000 new threats, reflecting the in- dustrial scale of modern cybercrime. In this context, understanding the behavior of malware during execution becomes essential for effective detection and classifi- cation. Among dynamic analysis techniques, tracing API calls, which captures the interactions between a program and the victim environment, offers valuable insights into the underlying behavioral patterns of malware. However, modeling these long, complex, and often noisy sequences presents a significant challenge. To address this, we explore the use of Large Language Models (LLMs) originally developed for nat- ural language processing, as they excel at processing long, sequential data. Their capacity to learn contextual patterns over extended input windows makes them a promising tool for behavior-based malware classification. This thesis explores the use of fine-tuned LLMs for behavior-based malware classi- fication using dynamic execution traces from modern Windows systems. As tradi- tional static analysis techniques face limitations, dynamic analysis has emerged as a more resilient alternative. However, modeling API call sequences remains chal- lenging due to their sequential complexity and behavioral overlap between malware types. In our study, we constructed a balanced dataset of 10,371 Windows portable ex- ecutable (PE) malware samples, selected from existing public repositories and ex- ecuted in a Windows 10 sandbox environment to extract API call traces. Each sample was labeled with one of nine behavior-defined malware types, enabling su- pervised multi-class classification based on runtime behavior. We used these traces as textual sequences and performed two fine-tuning stages. First stage includes fine- tuning of four open-source LLMs, Llama-3.1-8B, Mistral-7B v0.3, Qwen3-8B, and GLM-4-9B-0414, across a range of context lengths, starting from 4k and increasing through 8k and 16k, all the way to 32k tokens. At the second stage, we selected the best-performing model and context length combination from the initial fine-tuning phase and subjected it to more compute-intensive fine-tuning to further optimize performance. In the initial phase, three models, Mistral-7B-v0.3, Llama-3.1-8B, and Qwen3-8B demonstrated the capacity to acquire the classification task. With regard to context length, the Mistral-8B-v0.3 and Llama-3.1-8B models demonstrated superior per- formance with an 8k context length in comparison to alternative training lengths. Meanwhile, the Qwen3-8B model produced its best results with 8k and 16k context lengths, yielding equivalent outcomes. A comparison of the models' best perfor- mances in the first stage reveals that Mistral-7B-v0.3 achieved the highest overall accuracy of 84.1%, followed by Llama-3.1-8B with 79.1% and Qwen3-8B with 74.4%, respectively. The second stage fine-tuning of the best-performing model Mistral-7B-v0.3 led to further performance gains, with the final model achieving 88.7% accuracy, and macro and weighted F1-scores of 0.886 and 0.887, respectively. It showed particularly strong results on malware families with distinct and high-volume behaviors, such as Flooder, Crypto-miner, and Ransomware. Meanwhile, classification accuracy was more modest for families like Adware, Spyware, and Dropper, which often exhibit overlapping or subtler API call patterns. These findings highlight the effectiveness of modern LLMs in learning rich behav- ioral patterns from API call traces, offering a scalable and feature-free approach to behavioral malware classification.
Benzer Tezler
- A hybrıd approach for ransomware detectıon based on behavıoral and structural features
Davranışsal ve yapısal özelliklere dayalı hibrit bir fidye yazılımı tespit yaklaşımı
BÜŞRA ÇALIŞKAN
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. ABDÜL HALİM ZAİM
- Behavior based malicious software detection and classification
Davranış tabanlı zararlı yazılım tespiti ve sınıflandırılması
ABDURRAHMAN PEKTAŞ
Yüksek Lisans
İngilizce
2012
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGalatasaray ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. TANKUT ACARMAN
- Modeling human smartphone usage pattern via generative adversarial networks for sandboxes
Kum sandığı için çekişmeli üretici ağlar ile akıllı telefon kullanım kalıplarının modellenmesi
EZGİ GÜCÜYENER
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MEHMET AMAÇ GÜVENSAN
- Automated detection and classification of malware used in targeted attacks via machine learning
Hedefli saldırılarda kullanılan zararlı yazılımların makine öğrenimi kullanılarak tespiti ve sınıflandırılması
YAKUP KORKMAZ
Yüksek Lisans
İngilizce
2015
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. İBRAHİM KÖRPEOĞLU
- Infostealer Malware'in davranışsal özellikleri ile makine öğrenmesi tabanlı sınıflandırma
Behavioral characteristics-based classification of infostealer malware using machine learning
ÖMER TARHAN
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSelçuk ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HUMAR KAHRAMANLI ÖRNEK