Code vulnerability detection across different programming languages with AI models
Yapay zekâ modelleri ile farklı programlama dilleri arasında kod güvenlik açığı tespit
- Tez No: 1014970
- Danışmanlar: PROF. DR. FERDİ SÖNMEZ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Computer Engineering and Computer Science and Control, Science and Technology
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İstanbul Aydın Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Yapay Zeka ve Veri Bilimi Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Farklı programlama dillerinde yazılmış kaynak kodlarda güvenlik açıklarını tespit etmek önemli olmakla birlikte oldukça zordur. Kural tabanlı desenler, geleneksel statik analiz yöntemlerinin bağlama bağımlı, karmaşık hataları bulmasını zorlaştırmakta ve çok sayıda yanlış pozitif sonuca yol açmaktadır. Bu tez, özellikle dönüştürücü (transformer) tabanlı kod dil modelleri olmak üzere, yeni nesil yapay zeka modellerinin çok dilli yazılmış kodlardaki güvenlik açıklarını tespit etmede nasıl kullanılabileceğini ele almaktadır. Literatürdeki güncel araştırmalar ve yaklaşımlar incelenmekte; CodeBERT ve CodeLlama gibi modellerin çeşitli kod güvenlik açığı veri kümeleri üzerinde nasıl eğitilebileceği gösterilmekte ve performansları değerlendirilmektedir. Çalışmada, farklı programlama dillerinden elde edilen veri kümeleri analiz edilip standartlaştırılmış, önceden eğitilmiş modeller güvenlik açıklarını sınıflandıracak şekilde ince ayara tabi tutulmuş, ardından topluluk (ensemble) yöntemleri ve açıklanabilir yapay zeka (XAI) teknikleri entegre edilmiştir. Deneysel sonuçlar, hassas şekilde ayarlanmış bir CodeBERT modelinin %97'nin üzerinde doğrulukla güvenlik açığı tespiti yapabildiğini göstermiştir; bu da pek çok geleneksel statik analiz aracının ötesinde bir başarıdır. Ayrıca, literatürde öne çıkan bazı önemli bulgulara da yer verilmiştir. Büyük dil modelleri (LLM'ler) yüksek geri çağırma oranlarına ulaşabilmekte (bazı durumlarda neredeyse %100), ancak genellikle doğrulukta düşüş gözlemlenmektedir. Doğrulama süreçlerinin entegre edilmesi veya birden fazla modelin hibrit bir yapıda birleştirilmesi, yanlış pozitif oranını önemli ölçüde azaltabilmektedir. Yapay zeka tabanlı çözümlerin farklı programlama dillerine ve güvenlik açığı türlerine karşı daha etkin hale getirilebileceği gösterilmiştir. Bununla birlikte, bu çözümleri dayanıklı, anlaşılır ve gerçek dünya uygulamalarında kullanılabilir hale getirmek halen zorluk teşkil etmektedir. Bu tez, yapay zekanın güvenlik açıklarını tespit etmede nasıl kullanılabileceğini ayrıntılı olarak incelemekte; bu çözümlerin doğruluğunu artırma, açıklanabilirliğini sağlama ve gerçek dünyada uygulanabilirliğini geliştirme yollarını tartışmaktadır.
Özet (Çeviri)
It is important yet hard to find security weaknesses in source code that was created in more than one programming language. Rule-based patterns make it hard for traditional static analysis methods to find complex, context-dependent bugs and give a lot of false positives. This thesis talks about how new AI models, especially transformer-based code language models, can help detect code flaws in code written in diverse languages. We talk about some new research and methods, illustrate how to train AI models like CodeBERT and CodeLlama on different code vulnerability datasets, and then check how well they operate. We get datasets from diverse programming languages, break down and standardize the code, fine-tune pre-trained models to sort vulnerabilities, and integrate ensemble and explainable AI methodologies. Experiments reveal that a highly tuned CodeBERT model might detect vulnerabilities with an accuracy of over 97%, which is better than what many static analyzers can do. We also look at some crucial things that have been found in the literature when it comes to discovering vulnerabilities, large language models (LLMs) have very high recall (almost 100% in some circumstances), but they typically lose accuracy. Adding verification processes or combining several models into a hybrid framework can drastically cut down on false positives. Some of the most important findings are that AI-based solutions can function better with more programming languages and types of vulnerabilities. However, it is still hard to make them strong, easy to comprehend, and usable in the real world. This thesis goes into great detail about how AI may be used to uncover code flaws and how to make these solutions more accurate, easy to comprehend, and useful in the real world in the future.
Benzer Tezler
- Uzaktan denetim sistemlerinin veri bağlantı kontrolü
Başlık çevirisi yok
KAAN ERKAN
Yüksek Lisans
Türkçe
1996
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiDOÇ.DR. BÜLENT ÖRENCİK
- Predicting software vulnerabilities using topic modeling with issues
Konu modelleme yöntemi ile yazılım güvenlik açıklarını tahmin etme
FATMA GÜL BULUT
Yüksek Lisans
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesiİletişim Sistemleri Ana Bilim Dalı
DR. ÖĞR. ÜYESİ AYŞE TOSUN
- Mitigating vulnerability leakage from llms for secure code analysis
Güvenli kod analizi için büyük dil modellerinden kaynaklanan zafiyet sızıntısının azaltılması
BENGÜ GÜLAY
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSabancı ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. CEMAL YILMAZ
- Kod güvenliği ve zafiyet tespiti için hibrit derin öğrenme yaklaşımı
A hybrid deep learning approach for code security and vulnerability detection
ABDUL JAFAROV
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDüzce ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. FATİH KAYAALP
- Finansal piyasalarda elektronik risk ve denetimi
Electronic risc and auditing in the financial markets
HASAN ÖZKAN
Yüksek Lisans
Türkçe
2002
BankacılıkMarmara ÜniversitesiSermaye Piyasası ve Borsa Ana Bilim Dalı
YRD. DOÇ. DR. AHMET ÇİLİNGİRTÜRK