Geri Dön

Code vulnerability detection across different programming languages with AI models

Yapay zekâ modelleri ile farklı programlama dilleri arasında kod güvenlik açığı tespit

  1. Tez No: 1014970
  2. Yazar: HAEL ABDULHAKIM ALI HUMRAN
  3. Danışmanlar: PROF. DR. FERDİ SÖNMEZ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Computer Engineering and Computer Science and Control, Science and Technology
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İstanbul Aydın Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Yapay Zeka ve Veri Bilimi Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Farklı programlama dillerinde yazılmış kaynak kodlarda güvenlik açıklarını tespit etmek önemli olmakla birlikte oldukça zordur. Kural tabanlı desenler, geleneksel statik analiz yöntemlerinin bağlama bağımlı, karmaşık hataları bulmasını zorlaştırmakta ve çok sayıda yanlış pozitif sonuca yol açmaktadır. Bu tez, özellikle dönüştürücü (transformer) tabanlı kod dil modelleri olmak üzere, yeni nesil yapay zeka modellerinin çok dilli yazılmış kodlardaki güvenlik açıklarını tespit etmede nasıl kullanılabileceğini ele almaktadır. Literatürdeki güncel araştırmalar ve yaklaşımlar incelenmekte; CodeBERT ve CodeLlama gibi modellerin çeşitli kod güvenlik açığı veri kümeleri üzerinde nasıl eğitilebileceği gösterilmekte ve performansları değerlendirilmektedir. Çalışmada, farklı programlama dillerinden elde edilen veri kümeleri analiz edilip standartlaştırılmış, önceden eğitilmiş modeller güvenlik açıklarını sınıflandıracak şekilde ince ayara tabi tutulmuş, ardından topluluk (ensemble) yöntemleri ve açıklanabilir yapay zeka (XAI) teknikleri entegre edilmiştir. Deneysel sonuçlar, hassas şekilde ayarlanmış bir CodeBERT modelinin %97'nin üzerinde doğrulukla güvenlik açığı tespiti yapabildiğini göstermiştir; bu da pek çok geleneksel statik analiz aracının ötesinde bir başarıdır. Ayrıca, literatürde öne çıkan bazı önemli bulgulara da yer verilmiştir. Büyük dil modelleri (LLM'ler) yüksek geri çağırma oranlarına ulaşabilmekte (bazı durumlarda neredeyse %100), ancak genellikle doğrulukta düşüş gözlemlenmektedir. Doğrulama süreçlerinin entegre edilmesi veya birden fazla modelin hibrit bir yapıda birleştirilmesi, yanlış pozitif oranını önemli ölçüde azaltabilmektedir. Yapay zeka tabanlı çözümlerin farklı programlama dillerine ve güvenlik açığı türlerine karşı daha etkin hale getirilebileceği gösterilmiştir. Bununla birlikte, bu çözümleri dayanıklı, anlaşılır ve gerçek dünya uygulamalarında kullanılabilir hale getirmek halen zorluk teşkil etmektedir. Bu tez, yapay zekanın güvenlik açıklarını tespit etmede nasıl kullanılabileceğini ayrıntılı olarak incelemekte; bu çözümlerin doğruluğunu artırma, açıklanabilirliğini sağlama ve gerçek dünyada uygulanabilirliğini geliştirme yollarını tartışmaktadır.

Özet (Çeviri)

It is important yet hard to find security weaknesses in source code that was created in more than one programming language. Rule-based patterns make it hard for traditional static analysis methods to find complex, context-dependent bugs and give a lot of false positives. This thesis talks about how new AI models, especially transformer-based code language models, can help detect code flaws in code written in diverse languages. We talk about some new research and methods, illustrate how to train AI models like CodeBERT and CodeLlama on different code vulnerability datasets, and then check how well they operate. We get datasets from diverse programming languages, break down and standardize the code, fine-tune pre-trained models to sort vulnerabilities, and integrate ensemble and explainable AI methodologies. Experiments reveal that a highly tuned CodeBERT model might detect vulnerabilities with an accuracy of over 97%, which is better than what many static analyzers can do. We also look at some crucial things that have been found in the literature when it comes to discovering vulnerabilities, large language models (LLMs) have very high recall (almost 100% in some circumstances), but they typically lose accuracy. Adding verification processes or combining several models into a hybrid framework can drastically cut down on false positives. Some of the most important findings are that AI-based solutions can function better with more programming languages and types of vulnerabilities. However, it is still hard to make them strong, easy to comprehend, and usable in the real world. This thesis goes into great detail about how AI may be used to uncover code flaws and how to make these solutions more accurate, easy to comprehend, and useful in the real world in the future.

Benzer Tezler

  1. Uzaktan denetim sistemlerinin veri bağlantı kontrolü

    Başlık çevirisi yok

    KAAN ERKAN

    Yüksek Lisans

    Türkçe

    Türkçe

    1996

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    DOÇ.DR. BÜLENT ÖRENCİK

  2. Predicting software vulnerabilities using topic modeling with issues

    Konu modelleme yöntemi ile yazılım güvenlik açıklarını tahmin etme

    FATMA GÜL BULUT

    Yüksek Lisans

    İngilizce

    İngilizce

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    İletişim Sistemleri Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ AYŞE TOSUN

  3. Mitigating vulnerability leakage from llms for secure code analysis

    Güvenli kod analizi için büyük dil modellerinden kaynaklanan zafiyet sızıntısının azaltılması

    BENGÜ GÜLAY

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSabancı Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    PROF. CEMAL YILMAZ

  4. Kod güvenliği ve zafiyet tespiti için hibrit derin öğrenme yaklaşımı

    A hybrid deep learning approach for code security and vulnerability detection

    ABDUL JAFAROV

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDüzce Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. FATİH KAYAALP

  5. Finansal piyasalarda elektronik risk ve denetimi

    Electronic risc and auditing in the financial markets

    HASAN ÖZKAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2002

    BankacılıkMarmara Üniversitesi

    Sermaye Piyasası ve Borsa Ana Bilim Dalı

    YRD. DOÇ. DR. AHMET ÇİLİNGİRTÜRK