Mitigating vulnerability leakage from llms for secure code analysis
Güvenli kod analizi için büyük dil modellerinden kaynaklanan zafiyet sızıntısının azaltılması
- Tez No: 967832
- Danışmanlar: PROF. CEMAL YILMAZ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Sabancı Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Büyük Dil Modelleri (LLM'ler), yazılım geliştirme süreçlerinde giderek daha fazla kullanılarak kod analizi, hata ayıklama ve güvenlik açığı tespiti gibi alanlarda oldukça fazla destek sağlamaktadır. Ancak özellikle hassas kodların bu sistemlerle paylaşılması durumunda, bu modellerin kaynak kodlardaki güvenlik açıklarını ifşa etme ihtimali ve istenmeyen bilgi sızıntılarına yol açabileceği endişeleri göz ardı edilmemelidir. Bu tez, söz konusu bilgi sızıntısını azaltmaya yönelik savunma stratejilerini sunmaktadır: geleneksel obfüskasyon (karmaşıklaştırma) teknikleri ve bal küpü (honeypot) güvenlik açıklarını içeren yenilikçi, aldatmaya dayalı bir yaklaşım. Çalışma kapsamında, 51 farklı CWE kategorisini kapsayan 400 C ve Python kod parçasından oluşan bir veri kümesi oluşturulmuş ve üç güncel LLM (GPT-4o, GPT-4o-mini ve LLaMA-4)'in güvenlik açığı tespit performansları bu kodların üzerinde değerlendirilmiştir. İlk olarak sekiz farklı obfüskasyon yöntemi uygulanarak, bunların LLM'lerin tespit doğruluğu ve işlevselliğin korunması üzerindeki etkileri ölçülmüştür. Sonuçlar, ölü kod ekleme ve kontrol akışı obfüskasyonunun güvenlik açığı sızıntısını engellemede en etkili yöntemler olduğunu; ancak tam şifreleme gibi agresif tekniklerin, kodun işlevselliğinin anlaşılmasını olumsuz etkilediğini göstermiştir. İlk aşamada elde edilen sonuçlar doğrultusunda, başarılı olan obfüskasyonlar diğer yanıltıcı stratejilerle birleştirilerek, bal küpü güvenlik açıkları kodlara eklenmiştir. Bu aşamada birinci fazda etkili olduğu kanıtlanan kontrol akışı obfüskasyonu, veri akışı obfüskasyonu ve tanımlayıcı yeniden adlandırma tekniklerinin yanı sıra, siklomatik karmaşıklığın artırılması ve yanıltıcı yorumlar gibi yeni yöntemler de uygulanmıştır. Elde edilen bulgular, bal küplerinin bazı durumlarda güvenlik açığı tespit doğruluğunu yüzde 60'tan fazla azalttığını; buna karşın kodun işlevselliğinin büyük ölçüde korunduğunu ortaya koymuştur. Ayrıca, yanıltıcı yorumlar tüm modellerde hafif fakat etkili bir savunma yöntemi olarak öne çıkmıştır. Bu bulgular, yapay zekâ destekli yazılım geliştirme süreçlerinde güvenlik ve kullanılabilirlik arasında bir denge kurulması gerekliliğini vurgulamakta; ayrıca benzer tekniklerin otomatik denetimlerden kötü niyetli açıkları gizlemek amacıyla kötüye kullanılabileceğine dair etik kaygılara dikkat çekmektedir.
Özet (Çeviri)
Large Language Models (LLMs) are increasingly integrated into software development workflows, offering powerful capabilities for code analysis, debugging, and vulnerability detection. However, their ability to infer and expose vulnerabilities in source code raises security concerns, particularly regarding unintended information leakage when sensitive code is shared with these models. This thesis investigates defense strategies to mitigate such leakage: traditional obfuscation techniques and a novel deception-based approach involving honeypot vulnerabilities. We constructed a dataset of 400 C and Python code snippets spanning 51 CWE categories and evaluated their vulnerability detection performance across three state-of-the-art LLMs: GPT-4o, GPT-4o-mini, and LLaMA-4. Firstly, we applied obfuscation methods—including comment removal, identifier renaming, control/data flow transformations, dead code insertion, full encoding, and LLM-based rewriting—and measured their impact on LLM detection accuracy and functionality retention. Dead code insertion and control flow obfuscation proved most effective in suppressing vulnerability leakage, though aggressive techniques like encoding impaired functionality comprehension. Secondly, we introduced honeypot vulnerabilities combined with misleading strategies that were proven effective earlier—such as control flow obfuscation, data flow obfuscation, and identifier renaming—and additional techniques like cyclomatic complexity increases and misleading comments. Honeypots significantly reduced vulnerability detection accuracy by over 60 percentage points in some cases, while maintaining high functional clarity, with LLM-generated similarity scores consistently above 4.1 on a 5-point scale. Misleading comments emerged as a lightweight yet robust defense across all models. These findings underscore the need to balance security and usability in AI-assisted development and highlight ethical considerations, as similar techniques could potentially be misused to conceal malicious flaws from automated audits.
Benzer Tezler
- Ekseni salınım eksenine paralel olarak salınım yapan dairesel kesitli borularda ısı transferinin deneysel olarak incelenmesi
Başlık çevirisi yok
HASAN GÜL
Yüksek Lisans
Türkçe
1987
Makine MühendisliğiKaradeniz Teknik ÜniversitesiMakine Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. TEOMAN AYHAN
- Ağaçişleri-mobilya endüstrisinde seri üretim hatlarının oluşturulmasına ilişkin araştırmalar
Başlık çevirisi yok
İBRAHİM BAYKAN
Yüksek Lisans
Türkçe
1988
Ağaç İşleriHacettepe ÜniversitesiAğaç İşleri Endüstri Mühendisliği Ana Bilim Dalı
PROF. DR. RIFAT İLHAN
- Türk milli eğitim sisteminde ödül kavramı ve yılın öğretmeni ödülü
Başlık çevirisi yok
ESERGÜL BALCI
Doktora
Türkçe
1988
Eğitim ve ÖğretimHacettepe ÜniversitesiEğitim Yönetimi, Teftişi, Planlaması ve Ekonomisi Ana Bilim Dalı
PROF. DR. İLHAN AKHUN
- Tanıtım kampanyalarında afiş tasarımının yeri ve önemi afiş tasarımları
Başlık çevirisi yok
OĞUZ USTA
Yüksek Lisans
Türkçe
1989
Güzel SanatlarHacettepe ÜniversitesiUygulamalı Sanatlar Ana Bilim Dalı
DOÇ. HÜSEYİN BİLGİN