Büyük dil modelleri ile yazılan kaynak kodların güvenlik analizi: Bankacılık sektörü uygulaması
Security analysis of source codes written by large language models: An application to the banking industry
- Tez No: 1015931
- Danışmanlar: YRD. DOÇ. DR. MELTEM KURT PEHLİVANOĞLU
- Tez Türü: Yüksek Lisans
- Konular: Bankacılık, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Banking, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Elektronik bankacılık, Mimari yazılımlar, Electronic banking, Architectural softwares
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Kocaeli Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Yapay zekâ tabanlı büyük dil modelleri (BDM'ler), yazılım geliştirme süreçlerinde otomatik kod üretimini mümkün kılan yeni bir paradigma oluşturarak sektörde önemli bir dönüşümü hızlandırmıştır. Bununla birlikte, bu modellerin ürettiği kodların güvenlik, bakım yapılabilirlik ve yazılım kalitesi açısından sistematik olarak değerlendirilmesine yönelik çalışmalar literatürde sınırlı kalmaktadır. Bu tez çalışması, literatürdeki çalışmalardan farklı olarak, bankacılık sektörüne özgü senaryoları temel alarak beş farklı BDM ailesine (OpenAI, Anthropic, Cohere, xAI ve DeepSeek) ait dokuz modelin C# dilinde kaynak kod üretim performansını kapsamlı ve çok boyutlu bir çerçevede incelemektedir. Özgün katkılar olarak; (i) kurumsal üç katmanlı mimari için özel olarak tasarlanmış CodeSecurity platformu geliştirilmiş, (ii) altı bankacılık senaryo kümesi ve otuz kullanıcı ekranını kapsayan özgün bir senaryo/deney seti oluşturulmuş, (iii) SAST tabanlı çok boyutlu değerlendirme çerçevesi tasarlanmış ve (iv) model aileleri arasında güvenlik ve kalite performanslarının karşılaştırmalı analizi gerçekleştirilmiştir. Çalışma kapsamında geliştirilen CodeSecurity platformu kullanılarak BDM'ler tarafından üretilen kaynak kodları kurumsal yazılımlarda yaygın olarak kullanılan üç katmanlı mimariye (Veri, İş, Sunum) uygun biçimde üretilmiştir. Üretilen kodlar Statik Uygulama Güvenlik Testi (SAST) analiz süreçlerinden geçirilerek değerlendirilmiştir. Altı bankacılık senaryo kümesi ve otuz kullanıcı ekranını kapsayan deneysel tasarımda, ilgili modeller tarafından üretilen kodlar; güvenlik, güvenilirlik, bakım yapılabilirlik, kod tekrarı, temiz kod göstergeleri, hata seviyeleri ve hata tipleri üzerinden karşılaştırılmıştır. Elde edilen bulgular, BMD ailelerinin kod üretim davranışlarında belirgin farklılıklar bulunduğunu ortaya koymaktadır. Deneysel sonuçlara göre xAI model ailesi SAST güvenlik bulguları açısından en düşük bulgu yoğunluğunu sergilerken, DeepSeek maliyet etkinliği ve bakım yapılabilirlik parametrelerinde öne çıkmaktadır. Anthropic ve Cohere model aileleri kod kalitesi ve güvenlik arasında dengeli bir profil çizerken, OpenAI modellerinin diğer model ailelerine kıyasla daha yüksek güvenlik bulgusu ve hata yoğunluğuna sahip olduğu gözlemlenmiştir. Sonuç olarak bu çalışma; (i) BDM temelli yazılım geliştirme süreçlerinin güvenlik ve mühendislik kalitesi boyutlarının ölçülebilir ve karşılaştırılabilir olduğunu göstermekte, (ii) bankacılık sektörü için BDM seçim kriterlerinin belirlenmesine temel oluşturmakta ve (iii) insan tarafından yazılmış kodlar ile yapay zekâ tarafından üretilen kodların gelecekteki karşılaştırmalı incelemeleri için yeniden kullanılabilir bir deneysel çerçeve sunmaktadır.
Özet (Çeviri)
Artificial intelligence-based large language models (LLMs) have accelerated a major transformation in the software industry by enabling automated code generation as a new paradigm in software development processes. However, studies that systematically evaluate the security, maintainability, and overall software quality of LLM-generated code remain limited in the literature. This thesis, unlike existing works in the literature, examines the source code generation performance of nine models from five different LLM families (OpenAI, Anthropic, Cohere, xAI, and DeepSeek) in the C# programming language, based on banking-sector-specific scenarios, within a comprehensive and multidimensional framework. The original contributions of this study are as follows: (i) the CodeSecurity platform was developed specifically for an enterprise three-tier architecture, (ii) an original scenario/experimental dataset covering six banking scenario clusters and thirty user interfaces was created, (iii) a multi-dimensional SAST-based evaluation framework was designed, and (iv) a comprehensive comparative analysis of security and quality performance across model families was conducted. Using the CodeSecurity platform, the source code generated by LLMs was produced in compliance with the three-tier architecture (Data, Business, Presentation) commonly adopted in enterprise software. The generated code was evaluated through Static Application Security Testing (SAST) analysis processes. Within an experimental design comprising six banking scenario clusters and thirty user interfaces, the code produced by the models was compared across security, reliability, maintainability, code duplication, clean code indicators, error severity levels, and error types. The findings reveal pronounced differences in the code-generation behaviors of major LLM families. According to the experimental results, the xAI model family exhibits the lowest SAST security finding density, while DeepSeek stands out in terms of cost-effectiveness and maintainability. The Anthropic and Cohere model families demonstrate a balanced profile between code quality and security, whereas the OpenAI models are observed to have higher densities of security findings and errors compared to other model families. This study (i) demonstrates that LLM-based software development processes can be measured and compared not only in terms of productivity but also across security and engineering-quality dimensions, (ii) provides a basis for defining model selection criteria for the banking sector, and (iii) presents a reusable experimental framework for future comparative studies between human-written code and AI-generated code.
Benzer Tezler
- Obfuscated JavaScript detection using syntactically and lexically enhanced machine learning
Perdelenmiş JavaScript kodlarının sözdizimsel ve anlamsal yönden iyileştirilmiş makina öğrenmesi ile tespiti
EREN KILIÇ
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MEHMET TAHİR SANDIKKAYA
- Türkçe finans alanına özgü bilgi grafı inşası için çok aşamalı bilgi çıkarımı ve denetlenebilir operasyon planlama
Multi-stage information extraction and auditable operation planning for constructing a turkish finance domain-specific knowledge graph
ABDULLAH RAUF ŞİMŞEK
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
DOÇ. DR. AHMET CÜNEYD TANTUĞ
- A decolonial analysis of urban and regional planning education in the global south
Küresel güney ülkelerinde şehir ve bölge planlama eğitiminin dekolonyal bir analizi
İPEK ŞEN
Doktora
İngilizce
2024
Şehircilik ve Bölge Planlamaİstanbul Teknik ÜniversitesiŞehir ve Bölge Planlama Ana Bilim Dalı
PROF. DR. TURGAY KEREM KORAMAZ
- Fake news classification using machine learning and deep learning approaches
Makine öğrenimi ve derin öğrenme yaklaşımlarını kullanarak sahte haber sınıflandırması
SAJA ABDULHALEEM MAHMOOD AL-OBAIDI
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ TUBA ÇAĞLIKANTAR
- Essays on estimation methods
Tahmin yöntemleri üzerine makaleler
YASİN KÜTÜK
Doktora
İngilizce
2019
Ekonomiİstanbul Teknik Üniversitesiİktisat Ana Bilim Dalı
PROF. DR. BÜLENT GÜLOĞLU