Geri Dön

Learning-based analysis of pull request–issue alignment with large language models

Büyük dil modelleri ile pull request–ıssue hizalamasının öğrenme tabanlı analizi

  1. Tez No: 1011569
  2. Yazar: MUSTAFA YASİR ALTUNHAN
  3. Danışmanlar: DOÇ. ERAY TÜZÜN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İhsan Doğramacı Bilkent Üniversitesi
  10. Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Yazılım geliştirme süreçlerinde Pull Request (PR) ile ilişkili issue kayıtları arasındaki doğru hizalanma, izlenebilirliğin korunması ve kod kalitesinin sürdürülmesi açısından kritik öneme sahiptir. PR–issue uyumsuzlukları, izlenebilirliğin azalmasına, hata yerelleştirmenin zorlaşmasına ve bakım maliyetlerinin artmasına yol açabilmektedir. Bu tez, ince ayar (fine-tuning) uygulanmış büyük dil modellerini (LLM) çoklu hizalanma kategorileri üzerinde kullanarak otomatik PR–issue hizalanma sınıflandırmasını geliştirmeyi, PR–issue alanlarının model tahminleri üzerindeki etkilerini yorumlanabilirlik analizi yoluyla incelemeyi ve LLM tabanlı PR–issue hizalanma analizinin gerçek dünya kod inceleme iş akışlarına nasıl entegre edilebileceğini göstermeyi amaçlamaktadır. Önerilen yöntem; veri kümesi hazırlama, LLM ince ayarı, yorumlanabilirlik analizi ve sistem gerçekleştiriminden oluşmaktadır. Mevcut bir veri kümesi genişletilmiş ve sınıf dengesizliğini gidermek amacıyla veri artırma teknikleri uygulanmıştır. Ardından GPT-4o modeli talimat tabanlı ince ayar yöntemiyle eğitilmiş; CodeLlama-7B, CodeQwen1.5-7B, StableCode-3B, CodeGemma-7B ve DeepSeek-Coder-6.7B gibi açık kaynaklı LLM'ler ise sınıflandırmaya özgü model başlıkları eklenerek ince ayarlanmıştır. Buna ek olarak, en yüksek performansı gösteren açık kaynaklı LLM'in tahminlerinde PR–issue alanlarının etkisini incelemek amacıyla Shapley Additive Explanations (SHAP) yöntemi kullanılarak yorumlanabilirlik analizi gerçekleştirilmiştir. Modelleme yaklaşımına ek olarak, bu tez gerçek yazılım geliştirme iş akışlarına entegre edilmiş LLM tabanlı bir PR–issue hizalanma aracının tasarımını ve gerçekleştirimini sunmaktadır. Araç, Bitbucket ve Jira üzerine bir eklenti olarak uygulanmış olup, PR güncellemeleri sırasında PR–issue çiftlerini otomatik olarak analiz etmekte, hizalanma tahminlerini doğrudan PR arayüzünde raporlamakta ve geliştiricilerin otomatik kararları açık bir etiket ve açıklama ile geçersiz kılmasına olanak tanımaktadır. İzlenebilirliği ve sonradan analiz edilebilirliği desteklemek amacıyla model tahminleri, geliştirici geçersiz kılmaları ve ilgili PR–issue artifaktları (kod farkları dahil) commit-bağlamlı olarak kalıcı biçimde saklanmaktadır. Deneysel sonuçlar, ince ayarlanmış LLM'lerin temel modellere kıyasla daha yüksek performans gösterdiğini ortaya koymaktadır. Modeller, ortalama doğruluk (accuracy) ölçütünde \%6.16 ve F1-macro ölçütünde \%14.53 oranında iyileşme sağlamıştır. CodeLlama-7B, tüm değerlendirme metriklerinde tutarlı performans sergileyerek en iyi performans gösteren ince ayarlı model olmuştur. Yorumlanabilirlik analizi ise kod farklarının, issue gövdesi ve PR gövdesi içerikleriyle birlikte hizalanma tahminleri üzerinde en büyük etkiye sahip olduğunu göstermiştir. Genel olarak bulgular, ince ayarın PR–issue hizalanma sınıflandırmasını önemli ölçüde geliştirdiğini ve yorumlanabilirlik analizinin hizalanma kararlarını etkileyen veri özelliklerine dair uygulanabilir içgörüler sağladığını ortaya koymaktadır. Ayrıca, gerçekleştirilen PR–issue hizalanma aracı, LLM tabanlı hizalanma analizinin pratik kod inceleme iş akışlarına entegre edilebileceğini ve yazılım mühendisliğinde izlenebilirlik, şeffaflık ve karar verme süreçlerini destekleyebileceğini göstermektedir.

Özet (Çeviri)

Accurate alignment between pull requests (PRs) and corresponding issues is crucial for efficient software development and maintaining code quality, as misalignments can lead to reduced traceability, hindered defect localization, and decreased maintainability. This thesis aims to improve automated PR–issue alignment classification by leveraging fine-tuned large language models (LLMs) across multiple alignment categories, to investigate the effects of PR–issue fields on model predictions through interpretability analysis, and to demonstrate how LLM-based PR–issue alignment analysis can be integrated into a real-world code review workflow. The proposed methodology consists of dataset preparation, LLM fine-tuning, interpretability analysis, and system implementation. An existing dataset is extended and data augmentation techniques are applied to address class imbalance. Subsequently, GPT-4o is fine-tuned via instruction tuning, and several open-source LLMs—including CodeLlama-7B, CodeQwen1.5-7B, StableCode-3B, CodeGemma-7B, and DeepSeek-Coder-6.7B—are fine-tuned using classification-specific model heads. In addition, interpretability analysis using Shapley Additive Explanations (SHAP) is conducted to examine the influence of PR–issue fields on the predictions of the best-performing open-source LLM. In addition to the modeling approach, this thesis presents the design and implementation of an LLM-based PR–issue alignment tool integrated into real-world software development workflows. The tool is implemented as an extension to Bitbucket and Jira: it automatically analyzes PR–issue pairs upon pull request updates, reports alignment predictions directly within pull request interfaces, and allows developers to override automated decisions with an explicit label and explanation. To support traceability and post-hoc analysis, the tool persistently stores model predictions, developer overrides, and the corresponding PR–issue artifacts (including the code diff) in a commit-scoped manner. Experimental results show that fine-tuned LLMs outperform baseline models, achieving average improvements of 6.16\% in accuracy and 14.53\% in F1-macro. CodeLlama-7B emerges as the best-performing fine-tuned LLM overall, demonstrating consistent performance across evaluation metrics. Interpretability analysis further reveals that code diffs, together with issue body and PR body contents, exert the greatest influence on alignment predictions. Overall, the findings demonstrate that fine-tuning substantially enhances PR–issue alignment classification while interpretability analysis provides actionable insights into the dataset features driving alignment decisions. Moreover, the implemented PR–issue alignment tool shows that LLM-based alignment analysis can be embedded into practical review workflows, supporting improved traceability, transparency, and decision-making in software engineering.

Benzer Tezler

  1. Perceptions of foreign and Turkish university preparatory schools' instructors on project/assignment-based learning: A comparative analysis

    Yabancı ve Türk üniversite hazırlık okulları öğretim elemanlarının proje/ödev tabanlı öğrenmeye ilişkin algıları: Karşılaştırmalı bir analiz

    EBRU BAYRAMOĞLU

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Eğitim ve Öğretimİstanbul Aydın Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ İLKİN BAŞAR

  2. Elektromanyetik açıcının bazı fiziksel özelliklerinin ölçümü, sonlu elemanlar yöntemi ile analizi ve karakteristiğinin makine öğrenmesi ile kestirimi

    Measurement of some physical properties of an electromagnetic plunger, its analysis with finite element method, and estimating the characteristic using machine learning

    MAHAMMADKHAN GULIYEV

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    Elektrik ve Elektronik MühendisliğiSakarya Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ŞUAYB ÇAĞRI YENER

  3. Sürekli tip cam ergitme fırınları için hesaplamalı akışkanlar dinamiği tabanlı indirgenmiş model geliştirilmesi

    Development of a computational fluid dynamics based reduced order model for continuous glass melting furnaces

    ENGİN DENİZ CANBAZ

    Doktora

    Türkçe

    Türkçe

    2025

    Makine Mühendisliğiİstanbul Teknik Üniversitesi

    Makine Mühendisliği Ana Bilim Dalı

    PROF. DR. MESUT GÜR

  4. Kanban esaslı bir üretim hattında benzetim çalışması

    Simulation study of a kanban based production line

    M.NEJAT TANCA

    Yüksek Lisans

    Türkçe

    Türkçe

    1993

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. GÖNÜL YENERSOY

  5. Generational preferences in media consumption: A comparative study of English language development in terms of vocabulary among EFL teachers

    Medya tüketiminde nesil tercihleri: EFL öğretmenlerinin kelime bilgisi açısından İngilizce dil gelişiminin karşılaştırmalı bir çalışması

    DOĞUŞ TÜRKAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    İngiliz Dili ve Edebiyatıİstanbul Aydın Üniversitesi

    Yabancı Diller Eğitimi Ana Bilim Dalı

    PROF. DR. SAEED MEHRPOUR