Geri Dön

Evidence-driven, multi-reference patch correctness assessment for automated program repair benchmarking

Otomatik program onarımı karşılaştırmalarında kanıta dayalı ve çok referanslı yama doğruluğu değerlendirmesi

  1. Tez No: 1022566
  2. Yazar: SAHAND MOSLEMI YENGEJEH
  3. Danışmanlar: DR. ÖĞR. ÜYESİ ANIL KOYUNCU
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Bilgisayar programlama, Bilgisayar yazılımları, Computer programming, Computer softwares
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İhsan Doğramacı Bilkent Üniversitesi
  10. Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Yazılımı Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Otomatik Program Onarımı (APR) tarafından üretilen bir yamanın gerçekten doğru olup olmadığına karar vermek, bu alanın temel darboğazlarından biri olmaya devam etmektedir. Yamaların elle kontrol edilmesi hem önemli bir çaba gerektirir hem de bilinen sınırlamalar taşır: tek bir referans yamayla yapılan eşleştirme, geçerli alternatif düzeltmeleri gözden kaçırır. Anlamsal inceleme ise özneldir ve tekrarlanabilirliği güçtür. Mevcut Otomatik Yama Doğruluğu Değerlendirmesi (APCA) tekniklerinin büyük bölümü, her aday yamayı yeni bir örnekmiş gibi ele alan şeffaf olmayan tahmin modelleri biçiminde kurgulanmıştır. Bu nedenle anlamsal olarak daha önce doğrulanmış yamalarla eşdeğer olan yamaları tekrar tekrar yeniden değerlendirmek zorunda kalırlar. Bu boşluğu sayısal olarak ortaya koymak amacıyla, araç tarafından üretilen geniş bir yama derlemini inceledik ve birbirine karşıt iki eğilim gözlemledik. Benzersiz doğru yamaların yaklaşık %39,0'u birbirinin sözdizimsel klonudur. Bu durum otomasyon için belirgin bir alan bırakmaktadır. Aynı zamanda, hataların yaklaşık %65,0'i birden fazla farklı doğru düzeltmeye sahiptir. Dolayısıyla yalnızca tek bir referans yamayla karşılaştırma yapan herhangi bir yöntem, çözüm uzayının kayda değer bir kısmını yanlış değerlendirecektir. Bu bulgular ışığında, her yeni onarım girişimini tek bir referans yerine topluluk tarafından kabul görmüş çok sayıda yama ile karşılaştırmak üzere Büyük Dil Modellerinden yararlanan bir çerçeve önerilmektedir. Bu çerçevenin verdiği kararlar kanıta dayalı olup belirli geçmiş yamalara kadar izlenebilir niteliktedir. Elde edilen kanıtın yetersiz kaldığı durumlarda aday yama, bir etikete zorlanmak yerine Bilinmeyen olarak temkinli biçimde bir kenara ayrılmaktadır. Bir aracın dışarıda tutulduğu değerlendirme protokolü altında, önerilen çerçeve yamaların yaklaşık %95'ini %88 doğrulukla ele alarak elle inceleme yükünü derlemin yalnızca %5,0'ine indirir. Bağımsız APCA araçlarının önüne kanıta dayalı bir filtre olarak yerleştirildiğinde, bu araçların doğruluğunu %22'ye kadar yükseltmekte ve %86 genel doğruluk ile %100 kapsama ulaşan hibrit bir hattı mümkün kılmaktadır. Araç tarafından üretilen yamalar üzerinde 2020 ile 2024 yılları arasındaki dönemi kapsayan boylamsal bir inceleme, onarım girişimleri arasındaki tekrarlanmanın kalıcı bir özellik olduğunu da göstermektedir: pek çok yama yerleşik düzeltmeleri yeniden keşfetmekte ve bu durum, APR için kanıta dayalı değerlendirmenin uzun vadeli sürdürülebilirliğini güçlendirmektedir.

Özet (Çeviri)

Deciding whether a patch produced by Automated Program Repair (APR) is actually correct remains a key bottleneck in the field. Hand-checking patches takes considerable effort and has well-known limits: matching against a single reference overlooks valid alternative fixes, whereas semantic checking is subjective and hard to replicate. Many existing approaches to Automated Patch Correctness Assessment, or APCA, are built as opaque predictive models that treat every candidate as if it were new, repeatedly re-judging patches semantically equivalent to already validated ones. To quantify this gap, we examine a sizeable corpus of tool-generated patches and observe two opposing trends. About 39.0% of unique correct patches turn out to be syntactic clones of one another, leaving clear room for automation. Meanwhile, around 65.0% of bugs admit more than one distinct correct fix, so any method comparing only against a single reference patch will misjudge a substantial share of the solution space. These observations motivate a framework in which each incoming repair attempt is compared, via a Large Language Model, against a set of community-vetted patches rather than a single reference. Every verdict is tied to specific past patches that back it, so it is auditable rather than opaque; where the accumulated support is inconclusive, the candidate is set aside as Unknown instead of forced onto a definitive label. Under a leave-one-tool-out protocol, the framework covers 95% of patches at an accuracy of 88%, trimming manual review to roughly 5.0% of the corpus. Placed in front of standalone APCA tools as an evidence-based filter, it raises their accuracy by as much as 22% and produces a hybrid pipeline reaching 86% overall accuracy at 100% coverage. A longitudinal study of tool-generated patches across 2020 to 2024 further indicates that redundancy across repair attempts is a recurring property: numerous patches keep rediscovering long-established fixes, strengthening the long-term case for evidence-based APR assessment.

Benzer Tezler

  1. Spatial-behavioral dynamics in varied urban configurations during emergencies: An integrated VR-ABM approach to disaster resilience

    Acil durumlarda farklı kentsel ortamlardaki mekânsal ve davranışsal dinamikler: Afet dayanıklılığı için entegre bir VR-ABM yaklaşımı

    DUYGU KALKANLI

    Doktora

    İngilizce

    İngilizce

    2026

    Şehircilik ve Bölge Planlamaİstanbul Teknik Üniversitesi

    Şehir ve Bölge Planlama Ana Bilim Dalı

    PROF. DR. SEDA KUNDAK

  2. Yükseköğretim kurumlarında stratejik performansın izlenmesinde iş zekası sistemlerinin rolü: kapsama, olgunluk ve iyileştirme analizi

    The role of business intelligence systems in monitoring strategic performance in higher education institutions: Coverage, maturity, and improvement analysis

    ABDULLAH UYULUR

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Yönetim Bilişim Sistemleriİstinye Üniversitesi

    Veri Bilimi Ana Bilim Dalı

    DOÇ. DR. OKAN YAŞAR

  3. High-frequency trading dynamics in Turkish index futures: A comprehensive analysis

    Türk endeks vadeli işlem sözleşmelerinde yüksek frekanslı işlem dinamikleri üzerine kapsamlı bir analiz

    ONUR OLGUN

    Doktora

    İngilizce

    İngilizce

    2025

    İşletmeİstanbul Teknik Üniversitesi

    İşletme Ana Bilim Dalı

    DOÇ. DR. CUMHUR ENİS EKİNCİ

  4. Bir otomotiv fabrikasında baca gazı arıtım ekipmanının crıtıc ve multımoora metodları ile belirlenmesi

    Selection of flue gas treatment equipment in an automotive factory using the critic and multimoora methods

    SERKAN ERDOĞAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Endüstri ve Endüstri MühendisliğiSakarya Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ALPARSLAN SERHAT DEMİR