Novel models and methods for accelerating parallel full-batch GNN training on distributed-memory systems
Dağıtık-bellekli sistemlerde paralel çizge sinir ağları eğitimini hızlandırmak için yeni model ve yöntemler
- Tez No: 982144
- Danışmanlar: PROF. DR. CEVDET AYKANAT
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İhsan Doğramacı Bilkent Üniversitesi
- Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Çizge Sinir Ağları (GNN'ler), çizge tabanlı verilerden öğrenme konusunda güçlü bir araç olarak öne çıkmaktadır. Ancak, özellikle büyük ölçekli, düzensiz seyrek ve ölçeklenemeyen çizgelerde tam yığın (full-batch) eğitim senaryolarında, bu ağların dağıtık sistemlerdeki ölçeklenebilirliği ciddi zorluklar içermektedir. Yaygın olarak kullanılan tek boyutlu (1D) düğüm-paralel stratejiler, hesaplama yükü dengesizliği ve yüksek iletişim maliyetleri nedeniyle sınırlı verimlilik sunmaktadır. Bu tez, modern çizge verilerinin yapısal özelliklerini daha iyi değerlendirebilen alternatif bölütleme stratejileri ile 1D yaklaşımların ölçeklenebilirlik sınırlamalarını ele almaktadır. Bu kapsamda, farklı seyreklik ve derece dağılımlarına sahip veri kümeleri üzerinde paralel GNN eğitiminin performansını değerlendiren sistematik bir çerçeve geliştirilmiştir. Çalışmada, hesaplama yük dengesi, süreçler arası iletişim hacmi ve paralel çalışma süresi gibi temel performans ölçütleri dikkate alınmıştır. LUMI ve MareNostrum5 gibi Tier-0 süper bilgisayarlarda, yüzlerce gerçek çizge üzerinde yapılan kapsamlı deneylerde, 22 yaygın kullanılan GNN veri kümesi ortalamasına göre 1D bölütlemeye kıyasla %61'e varan iletişim hacmi ve %39'a varan paralel çalışma süresi azalmaları elde edilmiştir. Bu kazanımlar, önerilen yaklaşımların derece ve seyreklik açısından değişken yapıda çizgeler üzerinde dahi tutarlı ve etkili olduğunu göstermekte; dağıtık sistemlerde ölçeklenebilir ve iletişim açısından verimli GNN eğitimi için değerli katkılar sunmaktadır.
Özet (Çeviri)
Graph Neural Networks (GNNs) have emerged as effective tools for learning from graph-structured data across diverse application domains. Despite their success, the scalability of GNNs remains a critical challenge, particularly in full-batch training on large-scale, irregularly sparse, and scale-free graphs. Traditional one-dimensional (1D) vertex-parallel training strategies, while widely adopted, often suffer from severe load imbalance and excessive communication overhead, limiting their performance on distributed-memory systems. This thesis addresses the scalability limitations of 1D approaches by investigating alternative partitioning strategies for parallelization that better exploit the structure of modern graph workloads. A systematic evaluation framework is developed to assess parallel GNN training performance across a range of datasets with varying sparsity and degree distributions. The framework captures key performance indicators such as computational load balance, inter-process communication volume, and parallel runtime. Extensive experiments are conducted on two Tier-0 supercomputers, LUMI and MareNostrum5, using hundreds of real-world graph instances. On average of 22 well-known GNN datasets, the results show up to 61% decrease in total communication volume and up to 39% decrease in parallel runtime compared to 1D partitioning strategies on 1024 processes. These improvements are consistent across graphs with high variance in degree and sparsity, confirming the robustness of the proposed approaches. The findings demonstrate the potential of moving beyond traditional 1D paradigms and provide practical insights into scalable and communication-efficient GNN training on distributed platforms.
Benzer Tezler
- Eksenel statik çekme yüküne maruz betonarme tekil kazık davranışı ve orijinal bir kazık deney ve imalat yaklaşımı
A novel construction and testing approach for cast in-situ piles subjected to tension/uplift load
ORHAN ESAT İNANIR
Doktora
Türkçe
2024
İnşaat Mühendisliğiİstanbul Teknik Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
PROF. DR. AYKUT ŞENOL
PROF. DR. MEHMET MUHİT BERİLGEN
- Contribution to high-performance motion control of parallel robots using hybrid joint-space and task-space approaches
Hibrid eklem-uzayı ve görev-uzayı kontrol yaklasımı ile paralel robotlarda yüksek performanslı hareket kontrolü
EYYÜP SİNCAR
Doktora
İngilizce
2025
Makine Mühendisliğiİstanbul Teknik ÜniversitesiMakine Mühendisliği Ana Bilim Dalı
DOÇ. DR. ZEKİ YAĞIZ BAYRAKTAROĞLU
- Image reconstruction with deep learning and applications in MR images
Derin öğrenme ile görüntü geriçatımı ve MR görüntülerinde uygulamaları
AMIR AGHABIGLOU
Doktora
İngilizce
2022
Mekatronik Mühendisliğiİstanbul Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
PROF. DR. ENDER METE EKŞİOĞLU
- Ai for drug discovery LSTM-driven drug design using selfies for target-focused de novo generation of HIV-1 protease inhibitor candidates in the treatment of AIDS
Yapay zeka tabanlı LSTM destekli ilaç tasarımı: AIDS tedavisinde selfıes kullanarak HIV-1 proteaz odaklı inhibitör adaylarının tasarlanması
M.TALEB ALBRIJAWI
Yüksek Lisans
İngilizce
2023
Biyomühendislikİstanbul Medipol ÜniversitesiBiyomedikal Mühendisliği Ana Bilim Dalı
PROF. DR. REDA ALHAJJ
- Novel methods for fast and accurate solutions of electromagnetic integral equations
Elektromanyetik integral denklemlerin hızlı ve doğru çözümleri için yeni yöntemler
ENES KOÇ
Yüksek Lisans
İngilizce
2025
Elektrik ve Elektronik Mühendisliğiİhsan Doğramacı Bilkent ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. VAKUR BEHÇET ERTÜRK
DR. MERT KALFA