Post-training quantization for efficient inference oflarge language models on modern gpu architectures
Modern gpu mimarileri üzerinde büyük dil modellerininverimli çıkarımı için eğitim sonrası nicemleme
- Tez No: 984771
- Danışmanlar: DR. ÖĞR. ÜYESİ FATİH KAHRAMAN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Bahçeşehir Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Yapay Zeka Ana Bilim Dalı
- Bilim Dalı: Yapay Zeka Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Büyük dil modellerinin (LLM) hızla genişlemesi, veri merkezi ortamlarında ölçeklenebilirliği artırmak ve hesaplama maliyetlerini düşürmek için verimli optimizasyon tekniklerini gerektirmektedir. Sonradan eğitim sonrası nicemleme (PTQ), belleği önemli ölçüde azaltırken doğruluğu koruyup gecikmeyi en aza indiren kritik bir yöntem olarak öne çıkmaktadır. Bu çalışma, PTQ'nun Gemma 2B, MetaLlama 3.1 8B ve Mistral 7B Instruct modellerinde, BFLOAT16, FLOAT8, INT8 ve INT4 hassasiyet formatlarıyla NVIDIA A100 ve L4 GPU'larında nasıl uygulandığını incelemektedir. Simetrik kanal başına ağırlık nicemlemesi ve asimetrik tensör başına aktivasyon nicemlemesi, doğruluğu korurken hesaplama verimliliğini artırmaktadır. Sonuçlar, INT4 ağırlık ve FLOAT8 aktivasyon kullanmanın neredeyse temel performansı koruduğunu göstermektedir; Mistral 7B, %97,5 doğruluğunu korurken bellek kullanımını %70 azaltmaktadır. Benzer şekilde, Meta-Llama 3.1 8B, %97,5 doğrulukla %61,8'e varan bellek tasarrufu sağlamaktadır. A100, gecikmeyi %59,6 oranında azaltarak L4'ten üstün performans gösterirken, L4 enerji verimliliği sayesinde uç cihazlarda veya güç sınırlı veri merkezlerinde daha uygun bir seçenek olup, FLOAT8-FLOAT8 gibi karmaşık nicemlemelerde performans düşüşü yaşamaktadır. Bulgular, PTQ'nun ölçeklenebilir ve kaynak açısından verimli LLM dağıtımı için etkili bir yöntem olduğunu doğrulamaktadır.
Özet (Çeviri)
The rapid expansion of large language models (LLMs) necessitates efficient optimization techniques to improve scalability and reduce computational costs, especially in data center environments. Post-training quantization (PTQ) has emerged as a key approach, significantly reducing memory usage while maintaining accuracy and minimizing latency. This study examines PTQ for inference optimization across three state-of-the-art LLMs—Gemma 2B, Meta-Llama 3.1 8B, and Mistral 7B Instruct—using advanced precision formats (BFLOAT16, FLOAT8, INT8, and INT4) on NVIDIA A100 and L4 GPUs. Symmetric per-channel weight quantization and asymmetric per-tensor activation quantization ensure precision retention while enhancing computational efficiency. Results show that INT4 for weights and FLOAT8 for activations sustain near-baseline performance, with Mistral 7B retaining 97.5% accuracy while cutting memory usage by 70%. Similarly, Meta-Llama 3.1 8B achieves up to 61.8% memory savings while maintaining 97.5% accuracy. The A100 outperforms the L4, reducing latency by 59.6%, while the L4, with its energy-efficient design, is better suited for edge deployments or power-constrained data centers, though performance declines under complex quantization like FLOAT8-FLOAT8. These findings confirm PTQ's effectiveness for scalable, resource-efficient LLM deployment in diverse computational environments.
Benzer Tezler
- Nöromorfik hesaplama ve memristor tabanlı ağ saldırı tespit sistemleri: Siber güvenlikte yeni yaklaşımlar
Neuromorphic computing and memristor-based network attack detection systems: New approaches in cyber security
YUSUF ETKA KÖYLÜ
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
PROF. DR. İLHAN KOCAARSLAN
- Quantization robustness to input degradations for object detection
Girdi bozulmalarına karşı nesne tespiti için kuantizasyon dayanıklılığı
TOGHRUL KARIMOV
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
Assist. Prof. Dr. HASSAN IMANI
- Deep learning-based face recognition with raspberry Pi and USB accelerator for IoT environments
IoT için rapsberry Pi ve USB hızlandırıcı ile derin öğrenme tabanlı yüz tanıma
KUTAY YILDIZ
Yüksek Lisans
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAtılım ÜniversitesiBilişim Teknolojileri Ana Bilim Dalı
PROF. DR. MURAT KOYUNCU
- Model-based aı accelerator design on FPGA with in-depth evaluation of design parameters
FPGA'de model tabanli yapay zeka hizlandirici tasarimi ve tasarim parametrelerinin derinliğine değerlendirilmesi
GÖZDE ÖZDİL
Yüksek Lisans
İngilizce
2025
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
PROF. DR. SIDDIKA BERNA ÖRS YALÇIN
- Infrared domain adaptation with zero-shot quantization
Veri gerektirmeyen nicelemenin kızılötesi alana uyarlaması
BURAK SEVSAY
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiModelleme ve Simülasyon Ana Bilim Dalı
YRD. DOÇ. DR. ERDEM AKAGÜNDÜZ