Geri Dön

Post-training quantization for efficient inference oflarge language models on modern gpu architectures

Modern gpu mimarileri üzerinde büyük dil modellerininverimli çıkarımı için eğitim sonrası nicemleme

  1. Tez No: 984771
  2. Yazar: ENGİN BOZABA
  3. Danışmanlar: DR. ÖĞR. ÜYESİ FATİH KAHRAMAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Bahçeşehir Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Yapay Zeka Ana Bilim Dalı
  12. Bilim Dalı: Yapay Zeka Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Büyük dil modellerinin (LLM) hızla genişlemesi, veri merkezi ortamlarında ölçeklenebilirliği artırmak ve hesaplama maliyetlerini düşürmek için verimli optimizasyon tekniklerini gerektirmektedir. Sonradan eğitim sonrası nicemleme (PTQ), belleği önemli ölçüde azaltırken doğruluğu koruyup gecikmeyi en aza indiren kritik bir yöntem olarak öne çıkmaktadır. Bu çalışma, PTQ'nun Gemma 2B, MetaLlama 3.1 8B ve Mistral 7B Instruct modellerinde, BFLOAT16, FLOAT8, INT8 ve INT4 hassasiyet formatlarıyla NVIDIA A100 ve L4 GPU'larında nasıl uygulandığını incelemektedir. Simetrik kanal başına ağırlık nicemlemesi ve asimetrik tensör başına aktivasyon nicemlemesi, doğruluğu korurken hesaplama verimliliğini artırmaktadır. Sonuçlar, INT4 ağırlık ve FLOAT8 aktivasyon kullanmanın neredeyse temel performansı koruduğunu göstermektedir; Mistral 7B, %97,5 doğruluğunu korurken bellek kullanımını %70 azaltmaktadır. Benzer şekilde, Meta-Llama 3.1 8B, %97,5 doğrulukla %61,8'e varan bellek tasarrufu sağlamaktadır. A100, gecikmeyi %59,6 oranında azaltarak L4'ten üstün performans gösterirken, L4 enerji verimliliği sayesinde uç cihazlarda veya güç sınırlı veri merkezlerinde daha uygun bir seçenek olup, FLOAT8-FLOAT8 gibi karmaşık nicemlemelerde performans düşüşü yaşamaktadır. Bulgular, PTQ'nun ölçeklenebilir ve kaynak açısından verimli LLM dağıtımı için etkili bir yöntem olduğunu doğrulamaktadır.

Özet (Çeviri)

The rapid expansion of large language models (LLMs) necessitates efficient optimization techniques to improve scalability and reduce computational costs, especially in data center environments. Post-training quantization (PTQ) has emerged as a key approach, significantly reducing memory usage while maintaining accuracy and minimizing latency. This study examines PTQ for inference optimization across three state-of-the-art LLMs—Gemma 2B, Meta-Llama 3.1 8B, and Mistral 7B Instruct—using advanced precision formats (BFLOAT16, FLOAT8, INT8, and INT4) on NVIDIA A100 and L4 GPUs. Symmetric per-channel weight quantization and asymmetric per-tensor activation quantization ensure precision retention while enhancing computational efficiency. Results show that INT4 for weights and FLOAT8 for activations sustain near-baseline performance, with Mistral 7B retaining 97.5% accuracy while cutting memory usage by 70%. Similarly, Meta-Llama 3.1 8B achieves up to 61.8% memory savings while maintaining 97.5% accuracy. The A100 outperforms the L4, reducing latency by 59.6%, while the L4, with its energy-efficient design, is better suited for edge deployments or power-constrained data centers, though performance declines under complex quantization like FLOAT8-FLOAT8. These findings confirm PTQ's effectiveness for scalable, resource-efficient LLM deployment in diverse computational environments.

Benzer Tezler

  1. Nöromorfik hesaplama ve memristor tabanlı ağ saldırı tespit sistemleri: Siber güvenlikte yeni yaklaşımlar

    Neuromorphic computing and memristor-based network attack detection systems: New approaches in cyber security

    YUSUF ETKA KÖYLÜ

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    PROF. DR. İLHAN KOCAARSLAN

  2. Quantization robustness to input degradations for object detection

    Girdi bozulmalarına karşı nesne tespiti için kuantizasyon dayanıklılığı

    TOGHRUL KARIMOV

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    Assist. Prof. Dr. HASSAN IMANI

  3. Deep learning-based face recognition with raspberry Pi and USB accelerator for IoT environments

    IoT için rapsberry Pi ve USB hızlandırıcı ile derin öğrenme tabanlı yüz tanıma

    KUTAY YILDIZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAtılım Üniversitesi

    Bilişim Teknolojileri Ana Bilim Dalı

    PROF. DR. MURAT KOYUNCU

  4. Model-based aı accelerator design on FPGA with in-depth evaluation of design parameters

    FPGA'de model tabanli yapay zeka hizlandirici tasarimi ve tasarim parametrelerinin derinliğine değerlendirilmesi

    GÖZDE ÖZDİL

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    PROF. DR. SIDDIKA BERNA ÖRS YALÇIN

  5. Infrared domain adaptation with zero-shot quantization

    Veri gerektirmeyen nicelemenin kızılötesi alana uyarlaması

    BURAK SEVSAY

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Modelleme ve Simülasyon Ana Bilim Dalı

    YRD. DOÇ. DR. ERDEM AKAGÜNDÜZ