Geri Dön

Enhancing text-to-image with a u-net discriminator

U-net ayırıcı kullanarak metinden görüntüye dönüştürme işlemini geliştirme

  1. Tez No: 1007889
  2. Yazar: FARAH HUSNI A AL AMIR
  3. Danışmanlar: DR. ÖĞR. ÜYESİ DUYGU ÜÇÜNCÜ, DR. ÖĞR. ÜYESİ ERKUT ARICAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilim ve Teknoloji, Science and Technology
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Bahçeşehir Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Yapay Zeka Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Metinden görüntü sentezi, özellikle metin açıklamalarıyla tutarlılığı koruyan ve ince ayrıntılara sahip yüksek çözünürlüklü görüntüler üretme açısından, bilgisayarlı görü alanında en hızlı gelişen alanlardan biridir. Bu tez çalışmasında, görüntü sentezi amacıyla kullanılan özgün StackGAN-v2 modeline bir iyileştirme önerilmektedir. Bu kapsamda, modelde yer alan mevcut ayrıştırıcı mimarisi; uzamsal bilgiyi koruyabilen, atlama bağlantılarına sahip kodlayıcı-çözücü yapıda U-Net tabanlı bir mimari ile değiştirilmiştir. Önerilen bu yapı, üretici ağa koşullu, küresel ve piksel düzeyinde olmak üzere üç farklı türde daha zengin geri bildirim sağlamaktadır. Ayrıştırıcının daha güçlü hâle getirilmesiyle birlikte üretici ağ da güçlenmekte ve bunun sonucunda ince ayrıntılara sahip görüntüler üretebilmektedir. Önerilen model, özgün StackGAN-v2 ile; Inception Score (IS), Fréchet Inception Distance (FID) ve Kernel Inception Distance (KID) gibi yaygın metinden-görüntüye değerlendirme metrikleri kullanılarak ve insan değerlendirmesine dayalı görsel bir inceleme ile karşılaştırmalı olarak değerlendirilmiştir. Elde edilen sonuçlar, önerilen modelin hem nicel değerlendirme metriklerinde hem de insan değerlendirmelerinde özgün modele kıyasla daha yüksek performans sergilediğini doğrulamaktadır. Genel olarak bu tez, piksel düzeyindeki geri bildirimin, yüksek çözünürlüklü ve uzamsal farkındalığa sahip görüntülerin üretilmesindeki etkisini ortaya koymaktadır.

Özet (Çeviri)

Text-to-image synthesis is one of the most rapidly developing fields in computer vision, particularly generating high-resolution images that maintain consistency with text descriptions and with fine-grained details. This thesis introduces an enhancement to the original StackGAN-v2 model for image synthesis by replacing its current discriminators' architecture with a U-Net-based architecture that consists of an encoder-decoder structure with skip connections that enable the discriminator to preserve spatial information and provide the generator with richer feedback including three outputs: conditional, global, and pixel-wise feedback. By making the discriminator stronger, the generator becomes stronger as well. As a result, it generates images with fine details. The proposed model is evaluated against the original StackGAN-v2 using known text-to-image evaluation metrics such as Inception Score (IS), Fréchet Inception Score (FID), and Kernel Inception Score (KID) alongside a visual survey for human assessment. The result confirms that the proposed model achieves higher scores than the original model in both evaluation metrics and human surveys. The overall thesis highlights the effect of pixel-level feedback for generating images that are spatially aware with high-resolution.

Benzer Tezler

  1. KWLA-Plus stratejisinin ilkokul 4. sınıf öğrencilerinin okuma, okuduğunu anlama ve yazma becerilerine etkisi

    The effect of KWLA-Plus strategy on the reading, reading comprehension and writing skills of 4th grade primary school students

    BEGÜM YILMAZ

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Eğitim ve ÖğretimSivas Cumhuriyet Üniversitesi

    Temel Eğitim Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ İCLAL GÖKKUŞ

  2. An electronic performance support system for teaching Turkish as a foreign language:A case study

    Türkçeyi yabancı dil olarak öğretmeye yönelik bir elektronik performans destek sistemi: Bir durum çalışması

    NERGİZ ERCİL ÇAĞILTAY

    Doktora

    İngilizce

    İngilizce

    2003

    Eğitim ve ÖğretimOrta Doğu Teknik Üniversitesi

    Bilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı

    PROF.DR. YAŞAR ÖZDEN

    Y.DOÇ.DR. SONER YILDIRIM

  3. Design and simulation of a textrecognition algorithm using opticalcharacter recognition (OCR) technique

    Bir metin tasarımı ve simülasyonuoptik kullanarak tanıma algoritmasıkarakter tanıma (OCR) tekniği

    MURTADHA ABDULKAREEM MAHDI HAMEED

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş Üniversitesi

    Bilişim Teknolojileri Ana Bilim Dalı

    Assist. Prof. Dr. TİMUR İNAN

  4. Negative synthetic image generation for contrastive training to improve text-to-image translation

    Metinden görüntüye dönüşümü geliştirmek için karşıt öğrenmede negatif sentetik görüntü üretimi

    SERKAN ÖZTÜRK

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. PINAR DUYGULU ŞAHİN

  5. An improved steganography system based on contrast variation with fibonacci decomposition to increase imperceptibility

    Algılanmazlığı artırmak için fıbonaccı ayrışması ile kontrast değişimine dayanan geliştirilmiş bir steganografi sistemi

    AMJED FADHIL HAMODY AL-BAYATI

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş Üniversitesi

    Elektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ MESUT ÇEVİK