Enhancing text-to-image with a u-net discriminator
U-net ayırıcı kullanarak metinden görüntüye dönüştürme işlemini geliştirme
- Tez No: 1007889
- Danışmanlar: DR. ÖĞR. ÜYESİ DUYGU ÜÇÜNCÜ, DR. ÖĞR. ÜYESİ ERKUT ARICAN
- Tez Türü: Yüksek Lisans
- Konular: Bilim ve Teknoloji, Science and Technology
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Bahçeşehir Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Yapay Zeka Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Metinden görüntü sentezi, özellikle metin açıklamalarıyla tutarlılığı koruyan ve ince ayrıntılara sahip yüksek çözünürlüklü görüntüler üretme açısından, bilgisayarlı görü alanında en hızlı gelişen alanlardan biridir. Bu tez çalışmasında, görüntü sentezi amacıyla kullanılan özgün StackGAN-v2 modeline bir iyileştirme önerilmektedir. Bu kapsamda, modelde yer alan mevcut ayrıştırıcı mimarisi; uzamsal bilgiyi koruyabilen, atlama bağlantılarına sahip kodlayıcı-çözücü yapıda U-Net tabanlı bir mimari ile değiştirilmiştir. Önerilen bu yapı, üretici ağa koşullu, küresel ve piksel düzeyinde olmak üzere üç farklı türde daha zengin geri bildirim sağlamaktadır. Ayrıştırıcının daha güçlü hâle getirilmesiyle birlikte üretici ağ da güçlenmekte ve bunun sonucunda ince ayrıntılara sahip görüntüler üretebilmektedir. Önerilen model, özgün StackGAN-v2 ile; Inception Score (IS), Fréchet Inception Distance (FID) ve Kernel Inception Distance (KID) gibi yaygın metinden-görüntüye değerlendirme metrikleri kullanılarak ve insan değerlendirmesine dayalı görsel bir inceleme ile karşılaştırmalı olarak değerlendirilmiştir. Elde edilen sonuçlar, önerilen modelin hem nicel değerlendirme metriklerinde hem de insan değerlendirmelerinde özgün modele kıyasla daha yüksek performans sergilediğini doğrulamaktadır. Genel olarak bu tez, piksel düzeyindeki geri bildirimin, yüksek çözünürlüklü ve uzamsal farkındalığa sahip görüntülerin üretilmesindeki etkisini ortaya koymaktadır.
Özet (Çeviri)
Text-to-image synthesis is one of the most rapidly developing fields in computer vision, particularly generating high-resolution images that maintain consistency with text descriptions and with fine-grained details. This thesis introduces an enhancement to the original StackGAN-v2 model for image synthesis by replacing its current discriminators' architecture with a U-Net-based architecture that consists of an encoder-decoder structure with skip connections that enable the discriminator to preserve spatial information and provide the generator with richer feedback including three outputs: conditional, global, and pixel-wise feedback. By making the discriminator stronger, the generator becomes stronger as well. As a result, it generates images with fine details. The proposed model is evaluated against the original StackGAN-v2 using known text-to-image evaluation metrics such as Inception Score (IS), Fréchet Inception Score (FID), and Kernel Inception Score (KID) alongside a visual survey for human assessment. The result confirms that the proposed model achieves higher scores than the original model in both evaluation metrics and human surveys. The overall thesis highlights the effect of pixel-level feedback for generating images that are spatially aware with high-resolution.
Benzer Tezler
- KWLA-Plus stratejisinin ilkokul 4. sınıf öğrencilerinin okuma, okuduğunu anlama ve yazma becerilerine etkisi
The effect of KWLA-Plus strategy on the reading, reading comprehension and writing skills of 4th grade primary school students
BEGÜM YILMAZ
Yüksek Lisans
Türkçe
2025
Eğitim ve ÖğretimSivas Cumhuriyet ÜniversitesiTemel Eğitim Ana Bilim Dalı
DR. ÖĞR. ÜYESİ İCLAL GÖKKUŞ
- An electronic performance support system for teaching Turkish as a foreign language:A case study
Türkçeyi yabancı dil olarak öğretmeye yönelik bir elektronik performans destek sistemi: Bir durum çalışması
NERGİZ ERCİL ÇAĞILTAY
Doktora
İngilizce
2003
Eğitim ve ÖğretimOrta Doğu Teknik ÜniversitesiBilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı
PROF.DR. YAŞAR ÖZDEN
Y.DOÇ.DR. SONER YILDIRIM
- Design and simulation of a textrecognition algorithm using opticalcharacter recognition (OCR) technique
Bir metin tasarımı ve simülasyonuoptik kullanarak tanıma algoritmasıkarakter tanıma (OCR) tekniği
MURTADHA ABDULKAREEM MAHDI HAMEED
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş ÜniversitesiBilişim Teknolojileri Ana Bilim Dalı
Assist. Prof. Dr. TİMUR İNAN
- Negative synthetic image generation for contrastive training to improve text-to-image translation
Metinden görüntüye dönüşümü geliştirmek için karşıt öğrenmede negatif sentetik görüntü üretimi
SERKAN ÖZTÜRK
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. PINAR DUYGULU ŞAHİN
- An improved steganography system based on contrast variation with fibonacci decomposition to increase imperceptibility
Algılanmazlığı artırmak için fıbonaccı ayrışması ile kontrast değişimine dayanan geliştirilmiş bir steganografi sistemi
AMJED FADHIL HAMODY AL-BAYATI
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş ÜniversitesiElektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MESUT ÇEVİK