Perceptual video restoration: Task-specific versus pre-trained large generative models
Algisal video restorasyonu: Göreve özel ve önceden eğitilmiş büyük üretici modellerin
- Tez No: 983146
- Danışmanlar: PROF. DR. AHMET MURAT TEKALP
- Tez Türü: Doktora
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Koç Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Elektrik-Elektronik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Video restorasyonu problemleri, çok büyük bir null uzaya sahip, iyi tanımlanmamış ters problemlerdir. Algısal video restorasyonu, algısal olarak tatmin edici ve zamansal olarak tutarlı uygulanabilir bir çözümün seçilmesine karşılık gelir. Bu tez, algısal video restorasyonu için iki paradigmayı karşılaştırmaktadır: denetimli, göreve özgü üretici modeller ve önceden eğitilmiş büyük üretici modellerin çeşitli video restorasyon görevlerinde sıfır-atış (zero-shot) yaklaşımıyla, bazı çıkarım (inference) zamanı uyarlamalarıyla uygulanması. İlk kısımda, algı farkındalıklı bir çerçevede eğitilen yeni bir göreve özgü Video Süper-Çözünürlük (VSR) modeli sunuyoruz. Bu yaklaşım, doğruluğu uzamsal-zamansal algısal kalite ile değiş tokuş etmektedir. Mimari tasarımımız, biri uzamsal dokuların gerçekçiliğine, diğeri ise hareketin algısal doğallığına odaklanan iki ayrıştırıcı (discriminator) kullanmaktadır. Bu tasarım, doğal görüntü dizilerinin yoğunluk uzayında eğri görünebilmesine rağmen insan görsel sisteminin algısal alanında daha düz yörüngeleri takip etme eğiliminde olduğunu öne süren ``doğal videoların algısal düzleşmesi'' hipoteziyle desteklenmektedir. Kapsamlı deneyler, bu modelin taban yöntemlere kıyasla üstün uzamsal-zamansal algısal kalite elde ettiğini göstermektedir. İkinci kısımda, önceden eğitilmiş büyük ölçekli görüntü tabanlı latent difüzyon modellerini (LDM'ler), video süper-çözünürlük, inpainting, bulanıklık giderme, hareket bulanıklığı giderme ve bu görevlerin birleşimlerini içeren genel video restorasyonu için sıfır-atış, eğitim gerektirmeyen bir paradigma altında uyarlamayı araştırıyoruz. Bu modeller esnek olup iyi uzamsal üretim yetenekleri sunmasına rağmen, doğaları gereği görüntü tabanlı olduklarından kare-kare uygulandığında zamansal tutarsızlıklardan muzdarip olmaktadır. Ayrıca, zamansal tutarlılığı sağlamaya yönelik mekanizmalar bu sıfır-atış bağlamında görece az incelenmiştir. Bu sorunu ele almak için üç katkı sunuyoruz: (1) herhangi bir hareket kestirimi olmadan özellik yayılımını kolaylaştıran çapraz-kare dikkat (cross-frame attention) yaklaşımı; (2) örnekleme sürecinde algısal olarak daha düzgün zamansal yolları bulmaya rehberlik eden algısal düzleşme düzenlemesi; (3) difüzyon denoising süreci boyunca genel kaliteyi---zamansal tutarlılık dahil---artıran çok-yollu (multi-path) topluluk (ensemble) örnekleme şeması. Nicel ve nitel sonuçlar, göreve özgü modeller ile genel sıfır-atış büyük ölçekli modeller arasında bir ödünleşim (trade-off) olduğunu ortaya koymaktadır: göreve özgü modeller, test bozulmaları eğitimle eşleştiğinde en iyi doğruluk ve algısal skorları elde eder, ancak bozulma çekirdeği veya veri kümesi farklılıklarında performansları düşer. Bu durumlarda sıfır-atış model rekabetçi veya üstün kalabilmekte ve eğitim gerektirmeyen esnek bir seçenek sunmaktadır, fakat daha yüksek çalışma süresi (runtime) maliyetiyle. Bu tez, her iki paradigmayı da ayrıntılı biçimde incelemekte, özellikle zamansal tutarlılık sorununu ele almak için kullanılan farklı yaklaşımlara odaklanmaktadır---göreve özgü modellerde açıkça eğitim tabanlı mekanizmalar, sıfır-atış difüzyon çerçevesinde ise çıkarım zamanı teknikleriyle zamansal tutarlılık sağlama yöntemleri.
Özet (Çeviri)
Video restoration problems are ill-posed inverse problems with a very large null space. Perceptual video restoration refers to choosing a feasible solution that is perceptually pleasing and temporally coherent. This thesis compares two paradigms for perceptual video restoration: supervised task-specific generative models and pre-trained large generative models applied in a zero-shot manner with some inference-time adaptation across diverse video restoration tasks. In the first part, we present a novel task-specific Video Super-Resolution (VSR) model trained under a perception-aware framework, which trades fidelity for spatio-temporal perceptual quality. Our architecture employs two discriminators: one that focuses on the realism of spatial texture, and the other on the perceptual naturalness of motion. This design is supported by a hypothesis called perceptual straightening of natural videos, which states that natural image sequences that appear curved in the intensity domain tend to follow straighter trajectories in the perceptual domain of human visual system. Extensive experiments demonstrate that this model achieves superior spatio-temporal perceptual quality compared to baseline approaches. In the second part, we explore a zero-shot, training-free paradigm to adapt large pre-trained image-based latent diffusion models (LDMs), for general-purpose video restoration tasks including video super-resolution, inpainting, deblurring, motion blur removal, and a combination of aforementioned tasks. While these models are rather flexible and offer quite good spatial generative capabilities, being inherently image-based, suffer from temporal inconsistencies when applied frame by frame, and mechanisms for enforcing temporal coherence remain relatively underexplored in this zero-shot setting. To address this, we introduce three contributions: (1) a cross-frame attention approach to foster feature propagation without any motion estimation; (2) perceptual straightness regularization to guide sampling in finding perceptually smoother temporal paths, and, (3) a multi-path ensemble sampling scheme that improves overall quality—including temporal consistency—during the diffusion denoising process. Quantitative and qualitative results reveal a trade-off between task-specific models and general zero-shot large-scale models: task-specific models achieve the best fidelity and perceptual scores when test degradations match training, but their performance drops under degradation kernel or dataset shift, where the zero-shot model remains competitive or superior and provides a flexible, training-free option—albeit with higher runtime. This thesis presents a detailed exploring of both paradigms, with a focus on the different approaches employed to address the challenge of temporal consistency—leveraging explicit training-based mechanisms in task-specific models and introducing inference-time temporal consistency techniques within the zero-shot diffusion framework.
Benzer Tezler
- Yaşayan kültür mirası olarak Topkapı Sarayı bahçeleri
The Topkapı Palace gaedens as living cultural feritage
ÖZGE İSKENDER
Yüksek Lisans
Türkçe
1995
Şehircilik ve Bölge Planlamaİstanbul Teknik ÜniversitesiY.DOÇ.DR. NİLGÜN ERGÜN
- Perceptual video quality aware dynamic adaptive streaming over HTTP (DASH) with scalable video coding
Ölçeklenir video kodlamada algılanan video kalitesi kullanarak HTTP üzerinden dinamik uyarlanabilir video akışı
MEHMET ÇALI
Yüksek Lisans
İngilizce
2019
Elektrik ve Elektronik MühendisliğiEge ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ NÜKHET ÖZBEK
- Analysis of perceptual optimization in intra video coding
Video içi kodlamada algisal optimizasyonun analizi
ERÇETİN KUYUCU
Yüksek Lisans
İngilizce
2024
Elektrik ve Elektronik MühendisliğiOrta Doğu Teknik ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. GÖZDE BOZDAĞI AKAR
- Mimari cephede çok boyutlu tasarım arayüzü olarak video haritalama ve algısal mekân deneyimi
Video mapping as a multidimensional design interface on architectural facade and perceptual space
TUĞÇE GÖKÇEN
Yüksek Lisans
Türkçe
2016
MimarlıkBahçeşehir ÜniversitesiMimarlık Ana Bilim Dalı
YRD. DOÇ. DR. ALİ DEVRİM IŞIKKAYA
- Sdn ile kurulmuş mpeg-dash sağlayıcısını kullanarak android işletim sistemi üzerinde video oynatıcı uygulaması geliştirme ve sistemde algısal kaliteyi etkileyen faktörlerin incelenmesi
Developing android based video client application with using sdn mpeg-dash content provider and examining factors affecting perceptual quality in the system
EMRECAN ÇETİN
Yüksek Lisans
Türkçe
2020
Elektrik ve Elektronik MühendisliğiEge ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ NÜKHET ÖZBEK