Learning object-centric representations based on slots in real world scenarios
Gerçek dünya senaryolarında slotlara dayalı nesne-odaklı temsillerin öğrenilmesi
- Tez No: 975112
- Danışmanlar: PROF. DR. YÜCEL YEMEZ
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Bilgisayarla görme, Görüntü sentezleme, Computer vision, Image synthesis
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Koç Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Bilimi ve Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Yapay zekânın temel hedeflerinden biri, makinelerin görsel dünyayı ayrı nesnelerden oluşan bir bütün olarak algılamasını sağlamaktır. Nesne-merkezli anlayış, ince ayarlı ve kontrol edilebilir içerik üretimi ve düzenlemesini destekleyen üretici modeller için vazgeçilmezdir. Ancak güncel difüzyon modelleri görselleri bütüncül olarak işler ve metinlere koşullandırılır; bu da nesne düzeyindeki manipülasyon görevlerinde anlamsal bir uyumsuzluk yaratır. Bu nedenle araştırmacılar, ya güçlü fakat metin-ön yargılı modelleri uyarlamak ya da kapasitesi sınırlı yeni modeller geliştirmek gibi temel bir sorunla karşı karşıyadır. Bu tez, önceden eğitilmiş üretici modelleri nesne-merkezli görüntü ve video sentezi için uyarlayan bir çerçeve sunarak bu soruna çözüm getirmektedir. Analizimiz, mevcut yaklaşımlarda temel bir zorluk ortaya koymaktadır: yüksek kaliteli üretim elde etmek için küresel sahne tutarlılığını ayrıştırılmış nesne düzeyinde kontrol ile dengelemek gerekir. Bu dengeyi sağlamak için, değerli önbilgileri korurken önceden eğitilmiş modellere nesneye özgü koşullandırma entegre eden bir uyarlama stratejisi öneriyoruz. Bu çerçevenin videoya genişletilmesi sorunu daha da zorlaştırmaktadır; çünkü zamansal tutarlılık ve kareler boyunca nesne kimliğinin korunması kritik önem taşır. Durağan görüntüler için SlotAdapt yöntemini sunuyoruz. Bu yöntem, difüzyon modellerini hafif slot-tabanlı modüllerle genişletir. Bir kayıt token'ı arka planı ve tarzı yakalarken, slot-koşullu bileşenler nesneye özgü bilgileri kodlar. Bu çift-yollu tasarım, metin koşullandırma önyargısını azaltır ve hassas, nesne-merkezli kontrol sağlar; nesne keşfi, segmentasyon, bileşimsel düzenleme ve kontrol edilebilir görüntü üretiminde alanın en iyi sonuçlarını elde eder. Ardından çerçevemizi videoya genişletiyoruz. Invariant Slot Attention (ISA) kullanarak nesne kimliğini pozdan ayrıştırıyor, ayrıca Transformer-tabanlı bir zamansal toplayıcı ile zaman boyunca nesne temsillerinin ve dinamiklerinin tutarlı olmasını sağlıyoruz. Bu çerçeve, gözetimsiz video nesne segmentasyonu ve yeniden yapılandırmada yeni ölçütler belirlerken, nesne kaldırma, değiştirme ve ekleme gibi gelişmiş video düzenleme yeteneklerini de doğrudan gözetimsiz temsiller üzerinden mümkün kılmaktadır. Genel olarak, bu çalışma hem görüntüler hem de videolar için nesne-merkezli üretici modelleme adına genel ve ölçeklenebilir bir yaklaşım ortaya koymaktadır. Yalnızca yeni teknik standartlar belirlemekle kalmayıp, aynı zamanda etkileşimli ve kontrol edilebilir üretici araçların tasarım alanını da genişletmektedir. Bu katkılar, insanın nesne-merkezli algısı ile makine öğrenmesi modelleri arasındaki boşluğu kapatarak, yaratıcı, bilimsel ve pratik alanlarda yapılandırılmış, sezgisel ve kullanıcı odaklı yapay zekâ uygulamaları için yeni ufuklar açmaktadır.
Özet (Çeviri)
A central goal in artificial intelligence is to enable machines to perceive the visual world as a composition of distinct objects. This ability for object-centric understanding is essential for generative models that support fine-grained, controllable content creation and editing. However, state-of-the-art diffusion models process images holistically and are conditioned on text, creating a semantic misalignment when tasked with object-level manipulation. As a result, researchers face a fundamental challenge: either adapt powerful but text-biased models or build specialized models from scratch, often with reduced capacity. This dissertation addresses this problem by introducing a framework that adapts pretrained generative models for object-centric image and video synthesis. Our analysis highlights a core challenge in current approaches: achieving high-quality generation requires balancing global scene coherence with disentangled, object-level control. To address this, we propose an adaptation strategy that integrates object-specific conditioning into pretrained models while preserving their valuable priors. Extending this framework to video further amplifies the difficulty, as maintaining temporal coherence and consistent object identity across frames is critical. For static images, we introduce SlotAdapt, a method that augments diffusion models with lightweight slot-based modules. A register token captures background and style, while slot-conditioned components encode object-specific information. This dual-pathway design mitigates text-conditioning bias and provides precise, object-centric control, leading to state-of-the-art results in object discovery, segmentation, compositional editing, and controllable image generation. We then extend the framework to video. Using Invariant Slot Attention (ISA) to disentangle object identity from pose, combined with a Transformer-based temporal aggregator, our approach ensures consistent object representation and dynamics across time. This framework sets new benchmarks in unsupervised video object segmentation and reconstruction, while enabling advanced video editing capabilities, including object removal, replacement, and insertion, all without explicit supervision. Overall, this work establishes a general and scalable approach to object-centric generative modeling for both images and videos. Beyond setting new technical baselines, it expands the design space for interactive and controllable generative tools, bridging the gap between human object-based perception and machine learning models. These contributions open new directions for structured, intuitive, and user-driven AI applications in creative, scientific, and practical domains.
Benzer Tezler
- Efficient autonomous driving with foundation models
Temel modeller ile verimli otonom sürüş
SHADI SAMEH MOHAMMED HAMDAN
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
Assist. Prof. Dr. FATMA GÜNEY
- Yapı teknolojisi eğitiminde parametrik YBM destekli pedagojik yöntemlerin değerlendirilmesi
Evaluation of parametric BIM-enabled pedagogical methods in construction technology education
MEHMET ÜMİT METERELLİYOZ
Doktora
Türkçe
2023
Mimarlıkİstanbul Teknik ÜniversitesiBilişim Ana Bilim Dalı
DOÇ. DR. OZAN ÖNDER ÖZENER
- Real-time human manipulation action recognition with a factorized graph sequence encoder
Ayrıştırılmış çizge dizi kodlayıcısı ile insan nesne etkileşimlerinin gerçek zamanlı olarak tanınması
ENES ERDOĞAN
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. SANEM SARIEL UZER
DOÇ. DR. EREN ERDAL AKSOY
- Cognitively-inspired deep learning approaches for grounded language learning
Temellendirilmiş dil öğrenimi için bilişsel esinli derin öğrenme yaklaşımları
OZAN ARKAN CAN
Doktora
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. DR. DENİZ YURET
- Acil yardım çağrısı jestlerinin bilgisayarla görü ve derin öğrenme yöntemleriyle gerçek zamanlı tespiti
Real-time detection of emergency call gestures using computer vision and deep learning methods
FERHAT ERDOĞAN
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilişim Sistemleri Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MUHAMMED KOTAN