Geri Dön

Learning object-centric representations based on slots in real world scenarios

Gerçek dünya senaryolarında slotlara dayalı nesne-odaklı temsillerin öğrenilmesi

  1. Tez No: 975112
  2. Yazar: ADİL KAAN AKAN
  3. Danışmanlar: PROF. DR. YÜCEL YEMEZ
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Bilgisayarla görme, Görüntü sentezleme, Computer vision, Image synthesis
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Koç Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Bilimi ve Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Yapay zekânın temel hedeflerinden biri, makinelerin görsel dünyayı ayrı nesnelerden oluşan bir bütün olarak algılamasını sağlamaktır. Nesne-merkezli anlayış, ince ayarlı ve kontrol edilebilir içerik üretimi ve düzenlemesini destekleyen üretici modeller için vazgeçilmezdir. Ancak güncel difüzyon modelleri görselleri bütüncül olarak işler ve metinlere koşullandırılır; bu da nesne düzeyindeki manipülasyon görevlerinde anlamsal bir uyumsuzluk yaratır. Bu nedenle araştırmacılar, ya güçlü fakat metin-ön yargılı modelleri uyarlamak ya da kapasitesi sınırlı yeni modeller geliştirmek gibi temel bir sorunla karşı karşıyadır. Bu tez, önceden eğitilmiş üretici modelleri nesne-merkezli görüntü ve video sentezi için uyarlayan bir çerçeve sunarak bu soruna çözüm getirmektedir. Analizimiz, mevcut yaklaşımlarda temel bir zorluk ortaya koymaktadır: yüksek kaliteli üretim elde etmek için küresel sahne tutarlılığını ayrıştırılmış nesne düzeyinde kontrol ile dengelemek gerekir. Bu dengeyi sağlamak için, değerli önbilgileri korurken önceden eğitilmiş modellere nesneye özgü koşullandırma entegre eden bir uyarlama stratejisi öneriyoruz. Bu çerçevenin videoya genişletilmesi sorunu daha da zorlaştırmaktadır; çünkü zamansal tutarlılık ve kareler boyunca nesne kimliğinin korunması kritik önem taşır. Durağan görüntüler için SlotAdapt yöntemini sunuyoruz. Bu yöntem, difüzyon modellerini hafif slot-tabanlı modüllerle genişletir. Bir kayıt token'ı arka planı ve tarzı yakalarken, slot-koşullu bileşenler nesneye özgü bilgileri kodlar. Bu çift-yollu tasarım, metin koşullandırma önyargısını azaltır ve hassas, nesne-merkezli kontrol sağlar; nesne keşfi, segmentasyon, bileşimsel düzenleme ve kontrol edilebilir görüntü üretiminde alanın en iyi sonuçlarını elde eder. Ardından çerçevemizi videoya genişletiyoruz. Invariant Slot Attention (ISA) kullanarak nesne kimliğini pozdan ayrıştırıyor, ayrıca Transformer-tabanlı bir zamansal toplayıcı ile zaman boyunca nesne temsillerinin ve dinamiklerinin tutarlı olmasını sağlıyoruz. Bu çerçeve, gözetimsiz video nesne segmentasyonu ve yeniden yapılandırmada yeni ölçütler belirlerken, nesne kaldırma, değiştirme ve ekleme gibi gelişmiş video düzenleme yeteneklerini de doğrudan gözetimsiz temsiller üzerinden mümkün kılmaktadır. Genel olarak, bu çalışma hem görüntüler hem de videolar için nesne-merkezli üretici modelleme adına genel ve ölçeklenebilir bir yaklaşım ortaya koymaktadır. Yalnızca yeni teknik standartlar belirlemekle kalmayıp, aynı zamanda etkileşimli ve kontrol edilebilir üretici araçların tasarım alanını da genişletmektedir. Bu katkılar, insanın nesne-merkezli algısı ile makine öğrenmesi modelleri arasındaki boşluğu kapatarak, yaratıcı, bilimsel ve pratik alanlarda yapılandırılmış, sezgisel ve kullanıcı odaklı yapay zekâ uygulamaları için yeni ufuklar açmaktadır.

Özet (Çeviri)

A central goal in artificial intelligence is to enable machines to perceive the visual world as a composition of distinct objects. This ability for object-centric understanding is essential for generative models that support fine-grained, controllable content creation and editing. However, state-of-the-art diffusion models process images holistically and are conditioned on text, creating a semantic misalignment when tasked with object-level manipulation. As a result, researchers face a fundamental challenge: either adapt powerful but text-biased models or build specialized models from scratch, often with reduced capacity. This dissertation addresses this problem by introducing a framework that adapts pretrained generative models for object-centric image and video synthesis. Our analysis highlights a core challenge in current approaches: achieving high-quality generation requires balancing global scene coherence with disentangled, object-level control. To address this, we propose an adaptation strategy that integrates object-specific conditioning into pretrained models while preserving their valuable priors. Extending this framework to video further amplifies the difficulty, as maintaining temporal coherence and consistent object identity across frames is critical. For static images, we introduce SlotAdapt, a method that augments diffusion models with lightweight slot-based modules. A register token captures background and style, while slot-conditioned components encode object-specific information. This dual-pathway design mitigates text-conditioning bias and provides precise, object-centric control, leading to state-of-the-art results in object discovery, segmentation, compositional editing, and controllable image generation. We then extend the framework to video. Using Invariant Slot Attention (ISA) to disentangle object identity from pose, combined with a Transformer-based temporal aggregator, our approach ensures consistent object representation and dynamics across time. This framework sets new benchmarks in unsupervised video object segmentation and reconstruction, while enabling advanced video editing capabilities, including object removal, replacement, and insertion, all without explicit supervision. Overall, this work establishes a general and scalable approach to object-centric generative modeling for both images and videos. Beyond setting new technical baselines, it expands the design space for interactive and controllable generative tools, bridging the gap between human object-based perception and machine learning models. These contributions open new directions for structured, intuitive, and user-driven AI applications in creative, scientific, and practical domains.

Benzer Tezler

  1. Efficient autonomous driving with foundation models

    Temel modeller ile verimli otonom sürüş

    SHADI SAMEH MOHAMMED HAMDAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    Assist. Prof. Dr. FATMA GÜNEY

  2. Yapı teknolojisi eğitiminde parametrik YBM destekli pedagojik yöntemlerin değerlendirilmesi

    Evaluation of parametric BIM-enabled pedagogical methods in construction technology education

    MEHMET ÜMİT METERELLİYOZ

    Doktora

    Türkçe

    Türkçe

    2023

    Mimarlıkİstanbul Teknik Üniversitesi

    Bilişim Ana Bilim Dalı

    DOÇ. DR. OZAN ÖNDER ÖZENER

  3. Real-time human manipulation action recognition with a factorized graph sequence encoder

    Ayrıştırılmış çizge dizi kodlayıcısı ile insan nesne etkileşimlerinin gerçek zamanlı olarak tanınması

    ENES ERDOĞAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. SANEM SARIEL UZER

    DOÇ. DR. EREN ERDAL AKSOY

  4. Cognitively-inspired deep learning approaches for grounded language learning

    Temellendirilmiş dil öğrenimi için bilişsel esinli derin öğrenme yaklaşımları

    OZAN ARKAN CAN

    Doktora

    İngilizce

    İngilizce

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    PROF. DR. DENİZ YURET

  5. Acil yardım çağrısı jestlerinin bilgisayarla görü ve derin öğrenme yöntemleriyle gerçek zamanlı tespiti

    Real-time detection of emergency call gestures using computer vision and deep learning methods

    FERHAT ERDOĞAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilişim Sistemleri Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ MUHAMMED KOTAN