DoctorateOpen Access

Gerçek dünya senaryolarında slotlara dayalı nesne-odaklı temsillerin öğrenilmesi

2025
0 views
0 downloads
Advisor: Prof. Dr. Yücel Yemez

Abstract (TR)

Yapay zekânın temel hedeflerinden biri, makinelerin görsel dünyayı ayrı nesnelerden oluşan bir bütün olarak algılamasını sağlamaktır. Nesne-merkezli anlayış, ince ayarlı ve kontrol edilebilir içerik üretimi ve düzenlemesini destekleyen üretici modeller için vazgeçilmezdir. Ancak güncel difüzyon modelleri görselleri bütüncül olarak işler ve metinlere koşullandırılır; bu da nesne düzeyindeki manipülasyon görevlerinde anlamsal bir uyumsuzluk yaratır. Bu nedenle araştırmacılar, ya güçlü fakat metin-ön yargılı modelleri uyarlamak ya da kapasitesi sınırlı yeni modeller geliştirmek gibi temel bir sorunla karşı karşıyadır. Bu tez, önceden eğitilmiş üretici modelleri nesne-merkezli görüntü ve video sentezi için uyarlayan bir çerçeve sunarak bu soruna çözüm getirmektedir. Analizimiz, mevcut yaklaşımlarda temel bir zorluk ortaya koymaktadır: yüksek kaliteli üretim elde etmek için küresel sahne tutarlılığını ayrıştırılmış nesne düzeyinde kontrol ile dengelemek gerekir. Bu dengeyi sağlamak için, değerli önbilgileri korurken önceden eğitilmiş modellere nesneye özgü koşullandırma entegre eden bir uyarlama stratejisi öneriyoruz. Bu çerçevenin videoya genişletilmesi sorunu daha da zorlaştırmaktadır; çünkü zamansal tutarlılık ve kareler boyunca nesne kimliğinin korunması kritik önem taşır. Durağan görüntüler için SlotAdapt yöntemini sunuyoruz. Bu yöntem, difüzyon modellerini hafif slot-tabanlı modüllerle genişletir. Bir kayıt token'ı arka planı ve tarzı yakalarken, slot-koşullu bileşenler nesneye özgü bilgileri kodlar. Bu çift-yollu tasarım, metin koşullandırma önyargısını azaltır ve hassas, nesne-merkezli kontrol sağlar; nesne keşfi, segmentasyon, bileşimsel düzenleme ve kontrol edilebilir görüntü üretiminde alanın en iyi sonuçlarını elde eder. Ardından çerçevemizi videoya genişletiyoruz. Invariant Slot Attention (ISA) kullanarak nesne kimliğini pozdan ayrıştırıyor, ayrıca Transformer-tabanlı bir zamansal toplayıcı ile zaman boyunca nesne temsillerinin ve dinamiklerinin tutarlı olmasını sağlıyoruz. Bu çerçeve, gözetimsiz video nesne segmentasyonu ve yeniden yapılandırmada yeni ölçütler belirlerken, nesne kaldırma, değiştirme ve ekleme gibi gelişmiş video düzenleme yeteneklerini de doğrudan gözetimsiz temsiller üzerinden mümkün kılmaktadır. Genel olarak, bu çalışma hem görüntüler hem de videolar için nesne-merkezli üretici modelleme adına genel ve ölçeklenebilir bir yaklaşım ortaya koymaktadır. Yalnızca yeni teknik standartlar belirlemekle kalmayıp, aynı zamanda etkileşimli ve kontrol edilebilir üretici araçların tasarım alanını da genişletmektedir. Bu katkılar, insanın nesne-merkezli algısı ile makine öğrenmesi modelleri arasındaki boşluğu kapatarak, yaratıcı, bilimsel ve pratik alanlarda yapılandırılmış, sezgisel ve kullanıcı odaklı yapay zekâ uygulamaları için yeni ufuklar açmaktadır.

Author

Dr. Adil Kaan Akan

How to Cite

Adil Kaan Akan (Doktora Tezi). Gerçek dünya senaryolarında slotlara dayalı nesne-odaklı temsillerin öğrenilmesi, 2025, Koç University.

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Koç University