DoctorateOpen Access

Robust and adaptive deep reinforcement learning

2025
0 views
0 downloads
Advisor: Doç. Dr. Emre Uğur ; Prof. Dr. Erhan Öztop

Abstract (TR)

Bu tez, karmaşık, Markov olmayan ve durağan olmayan ortamlarda gürbüz ve uyarlanabilir pekiştirmeli öğrenme tabanlı etmenler geliştirme zorluğunu ele almaktadır. Koşullu Sinirsel Süreçler ile Gözetimsiz Meta-Sınama (UMCNP), sınama zamanında ödül sinyalleri eksik olduğunda bilinmeyen dinamikler altında az örnekli uyarlamayı hedeflemektedir. UMCNP, kendi ürettiği gezingeler aracılığıyla etkin örneklemli uyarlama sağlamak için bir model öğrenir. Çift yönlü İlerleyen Sinir Ağları ile Epizodik Getiri İlerlemesi (ERP-BPNN), otonom görev geçişi için yeni bir içsel motivasyon sinyali (ERP) ile morfolojik olarak farklı etmenler arasında yetenek aktarımını sağlayan çift yönlü ilerleyen sinir ağlarını birleştirerek insan esinli bir çoklu görev pekiştirmeli öğrenme çatısı sağlar. Yayınım Politikaları için Durum Geri Çatma (SRDP), bir durum geri çatma yitimini yayınım politikası öğrenme sürecine dahil ederek çevrimdışı pekiştirmeli öğrenmede dağılım dışı durumlara genelleme yapma zorluğunun üstesinden gelir. Durağan Olmayan Çevrimdışı Pekiştirmeli Öğrenmede Öngörü (FORL), koşullu yayınım modellerini olasılıksal örneksiz zaman dizisi temel modelleri ile birleştirerek zorlu durağan olmayan durumları ele alır. Bu çatı, ani, saklı gözlem sapmalarını proaktif olarak öngörür ve düzeltir. Sürekli kontrol, çevrimdışı pekiştirmeli öğrenme deneyleri ve robotik görevler üzerindeki deneysel değerlendirmeler, bu yöntemlerin etkinliğini doğrulamaktadır. Çıkarımlarımız, meta sınama örneklem etkinliğinde önemli iyileşmeler, getiri ilerlemesi kullanılarak eğitilen çift yönlü yetenek aktarımı yoluyla daha hızlı yakınsama, dağılım dışı durumlara üstün genelleme ve gözlem işlevindeki ani, Markov olmayan kaymalara karşı gürbüz başarı göstermektedir.

Author

Dr. Suzan Ece Ada

How to Cite

Suzan Ece Ada (Doktora Tezi). Robust and adaptive deep reinforcement learning, 2025, Boğaziçi University.

Keywords

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Boğaziçi University