Master'sOpen Access

Novel deep reinforcement learning algorithms for continuous control

2023
1 views
0 downloads
Advisor: Prof. Süleyman Serdar Kozat

Abstract (TR)

Sürekli kontrol altında derin pekiştirmeli öğrenme algoritmaları, ham duyusal girdilerden doğrudan karmaşık ve yüksek boyutlu politikalar öğrenebilme kapasitesine sahiptir. Ancak, genellikle örnekleme verimliliği ve keşif ile ilgili zorluklarla karşılaşırlar, bu da gerçek dünya görevleri için uygulanabilinirliklerini sınırlar. Bu bağlamda, sürekli kontrol altında derin pekiştirmeli öğrenme algoritmalarının performansını geliştiren iki yeni teknik sunuyoruz. İlk teknik, aktör-eleştirmen metotlarında deneyleri örneklemek için yeni bir yaklaşım sunmaktadır. Öncelikli Deneyim Tekrar algoritması tarafından neden olunan kararsızlık ve ayrışmayı önlemek ve stabilize etmek için özel olarak tasarlanan tekniğimiz, zamansal-fark hatası ve politika gradyanı arasında denge sağlayarak hem aktör hem de eleştirmen ağlarını etkili bir şekilde eğitebilmektedir. Teorik analizler ve deneysel çalışmalar, yöntemimizin sürekli kontrol altında derin pekiştirmeli öğrenme algoritmalarının performansını iyileştirmede etkili olduğunu göstermektedir. İkinci teknik, içsel motivasyona dayalı yönlendirilmiş bir keşif stratejisini içermektedir. Hayvan motivasyon sistemleri üzerine kurulu kuramlardan esinlenerek ve bunları sürekli kontrol ortamına adapte ederek, stratejimiz, bilgilendirici ve çeşitlilik gösteren keşif davranışları oluşturmada etkinliğini sergilemektedir. Bunun, değer fonksiyonunun hatasını maksimize ederek ve mevcut literatürde bulunan içsel keşif hedeflerini birleştirerek gerçekleştiğini gösteriyoruz. Sunulan yöntemleri çeşitli sürekli kontrol testlerinde değerlendiriyor ve derin pekiştirmeli öğrenmede yeni performans seviyelerine ulaşarak mevcut en iyi yöntemleri geride bıraktığımızı gösteriyoruz.

Author

Dr. Baturay Sağlam

How to Cite

Baturay Sağlam (Yüksek Lisans Tezi). Novel deep reinforcement learning algorithms for continuous control, 2023, Bilkent University.

Keywords

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Bilkent University