Novel sampling strategies for experience replay mechanisms in off-policy deep reinforcement learning algorithms
2024
0 views
0 downloads
Advisor: Prof. Dr. Süleyman Serdar Kozat ; Prof. Dr. Sinan Gezici ; Doç. Dr. Ramazan Gökberk Cinbiş
Abstract (TR)
Deneyim tekrarı, pekiştirmeli öğrenme ajanlarının geçmiş deneyimlerini tekrar tekrar kullanarak öğrenme performansını etkili bir şekilde geliştirmesini sağlar. Varsayılan deneyim tekrarı gibi geleneksel stratejiler, tekrar oynatma arabelleğinden rastgele örnekler almayı içerir, bu da farklı geçişlerin değişen önemini hesaba katmadıkları için verimsizliklere yol açabilir. Öncelikli Deneyim Tekrarı (PER) gibi daha gelişmiş yöntemler, her geçişin örnekleme olasılığını algılanan önemine göre ayarlayarak bu sorunu çözmeyi amaçlar. Ancak, her yineleme sonrasında arabellekteki her geçiş için bu olasılıkları sürekli olarak yeniden hesaplamak, hesaplama açısından maliyetlidir ve büyük ölçekli uygulamalar için pratik değildir. Ayrıca, bu yöntemler genellikle Geçici Fark (TD) hatası gibi önceden tanımlanmış metriklere dayandıkları için, aktör-kritik tabanlı pekiştirmeli öğrenme algoritmalarının performansını doğrudan artırmazlar ve bir geçişin ajanın politikasına olan önemini doğrudan temsil etmezler. Bir geçişin önemi eğitim süresince dinamik olarak değişebilir, ancak mevcut yaklaşımlar hesaplama sınırlamaları nedeniyle buna uyum sağlamakta zorlanır. Hem varsayılan örnekleme stratejileri hem de PER gibi gelişmiş yöntemler belirli geçişlere karşı yanlılıklar getirir. Varsayılan deneyim tekrarı, genellikle başlangıçta rastgele bir politika tarafından oluşturuldukları için artık faydalı olmayabilecek eski geçişleri tercih etme eğilimindedir. Öte yandan, PER, yüksek TD hatalarına sahip geçişlere karşı yanlıdır; bu da genellikle kritik ağındaki hataları yansıtır ve TD hatası ile politika geliştirme arasında doğrudan bir ilişki olmadığı için politika ağı iyileştirmelerine karşılık gelmeyebilir. Bu zorluklar göz önüne alındığında, öğrenim sırasında yanlılığı azaltmak ve her geçişin güncellemelerde eşit sayıda kullanılmasını sağlamak için yeni bir örnekleme stratejisi öneriyoruz. Yöntemimiz, Düzeltici Sabit Deneyim Tekrarı (CUER), tüm geçişler için adil örnekleme sayılarına ulaşmak amacıyla verimli bir toplam-ağaç yapısını kullanır. CUER'in performansını çeşitli sürekli kontrol görevlerinde değerlendiriyoruz ve bunun, TD3 ve SAC gibi en gelişmiş politika dışı derin pekiştirmeli öğrenme algoritmalarına uygulandığında hem geleneksel hem de gelişmiş tekrar mekanizmalarından daha iyi performans gösterdiğini gösteriyoruz. Deneysel sonuçlar, CUER'in önemli bir hesaplama yükü getirmeden örnekleme verimliliğini sürekli olarak artırdığını, bu da daha hızlı yakınsama ve daha kararlı öğrenme performansına yol açtığını gösteriyor.
Author
Dr. Furkan Burak Mutlu
Institution
How to Cite
Furkan Burak Mutlu (Yüksek Lisans Tezi). Novel sampling strategies for experience replay mechanisms in off-policy deep reinforcement learning algorithms, 2024, Bilkent University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Bilkent University
- The Lower Danube in Late Antiquity: The case of Histria(2023)
- Oil price surges and the yield curve(2024)
- Essays on forward guidance(2014)
- Multi-armed bandit algorithms for communication networks and healthcare(2022)
- Comparative constitutional happiness in the light of the jurisprudence of the Turkish Constitutional Court(2023)
- Density functional theory investigation of linear carbon chains(2023)
