Novel experience replay mechanisms to improve the performance of the deep deterministic policy gradients algorithms
2022
0 views
0 downloads
Advisor: Prof. Dr. Süleyman Serdar Kozat
Abstract (TR)
Tecrübe tekrar mekanizması, ajanların tecrübelerini birden çok kez kullanmasını sağlar. Daha önceki çalışmalarda, her bir tecrübenin örnekleme olasılığı, önemlerine göre ayarlanmıştır. Her yinelemeden sonra yeniden oynatma arabelleğindeki her geçiş için örnekleme olasılıklarını yeniden atamak oldukça verimsizdir. Bu nedenle, tecrübe tekrarı önceliklendirme algoritmaları, hesaplama verimliliği elde etmek için karşılık gelen tecrübe örneklendiğinde o tecrübenin önemini yeniden hesaplar. Ancak, ajanın politika ve değer fonksiyonu güncellendikçe geçişlerin önem düzeyi dinamik olarak değişmektedir. Ek olarak, tecrübe tekrarı, ajanın en son politikasından önemli ölçüde sapabilecek olan ajanın önceki politikaları tarafından oluşturulan tecrübeleri depolar. Ajanın en son politikasından daha yüksek sapma, ajan için zararlı olan daha fazla politika dışı güncellemelere yol açar. Bu tezde, her tecrübeye doğrudan öncelik vermek yerine toplu halde örneklenen tecrübelere öncelik veren, KL Iraksaması aracılığıyla Öncelikli Tecrübe Oynatma(KLPER) adında yeni bir algoritma geliştiriyoruz. Ayrıca, literatürdeki önceki deneyim tekrarlama algoritmaları, Derin Deterministik Politika Gradyanları algoritmalarının Aktör ve Kritik Ağlarına aynı tecrübe gruplarını sağlar. Ancak, bir derin deterministik politika gradyan algoritmasının bu iki kademeli bileşeninin öğrenme ilkeleri, parametre güncelleme stratejileri açısından farklılıklar içerir. Bu nedenle, derin deterministik politika gradyan algoritmalarının Aktör ve Kritiğinin eğitimini, ağların eğitimi sırasında kullandıkları tecrübe yığınları açısından ayırmaya çalışıyoruz. Aracının, Derin Deterministik Politika Gradyan Algoritmalarının Aktör ve Kritik için bağımsız olarak örneklenmiş tecrübe yığınlarını kullanmasını sağlayan, Ayrılmış Öncelikli Tecrübe Tekrarı (DPER) adlı yeni bir algoritma geliştiriyoruz. DPER, sırasıyla Kritik ve Aktörün öğrenme süreçlerini ayırmak için Öncelikli Tecrübe Tekrarı, PER ve KLPER kullanır. Algoritmalarımız olan KLPER ve DPER, mevcut son derin deterministik politika gradyan algoritmaları, DDPG ve TD3 ile birleştiriyor ve sürekli kontrol görevlerinde değerlendiriyoruz. KLPER, eğitim sırasında örnek verimliliği, nihai performans ve politikanın kararlılığı açısından derin deterministik sürekli kontrol algoritmaları için umut verici iyileştirmeler sağlar. Öte yandan, DPER, sürekli kontrol görevlerinin çoğunda PER, KLPER ve Vanilla Experience Replay'den daha iyi performans gösterir. DPER, önemli miktarda hesaplama karmaşıklığı eklemeden geleneksel deneyim tekrar oynatma stratejilerinden daha iyi performans gösterir.
Author
Dr. Doğan Can Çiçek
Institution
How to Cite
Doğan Can Çiçek (Yüksek Lisans Tezi). Novel experience replay mechanisms to improve the performance of the deep deterministic policy gradients algorithms, 2022, Bilkent University.
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Bilkent University
- The Lower Danube in Late Antiquity: The case of Histria(2023)
- Oil price surges and the yield curve(2024)
- Essays on forward guidance(2014)
- Multi-armed bandit algorithms for communication networks and healthcare(2022)
- Comparative constitutional happiness in the light of the jurisprudence of the Turkish Constitutional Court(2023)
- Density functional theory investigation of linear carbon chains(2023)
