Markov chain Monte Carlo Algorithm for Bayesian Policy Search
2019
0 views
0 downloads
Advisor: Assoc. Prof. Dr. Ahmet Onat ; Dr. Sinan Yıldırım
Abstract (TR)
Takviye Öğrenimindeki temel amaç, belirli bir parametrelenmiş kontrol politikanın en uygun parametrelerini aramaktır. Politika arama algoritmaları, ortamın yüksek boyutlu durum ve eylem alanlarından oluştuğu robotik alan gibi karmaşık dinamik sistemlere uygulanmaya uygun hale getirmenin yolunu açmıştır. Birçok politika arama tekniği geniş çaplı politika gradyan yöntemlerine dayanmasına rağmen, bu tür karmaşık ortamlara uygun olmaları nedeniyle performansları yavaş yakınsama veya yerel optima komplikasyonlarından etkilenebilir. Bunun nedeni, parametreleştirilmiş politikanın gradyan bileşenlerinin hesaplanma dürtüsünden kaynaklanmaktadır. Bu çalışmada, Takviye Öğrenme çerçevesine uygun politika arama problemi için bir Bayesian yaklaşımı elde ettik. İlgilendiğimiz konu, sürekli durum ve eylem alanları ile ayrık zaman bir Markov karar sürecini (MDP) kontrol etmektir. Gradyan yaklaştırmaları yerine, bir Posterior Dağılımından politika parametreleri için numune üretme yöntemi olarak bir Parçacık Markov Zinciri Monte Carlo (P-MCMC) algoritması geliştirerek bu alana katkıda bulunuyoruz. Bunu yapmak için, politika parametreleri üzerinde önceden bir yoğunluğu benimsiyoruz ve 'olasılığın' beklenen toplam ödül olduğu varsayılan posterior dağıtımı hedefliyoruz. Politikanın kümülatif muadili yerine performansını ölçmek için çoklayıcı beklenen toplam bir ödülün kullanıldığı riske duyarlı senaryolar açısından, metodolojimiz bir ödül fonksiyonunu çarpımcı bir formda kullanmaktan dolayı amaca uygundur. P-MCMC'nin yinelemelerinde parçacık filtresi olarak bilinen sıralı Monte Carlo'yu (SMC) tamamen kullanılabilir. Bu yöntemlerin son yıllarda istatistik ve mühendislik uygulamalarında yaygın olarak kullanıldığını belirtmekte fayda var. Ayrıca, politika araştırmasının bir başka zorlayıcı sorununu büyük boyutlu uzaylarda ele almak için, bir Uyarlamalı MCMC algoritması önerilecektir.
Author
Dr. Vahıd Tavakol Aghaeı
How to Cite
Vahıd Tavakol Aghaeı (Doktora Tezi). Markov chain Monte Carlo Algorithm for Bayesian Policy Search, 2019, Sabanci University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Sabanci University
- Populism, failures, and a sense of crisis(2019)
- Ways of seeing: Nev'izâde Atâ'i's Alemnümâ and changes in the visual perception of Ottoman society in the early Seventeenth century(2020)
- Who's There? staging the silenced pasts in contemporary theater in Turkey: Kim Var Orada? Muhsin Bey'in Son Hamleti(2020)
- An evaluation on the life of prostitutes in the late ottoman istanbul through the novels of Ahmed Midhat Efendi and Hüseyin Rahmi Gürpinar(2019)
- (Re)making the margins: An oral history of university students(2020)
- On maximum likelihood and sample moment estimators for the mth (central) moment in a normal and generalized gamma population(2020)
