Markov chain Monte Carlo Algorithm for Bayesian Policy Search
Bu tez size mi ait?
Bu kayıt toplu arşivden geldi. Sizinse profilinize bağlayın.
2019
0 görüntülenme
0 i̇ndirme
Danışman: Assoc. Prof. Dr. Ahmet Onat ; Dr. Sinan Yıldırım
Özet (TR)
Takviye Öğrenimindeki temel amaç, belirli bir parametrelenmiş kontrol politikanın en uygun parametrelerini aramaktır. Politika arama algoritmaları, ortamın yüksek boyutlu durum ve eylem alanlarından oluştuğu robotik alan gibi karmaşık dinamik sistemlere uygulanmaya uygun hale getirmenin yolunu açmıştır. Birçok politika arama tekniği geniş çaplı politika gradyan yöntemlerine dayanmasına rağmen, bu tür karmaşık ortamlara uygun olmaları nedeniyle performansları yavaş yakınsama veya yerel optima komplikasyonlarından etkilenebilir. Bunun nedeni, parametreleştirilmiş politikanın gradyan bileşenlerinin hesaplanma dürtüsünden kaynaklanmaktadır. Bu çalışmada, Takviye Öğrenme çerçevesine uygun politika arama problemi için bir Bayesian yaklaşımı elde ettik. İlgilendiğimiz konu, sürekli durum ve eylem alanları ile ayrık zaman bir Markov karar sürecini (MDP) kontrol etmektir. Gradyan yaklaştırmaları yerine, bir Posterior Dağılımından politika parametreleri için numune üretme yöntemi olarak bir Parçacık Markov Zinciri Monte Carlo (P-MCMC) algoritması geliştirerek bu alana katkıda bulunuyoruz. Bunu yapmak için, politika parametreleri üzerinde önceden bir yoğunluğu benimsiyoruz ve 'olasılığın' beklenen toplam ödül olduğu varsayılan posterior dağıtımı hedefliyoruz. Politikanın kümülatif muadili yerine performansını ölçmek için çoklayıcı beklenen toplam bir ödülün kullanıldığı riske duyarlı senaryolar açısından, metodolojimiz bir ödül fonksiyonunu çarpımcı bir formda kullanmaktan dolayı amaca uygundur. P-MCMC'nin yinelemelerinde parçacık filtresi olarak bilinen sıralı Monte Carlo'yu (SMC) tamamen kullanılabilir. Bu yöntemlerin son yıllarda istatistik ve mühendislik uygulamalarında yaygın olarak kullanıldığını belirtmekte fayda var. Ayrıca, politika araştırmasının bir başka zorlayıcı sorununu büyük boyutlu uzaylarda ele almak için, bir Uyarlamalı MCMC algoritması önerilecektir.
Yazar
Vahıd Tavakol Aghaeı
Bu Yayına Nasıl Atıf Yapılır
Vahıd Tavakol Aghaeı (Doktora Tezi). Markov chain Monte Carlo Algorithm for Bayesian Policy Search, 2019, Sabancı University.
Anahtar Kelimeler
Lisans
Tüm Hakları Saklıdır
Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.
Sabancı University tezlerinden daha fazlası
- Internal party democracy in Turkey: Theory, prospect and problems(2019)
- Bride: Comes with a price / a visual narrative of bride exchange and child marriage(2019)
- Populism, failures, and a sense of crisis(2019)
- Ways of seeing: Nev'izâde Atâ'i's Alemnümâ and changes in the visual perception of Ottoman society in the early Seventeenth century(2020)
- Who's There? staging the silenced pasts in contemporary theater in Turkey: Kim Var Orada? Muhsin Bey'in Son Hamleti(2020)
- Two worlds meeting in one neighborhood: Receiving society members-Afghan workers relations in Yenimahalle, İstanbul(2019)
