Master'sOpen Access

Anahtar nokta gösterimlerinden desteklenerek başlatılmış ve Bayessel optimize edilmiş politika öğrenimi

2022
0 views
0 downloads
Advisor: Dr. Öğr. Üyesi Barış Akgün

Abstract (TR)

Pekiştirmeli öğrenme (PÖ), robotlara beceriler kazandırmak için gelecek vaadeden bir yaklaşımdır. Bununla birlikte, PÖ kullanarak iyi sonuçlar elde etmek için birçok deneme yapmak gerekir. Gösterimlerden Öğrenme (GÖ) destekli PÖ, insan gösterimlerinden başlangıç becerisi öğrenerek bu sorunun etkisini azaltır. Ne yazık ki, GÖ destekli PÖ hala daha robotların beceri öğrenmesi için fazla denebilecek miktarda deneme gerektirir. Bu çalışmada, bu deneme sayısını daha da azaltmak için bir yaklaşım geliştirdik. Başlıca katkılarımız, (1) keşfe odaklanan bir algoritma ve (2) Yol İntegralleriyle Politika İyileştirme yöntemini geliştiren kapalı kutu politika bulma yöntemi olan Bayessel Optimize Edilmiş Politika Öğrenimi methodur (BO-PI$^{2}$). GÖ yapımız, becerinin hareketini (robot kol pozu) ve hedefini (nesneye özgü algısal veriler) birlikte modellemek için anahtar nokta gösterimlerini ve bunlardan öğrenilen bir Dinamik Bayessel Ağ'dan (DBA) yararlanır. Bu ağın hareket bölümü robot hareketini modellemek için, hedef bölümü ise hareketin başarısını izlemek ve Kısmen Gözlenebilir Markov Ödül Modeli oluşturarak ödül sinyali oluşturmaya yarar. BO-PI$^{2}$, öğrenilen ödül sinyali sayesinde DBA'nın hareket bölümünü geliştirir. BO-PI$^{2}$'nin yeniliği, keşif stratejisinden gelir. Hareket ve hedef arasındaki bağlantı deneme miktarını azaltmak için yeteneğin odaklanılacak kısmını seçmek için kullanılır. Bu yaklaşım, bir anlamda kredi atama sorununu çözmeye benzer. Odaklanacak kısım seçildikten sonra, BO-PI$^{2}$, PÖ yaklaşımlarının tipik olarak kullandığı denemeleri üretmek için hareket modelini kullanır. BO-PI$^{2}$, bu işlem sırasında yürütülen hareketler ile gelişen kümülatif ödülleri öğrenmek için Gaussal Süreç modeli (GS) kullanır. BO-PI$^{2}$ bir sonraki hareket noktalarını Üst Güven Sınırı (ÜSB) algoritmasını kullanarak seçer. Bu algoritma adayların tahmin edilen ödül ve belirsizliğine dayanır. Bu, çoğu PÖ yaklaşımında kullanılan rastgele hareket yaratmaktan farklıdır. BO-PI$^{2}$ ayrıca yeteneği öğrendiğinde erken durmak için hedef modeline dayanan bir sonlandırma kriterinden faydalanır. Bu çalışmada BO-PI$^{2}$'yi 3 beceri için uzman ve uzman olmayanlar alınmış anahtar nokta gösterimleriyle test ettik. Uzmanlar tarafından verilmiş gösterimlerden öğrenilen hareket modelleri başarılı oldukları için, elle yapılan müdahalelerle başarısız hale getirdik. Uzman olmayan kişilerden alınmış gösterimlerde ise başlangıçta başarısız olan haraket modellerini seçtik. Yaklaşımımızı şu zamana kadar ki en başarılı sonuçları elde etmiş PI$^{2}$-ES-Cov algoritmasına karşı üç metrikde karşılaştırdık, bunlar: (1) beceri başarı oranı, (2) toplam birikmiş ödül ve (3) deneme sayısı. Hem uzman, hem de uzman olmayan durumlarda, yaklaşımımız ortalama olarak her üç metrikte de PI$^{2}$-ES-Cov dan daha iyi performans gösterdi. Sonuçlarımız, anahtar nokta gösterimlerinin bütün gezingeden ziyade başarısız olan kısımlara odaklanmamıza izin verdiğini ve bunun ödül tahminine dayalı keşif stratejileriyle birleştirildiğinde, PÖ performansını iyileştirdiğini ve robot kollarını gerçek hayatta kullanılacak yeteneklerle donatmak için deneme sayısını azaltmaya faydalı olduğunu gösteriyor.

Author

Dr. Onur Berk Töre

How to Cite

Onur Berk Töre (Yüksek Lisans Tezi). Anahtar nokta gösterimlerinden desteklenerek başlatılmış ve Bayessel optimize edilmiş politika öğrenimi, 2022, Koç University.

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Koç University