Master'sOpen Access

Robust optimization of multi-objective multi-armed bandits with contaminated bandit feedback

2022
0 views
0 downloads
Advisor: Doç. Dr. Cem Tekin

Abstract (TR)

Çoklu hedefli, çoklu kollu haydut optimizasyonu problemi (MO-MAB), standard çoklu kollu haydut optimizasyonu probleminin (MAB) önemli bir varyasyonu olup, klinik deneylerden, çevrimici öneri sistemlerine kadar uzanan pek çok çeşitte aplikasyonda kullanılmaktadır. Bu çalışmada, karşı saldırı varlığında, çok kollu optimizasyon problemi ele alınmıştır. Her kol çekilmesinde, kol çekilmesinden elde edilen gerçek örneklem, 0 ile 0.5 arasında bir olasılıkla saldırıya maruz kalmakta ve örneklem kirlenmektedir. Ayrıca, saldırının, rastgele bir olasılık dağılımından seçilebildiği kabul edilmekte ve olasılık dağılımı üzerinde hiçbir sınırlama getirilmemektedir. Varolan MO-MAB calışmalarında önerilen metodlar, saldırı üzerinde çok katı sınırlamalar olmadığı sürece, dayanıksız kalmaktadır. Bu durum, bu algoritmaların, saldırının katı bir sınırlamaya tabi tutulmasının genellikle mümkün olmadığı, gerçek dünya problemlerinde, kötü bir performans göstermesine sebep olmaktadır. Literatürdeki bu boşluğu doldurmak için, dayanıklı, medyan temelli; Pareto setini, kirlenmiş örneklemlerden yola çıkarak, kullanıcı tarafından belirlenen isabet ve güven parametrelerine uygun olarak tahmin edebilen, iki ayrı metod önerilmiştir. Önerilen algoritmaların, tüm kollardan aldıkları toplam örneklem sayısının, isabet parametresine, ters kare orantıyla bağlı olduğu ispat edilmiştir. Bu ifade aynı zamanda, saldırı olmadığı durumu ele alan daha önceki çalışmalarda bulunan üst sınırla eşleşmektedir [1, Theorem 4], [2, Theorem 3]. Önerilen algoritma, sentetik ve gerçek veri kullanılarak yapılan deneylerle, literatürden, ortalama bazlı bir metod ile karşılaştırılmıştır. Sonuçlarımız, teorik beklentilerimizi karşılamakta ve karşı saldırı varlığında, dayanıklı öğrenmenin gerekliliğini ispat etmektedir.

Author

Dr. Kerem Bozgan

How to Cite

Kerem Bozgan (Yüksek Lisans Tezi). Robust optimization of multi-objective multi-armed bandits with contaminated bandit feedback, 2022, Bilkent University.

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Bilkent University