Robust optimization of multi-objective multi-armed bandits with contaminated bandit feedback
2022
0 views
0 downloads
Advisor: Doç. Dr. Cem Tekin
Abstract (TR)
Çoklu hedefli, çoklu kollu haydut optimizasyonu problemi (MO-MAB), standard çoklu kollu haydut optimizasyonu probleminin (MAB) önemli bir varyasyonu olup, klinik deneylerden, çevrimici öneri sistemlerine kadar uzanan pek çok çeşitte aplikasyonda kullanılmaktadır. Bu çalışmada, karşı saldırı varlığında, çok kollu optimizasyon problemi ele alınmıştır. Her kol çekilmesinde, kol çekilmesinden elde edilen gerçek örneklem, 0 ile 0.5 arasında bir olasılıkla saldırıya maruz kalmakta ve örneklem kirlenmektedir. Ayrıca, saldırının, rastgele bir olasılık dağılımından seçilebildiği kabul edilmekte ve olasılık dağılımı üzerinde hiçbir sınırlama getirilmemektedir. Varolan MO-MAB calışmalarında önerilen metodlar, saldırı üzerinde çok katı sınırlamalar olmadığı sürece, dayanıksız kalmaktadır. Bu durum, bu algoritmaların, saldırının katı bir sınırlamaya tabi tutulmasının genellikle mümkün olmadığı, gerçek dünya problemlerinde, kötü bir performans göstermesine sebep olmaktadır. Literatürdeki bu boşluğu doldurmak için, dayanıklı, medyan temelli; Pareto setini, kirlenmiş örneklemlerden yola çıkarak, kullanıcı tarafından belirlenen isabet ve güven parametrelerine uygun olarak tahmin edebilen, iki ayrı metod önerilmiştir. Önerilen algoritmaların, tüm kollardan aldıkları toplam örneklem sayısının, isabet parametresine, ters kare orantıyla bağlı olduğu ispat edilmiştir. Bu ifade aynı zamanda, saldırı olmadığı durumu ele alan daha önceki çalışmalarda bulunan üst sınırla eşleşmektedir [1, Theorem 4], [2, Theorem 3]. Önerilen algoritma, sentetik ve gerçek veri kullanılarak yapılan deneylerle, literatürden, ortalama bazlı bir metod ile karşılaştırılmıştır. Sonuçlarımız, teorik beklentilerimizi karşılamakta ve karşı saldırı varlığında, dayanıklı öğrenmenin gerekliliğini ispat etmektedir.
Author
Dr. Kerem Bozgan
Institution
How to Cite
Kerem Bozgan (Yüksek Lisans Tezi). Robust optimization of multi-objective multi-armed bandits with contaminated bandit feedback, 2022, Bilkent University.
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Bilkent University
- The Lower Danube in Late Antiquity: The case of Histria(2023)
- Oil price surges and the yield curve(2024)
- Essays on forward guidance(2014)
- Multi-armed bandit algorithms for communication networks and healthcare(2022)
- Comparative constitutional happiness in the light of the jurisprudence of the Turkish Constitutional Court(2023)
- Density functional theory investigation of linear carbon chains(2023)
