Contextual multi-armed bandits with structured payoffs
2020
0 views
0 downloads
Advisor: Dr. Öğr. Üyesi Cem Tekin
Abstract (TR)
Çok kollu haydut (MAB) problemleri belirsizlik altında sıralı karar verme işlemini modellerler. Geleneksel MAB probleminde, öğrenici her turda bir kol seçer ve ardından seçilen kolun bilinmeyen ödül dağılımdan rastgele bir ödül gözlemler. Öğrenicinin amacı en yüksek ödülü veren kolları seçmeyi öğrenerek toplam ödülü ençoklamaktır. MAB'nin bir uzantısı olan bağlamsal MAB probleminde, öğrenici her turun başlangıcında bir bağlamı (yan bilgi) gözlemler, bir kol seçer ve dağılımı hem gelen bağlama hem de seçilen kola bağlı olan rastgele bir ödülü gözlemler. Başka bir MAB çeşidi olan tektepeli MAB'de ise beklenen ödülün kollar üzerinde tek tepeli bir yapı sergilediğini varsayar ve beklenen ödülün artış yönünü öğrenerek ``zirve'' ödüllü kolu tespit etmeye çalışır. Bu tezde, tek tepeli MAB probleminin bir uzantısı olan bağlamsal tek tepeli MAB problemi incelenmektedir ve bu modelin kollardaki ve bağlamlardaki yapılardan istifade ederek kablosuz iletişim alanında yapay zeka tabanlı radyo dizaynında güçlü bir araç olduğu gösterilmektedir. Yapay zeka özellikli telsizlerin, ağ kaynaklarını optimize etmeyi öğrenerek 5. nesil (5G) milimetre dalga (mmWave) ağlarının spektral verimliliğini artırması beklenmektedir. Ancak, kaynakların mmWave bandı üzerinden tahsis edilmesi, hızla değişen kanal koşulları nedeniyle son derece zordur. Bu tezde, bilinmeyen kanal istatistikleri altında ve herhangi bir kanal durum bilgisi (CSI) geri bildirimi olmaksızın mmWave radyo ağları için çeşitli tasarım olanakları altında çeşitli kaynak tahsisi problemleri ele alınmıştır: i) bir enerji hasat vericisi için dinamik oran seçimi, ii) heterojen uygulamalar için dinamik güç tahsisi ve iii) çok kullanıcılı bir ağda dağıtılmış kaynak tahsisi. Tüm bu problemlerde beklenen ödül hem kısmen sıralı kollar (iletişim parametreleri) üzerinde tek tepeli hem de kısmen sıralı bağlamlar (yan-bilgi) üzerinde tek tepeli veya monoton bir yapı sergilemektedir. Kolların üzerindeki yapı, keşfedilecek kolların sayısını azaltmaya yardımcı olurken, bağlamlar üzerindeki yapı, daha iyi seçimler yapmak için yakın bağlamlardan alınan geçmiş bilgileri kullanmaya yardımcı olur. Tez kapsamında iletişim parametrelerinin dinamik uyarlanması problemi yukarıda belirtilen özelliklere sahip yapılandırılmış getirili MAB olarak modellenmiş ve sıklıkçı ve Bayes tabanlı yaklaşımlara dayalı çevrimiçi öğrenme algoritmaları önerilmiştir. Bu algoritmaların pişmanlıklarının zamanda logaritmik olduğu kanıtlanmıştır. Tez kapsamında bunlar haricinde, dinamik olarak değişen kanal kullanılabilirliği ve gönderim hızı kısıtlamaları altında heterojen uygulamalara hizmet veren bilişsel bir radyo ağında dinamik hız ve kanal adaptasyonu problemi da ele alınmıştır. Problem bir Bayes öğrenme problemi olarak modellenmiş ve her bir hız-kanal çiftini iki boyutlu bir eylem olarak ele alan yeni bir öğrenme algoritması önerilmiştir. Bu problemde kullanılabilir eylemler kümesi, birincil kullanıcı etkinliğindeki ve ağ uygulamalarının gönderim hızı gereksinimlerindeki değişimler nedeniyle zaman içinde dinamik olarak değişir. Bunlara ek olarak, seçilebilen kol kümesinin sürekli olduğu durumları içeren senaryolar da çalışılmıştır. Son olarak, geliştirilen algoritmaların yukarıda belirtilen kaynak tahsisi problemlerinde performansı önemli ölçüde iyileştirdiğini simülasyonlar yoluyla da gösterilmiştir.
Author
Dr. Muhammad Anjum Qureshı
Institution
How to Cite
Muhammad Anjum Qureshı (Doktora Tezi). Contextual multi-armed bandits with structured payoffs, 2020, Bilkent University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Bilkent University
- The Lower Danube in Late Antiquity: The case of Histria(2023)
- Oil price surges and the yield curve(2024)
- Kripto varlıkların medeni hukuk bağlamında incelenmesi(2024)
- The evolution of a concept: "Vatan" from hometown to shared place(2024)
- Approaches to teaching creative writing in L2 at the tertiary level: A critical interpretive synthesis(2025)
- Living alone: Pathways, experiences and future expectations(2025)
