Master'sOpen Access

Reinforcement learning based resource allocation for initial disasterresponse

2023
0 views
0 downloads
Advisor: Dr. Öğr. Üyesi Barış Akgün

Abstract (TR)

Afet sonrası müdahalelerin etkin, adil ve hızlı olması mecburidir. Deprem gibi büyük çapta etkileri olan afetlerin ardından kaynakların sınırlı olması, bu kaynakların yönetimi noktasında afetle mücadeleye güçlük oluşturmaktadır. Bu tez çalışmasında, afetten etkilenen bir bölgeye müdahalede sınırlı olan bu kaynakların yönetimi için pekiştirmeli öğrenme tabanlı kaynak yönetimi yaklaşımımızı sunuyoruz. Pekiştirmeli öğrenme tabanlı yaklaşımımız şu şekildedir. İki boyutlu bir afet şiddet haritası bizim durum uzayımızı belirtmektedir.Bir kaynağın, destek biriminin, belirli bir noktaya atanması ise eylem uzayımızı ifade eder. Basit bir simulasyon yardımıyla sanallaştırdığımız afet senaryosunda destek birimlerinin sönümlendiği afet hasarları miktarı kaynak yönetiminin etkinliğini, kaynakların bölgeye yayılım miktarı kararların ne kadar adil olduğunu gösterir. Bu metrikleri kullanarak tüm atama sonrasında bir ödül hesaplaması yapıyoruz. Ayrıca, bu formulasyonda karşılaşı-lan problemleri azaltmak amaçlı her adımda ödüllendirme esaslı bir hesaplamamız daha mevcut. Çalışmamızda, iki farklı derin q-öğrenmesi tabanlı ajanlar eğittik. Biri sadece nihai durumda ödüllendirilirken, diğeri hem her adımda hem de nihai durumda ödüllendirildi. İki boyutlu olarak tasarladığımız dünya modellemesi durum ve eylem uzaylarının fazlaca geniş olmasını da beraberinde getirdi. Parametre sayılarını düşürmek ve model varsayımı eklemek için kullanacağımız modeli evrişimli sinir ağları üzerine kurguladık. Ayrıca, açgözlü yaklaşım ajanı geliştirip, her adımda ödüllendirme esaslı yaklaşımımıza bir taban oluşturduk. Modelleri değerlendirme süreçlerimiz iki farklı şekildedir. Birincisi, oyuncak haritalar diye isimlendirdiğimiz senaryolarımız üzerinde niteliksel davranış değerlendirme-leri yapıyoruz. İkinci olarak, kentsel senaryolarımızda ise niceliksel değerlendirmelerimizi yapıyoruz. Her iki değerlendirmede de kullandığımız senaryolar modellerin eğitilme aşamasında hiç karşılaşmadığı haritalardır. Nitelik değerlendirmelerimizde açgözlü yaklaşımın, beklendiği gibi, yayılımı dikkate almadığı, sadece afet şiddeti yoğun olan bölgelere kaynak ataması yaptığını gözlemledik. Nihai durumda ödüllendirdiğimiz ajanımızın ise çok yoğun olan bölgeleri gözden kaçırdığını, her adımda ve nihai durumda ödüllendirdiğimiz ajanımızın ise hem yayılımı hem de şiddetli noktaları dikkate aldığını ortaya koyduk. Niceliksel değerlendirmelerimizde de niteliksel değerlendirmelerimize paralel çıka-rımlar elde ettik. Açgözlü ajanımız yayılım hususunda başarısız olduğunu ve nihai durumda ödüllendirdiğimiz ajanımızın afet sönümlemelerinde geride kaldığını gözlemledik. Açgözlü ajanımız her lokasyonun değerini her adımda hesaplaması sebebiyle eğitilmiş modellerimize nazaran çok geride kaldığını, karar alım sürecinin çok uzun olduğunu belirledik. Genel olarak ifade etmek gerekirse, hem her adımda hem de nihai durumda ödüllendirdiğimiz ajanımız en iyi performansı gösterdi. Karar alımının hızlı olduğunu, atamalar sonrasında destek birimlerinin sönümlediği afet miktarının daha fazla olduğunu ve yayılımın daha geniş kapsama alanını etkilediğini niceliksel ve niteliksel olarak ortaya koyduk. Bu tez çalışmasında, ana amacımız pekiştirmeli öğrenmenin geniş çaplı kaynak yönetimi problemlerinde uygulanabilir olduğunu göstermektir. Öyle ki, çalışmamızda bazı basitleştirici varsayımlar yaptık. Örneğin, afetten farklı etkilenen farklı lokasyonlar için değişik tiplerde destek birimleri gerekiyor olsa da, çalışmamızda tek tip bir kaynak üzerine yoğunlaştık. Aksi durumda, her bir tip destek birimi için birden fazla yapay zeka ajanı eğitiyor olmamız gerekebilirdi. Ayrıca, kaynakların dağılım maliyetini de göz önüne almadık. Kaynak ataması sonrasında destek birimlerinin ilgili yerlere herhangi bir engel olmadan ulaşılabilir olduğu bir dünya tasarladık. Her ne kadar her adım ödüllendirme esaslı yaptığımız çalışmalarda ayrıca bir geliştirme yapma ihtiyacımız doğsa da, bu hali ile afet simulatörümüz ve nihai durum ödüllendirmelerimizi yeterli bir şekilde kapsayacak altyapı ihtiyacımızı karşıladı. Diğer bir varsayımımız ise, durağan bir afet doğası üzerinde çalışıyor olmamızdır. Çalışmamıza deprem odaklı başlamamız sebebiyle araştırma süreçlerimiz bu şekilde ilerledi. Büyük ölçekli yangınlar gibi dinamik felaketler de simülatöre dahil edilebilir ancak bu, felaketin nasıl geliştiğine ilişkin bilgilerin de yaklaşımımız ve altyapımıza dahil edilmesi için durum uzayında ek çalışma yapılmasını gerektirecektir. Bu tez çalışması, gelişigüzel karmaşık hedeflerin kullanılması ve ortam stokasti-sitesinin dahil edilmesi potansiyeline ek olarak, hedef yapıya ilişkin varsayımlar olmadan geniş durum ve eylem uzaylarıyla çalışabilen afet müdahalesine yönelik ilk kaynak tahsis yaklaşımını sunmaktadır. Çalışmalarımız, basitleştirici varsayımları ortadan kaldıracak daha karmaşık afet senaryoları ve hedef fonksiyonları ile bu alanda yapılacak çalışmaların önünü açacaktır.

Author

Dr. Esat Tunahan Tuna

How to Cite

Esat Tunahan Tuna (Yüksek Lisans Tezi). Reinforcement learning based resource allocation for initial disasterresponse, 2023, Koç University.

Keywords

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Koç University