Master'sOpen Access

A new mathematical programming formulation for multivariate regression clustering with a store clustering application in retail sector

2019
0 views
0 downloads
Advisor: Doç. Dr. Mevlüde Ebru Angün

Abstract (TR)

Kümeleme, birbirine benzer elemanların benzer gruplara ayrılmasını amaçlayan, gözetimsiz öğrenme tekniklerinden biridir. Doğrusal regresyon tabanlı kümeleme ise benzer elemanları, her bir grup için uyarlanan doğrusal regresyon model hatalarının belirli bir normda en iyilecek şekilde gruplamasıdır---literatürde genellikle L^2-normu (Öklid normu) minimize eden en küçük kareler yöntemi kullanılarak regresyon parametreleri tahmin edilir. Bu çalışma yüksek korelasyona sahip birden fazla bağımlı değişkenin varlığında kullanılabilecek doğrusal regresyon tabanlı kümeleme modelini dikkate almaktadır. Ayrıca iki adet yeni karmaşık tamsayılı doğrusal programlama formülasyonu önerilmiştir. İlk formülasyon literatürde bulunan klasik büyük M kısıtlı modelin birden fazla bağımlı değişkeni dikkate alacak şekilde genişletilmiş halidir. Bununla birlikte amaç fonksiyonunda L^1 ve L^2 norm yerine L^∞ normu minimize edilmektedir. Ancak büyük M değeri bilinmeyen kümeleme ve regresyon parametrelerine bağımlı olduğundan dolayı, uygun bir büyük M değerini önceden bilmek mümkün değildir. Çok büyük bir büyük M değeri çözümde sayısal dengesizliklere, çok küçük bir büyük M değeri ise optimal sonuca ulaşamamaya neden olmaktadır. Bu yüzden çalışmamızda büyük M kısıtlarını içeren klasik formülasyon yerine tip 1 özel sıralı set değişkenlerini içeren formülasyon önerilmiştir. Birden fazla çıktı değişkeni için önerilen yeni büyük M kısıtlı formülasyon literatürde bulunan JURA veri setine uygulanmıştır. JURA veri setindeki farklı bölgelerden alınan toprak örneklerinde ölçüm maliyeti düşük olan metallerin konsantrasyonu ile ölçüm maliyeti yüksek olan metallerin konsantrasyonu tahmin edilmeye çalışılmaktadır. Bu uygulamada, her bir çıktı değişkenini ayrı ayrı dikkate alarak gerçekleştirilen kümeleme sonuçlarının birbirinden farklı olduğu ve bu nedenle hangi örneğin hangi kümeye ait olduğu bilgisinin belirli olmadığı gösterilmiştir. Her çıktı değişkenini ayrı ayrı dikkate alarak gerçekleştirilen kümeleme sonuçları birbiri ile aynı olsa bile, bütün değişkenleri eş zamanlı değerlendirerek yapılan kümeleme sonuçlarından farklı olabilecektir. Bu nedenle birden fazla yüksek korelasyona sahip değişkenin bulunduğu durumlarda bu klasik yaklaşım yanlış kümeleme sonuçlarına neden olabilir. Son olarak, önerilen yeni matematiksel formülasyonlar Türkiye'de faaliyet gösteren bir moda perakendecisine ait mağazaların kümelenmesi problemine uygulanmıştır. Mağaza kümelenmesi kısaca önceden belirlenen özelliklere dayanarak benzer mağazaların gruplara ayrılmasını ifade eder. Bu kümeleme çalışmasının amacı küme bazında değişiklik gösterecek olan lokasyon, müşteri ve mağazaya ait özelliklerin ilgili mağaza performansı üzerindeki etkilerini belirlemek ve analiz etmektir. Önerilen matematiksel modeller Gurobi 8.1.0 çözücüsünde dal kesme algoritması kullanılarak çözümlenmiştir.

Author

Dr. Alper Altınoy

How to Cite

Alper Altınoy (Yüksek Lisans Tezi). A new mathematical programming formulation for multivariate regression clustering with a store clustering application in retail sector, 2019, Galatasaray University.

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Galatasaray University