Analysis of context embeddings in word sense induction
2015
0 views
0 downloads
Advisor: Doç. Dr. Deniz Yuret
Abstract (TR)
Bir kelimenin anlamlarını elle hazırlanmış sözcüksel bir veritabanı ile temsil etmenin birden çok problemi bulunmaktadır. Bu tip sözlükler bir kelimeye ait tahmin ettiğimiz anlamı işaret edecek bir kayıt bulundurmayabilirler; zirâ sözlükler çok genel hazırlanmaktadırlar. Bu sözlükler bir kelimenin çok nâdir kullanılan anlamlarını içerirler fakat alana özgü anlamları barındırmayabilirler. Sözcük anlamı tümevarımı (word sense induction) kelimenin anlamlarını (kullanımlarını) ayırırken elle oluşturulmuş, durağan bir kaynak yardımı almadığından bu tip problemleri çözmektedir. Diğer popüler çözümlerin (muğlaklığı giderilmek istenen kelimenin birinci dereceden ya da ikinci dereceden birlikte görüldüğü diğer kelimeleri kullanarak elde edilen bir temsil üzerine kümeleme ya da çizge bölümlemesi gibi) aksine tezde takip ettiğimiz yöntem; muğlaklığını gidermek istediğimiz kelimeyle aynı bağlamda kullanılması ihtimâli yüksek olan kelimeleri ve bu kelimelerin olasılıklarını bir dil modeli yardımıyla bulup, bunları S-CODE adlı Öklitsel gömme (embedding) algoritması vasıtasıyla modellemektir. Bu algoritma ile kelime türü gömülerine (word embedding) ek olarak, kullandığımız yöntemle bağlam gömülerini (context embedding) de elde etmekteyiz. Bağlam gömüleri daha sonra $k$-means algoritması yardımıyla kümelenerek hedef kelimemize ait farklı kullanımlar ayrıştırılmaktadır. Bu yöntemin benzerleri önceki yıllarda gözetimsiz sözcük türü tümevarımı (unsupervised part-of-speech induction) ve gözetimli bağlılık ayrıştırması problemlerinde başarılı olmuşlardır. Yöntemimizi SemEval 2010, SemEval 2013 kelime anlamı tümevarımı yarışmalarında hazırlanmış veri kümelerinde ve OntoNotes projesinin (versiyon 5.0) işaretlediği cümleleri kullanarak bizim oluşturduğumuz, yüksek uzlaşmaya (>%90) ve en az 500 örneğe sahip kelimelerin bulunduğu bir sözcük veri kümesinde test ettik. Bu tezin literatüre katkısı şöyle özetlenebilir. (1) Sözcük anlamı tümevarımı problemi için bağlam temsillerinden yararlanan bir yöntem öneriyoruz. (2) (a) Literatürde önerilen kelime temsillerini, aynı bağlamda kullanılması ihtimâli yüksek olan kelimelerin olasılıklarını kullanarak bağlam temsillerine dönüstürüp kendi onerdigimiz bağlam temsilleriyle kıyasladık. (b) Farklı kümeleme algoritmalarını ($k$-means, Spectral Clustering, DBSCAN) ve bu algoritmaların Sözcük Anlamı Tümevarımı problemine özel farklı yaklaşımlarını (lokâl yaklaşım, sözcük türüne bağlı yaklaşım) kıyasladık. Son olarak, OntoNotes projesini kullanarak olusturduğumuz veri kümesini hazırlayan prosedürü, ilerde aynı problemle uğraşacak araştırmacılara yardımı dokunması ümidiyle paylaştık. Araştırmacılar aynı parametrelerle aynı veri kümesini üretip, bizim önerdiğimiz yöntem ile kendi sistemlerini karşılaştırabilir; yâhut farklı parametrelerle kendilerine uyacak bir veri kümesi üretebilirler. Yapılan çalışmayı ve alınan sonuçları tekrarlamak için gerekli kodlara https://github.com/osmanbaskaya/wsid adresinden ulaşılabilir.
Author
Dr. Osman Başkaya
Institution
How to Cite
Osman Başkaya (Yüksek Lisans Tezi). Analysis of context embeddings in word sense induction, 2015, Koç University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Koç University
- International marketing strategies of Ekom-Eczacıbaşı in the Russian market(1995)
- The Balkans in an Age of Baroque transformations in architecture, decoration, and patterns of patronage ad cultural production in Ottoman Europe, 1718-1856(2006)
- Single machine scheduling with timelag constraints(2014)
- Ottoman olfactory traditions in a palatial space: Incense burners in The Topkapi Palace(2015)
- The connectedness of the Rum Seljuks and the Kingdom of Georgia: A framework for artistic exchance in the thirteenth century(2015)
- Turkish coffee fortune-telling ritual as a source of inspiration for designing object-mediated advice interactions(2017)
