Kısa metinlerde varlık ismi tanıma
2015
0 views
0 downloads
Advisor: Yrd. Doç. Dr. Ahmet Cüneyd Tantuğ
Abstract (TR)
Ağ ortamının gelişmesi ve Web 2.0 olarak adlandırılan sürece girmesi ile birlikte içeriklerini kullanıcıların oluşturduğu sosyal medya siteleri, mikroblog (internet günlüğü) sitelerinin sayısı ve popülerliği artmıştır. Bu sitelerde paylaşılan metinlerin içinden istenilen bilgiye makineler yardımı ile kolayca ulaşma ve bilgileri yorumlama noktasında doğal dil işleme devreye girmektedir. Doğal dil işleme insanların konuştuğu dili bilgisayarların yorumlayabilmesini amaçlayan çalışmaları kapsar. Yapay zeka ve dilbilimin bir alt dalıdır. Varlık ismi tanıma ise doğal dil işlemenin çalışma alanlarından bilgi çıkarımının bir alt dalı olup metinlerden geçen varlık isimlerinin tanınması ile ilgilenir. Varlık ismi tanıma kapsamında varlık isimleri tespit edilir ve önceden tanımlanmış kategorilere göre sınıflandırılırlar. Bu kategorilerden en çok kullanılanları temel olarak kişi, organizasyon, yer, tarih, saat, para, yüzde varlıklarıdır. Varlık ismi tanıma makine çevirisi, bilgi elde etme, duygu analizi, multimedia indeksleme, soru-cevap sistemleri gibi diğer doğal dil işleme uygulamalarınında kullanılabilmektedirler. Kurallı yazılmış metinlerde varlık ismi tanıma problemi %95 seviylerine yaklaşmış iken, imla kurallarına uymadan kuralsız ve rahat bir dille yazılan metinlerde performans %50 seviyelerine düşmektedir. Kuralsız metinlerde başarımı yükseltmek adına litaratürde genel olarak iki eğilim görülmektedir; kuralsız metinler normalize edilerek kurallı formata dönüştürülür ve mevcut araçlara uygun hale getirilir ya da kuralsız metinlerin doğasına uygun yeni yöntemler ve araçlar geliştirilir. Normazliasyon ciddi ve kompleks bir doğal dil işleme alanıdır. Bu çalışmada amaç kuralsız metinlerde kompleks bir normalizasyon uygulamadan varlık ismi tanıma yöntemleri geliştirmektir. İstatistiksel öğrenme tekniklerinden koşullu rastgele alanlar yöntemi kullanılarak tweet verileri üzerinde varlık ismi tanıma çalışmaları yapılmıştır. Twitter adlı mikroblog sitesinde kullanıcıların paylaştığı 140 karakterle sınırlı kısa metinlere tweet denilmektedir. Bu metinler yazım ve dilbilgisi kurallarına uymadıkları gibi yabancı ve argo kelimeler, gülensuratlar (smiley) içerebilmektedirler. Tweetlerin rahat ve kuralsız doğası doğal dil işleme çalışmalarını zorlu bir hale getirmektedir. Çalışmada iki yöntem kullanılmıştır. İlki daha önceki yöntemlere dayanan kurallı yazılmış haber metinlerde başarımı ispatlanmış, biçimbilimsel özelliklere dayanan bir yöntemdir. İkincisi ise biçimbilimsel özellikler yerine kabaca kelimenin ilk N ve son N harfleri kullanılarak geliştirilen bir yöntemdir. Türkçenin zengin biçimsel yapısından dolayı biçimbilimsel özelliklerin doğal dil işleme çalışmalarında kullanılması kaçınılmaz bir durumdur. Fakat tweet metinlerinin biçimbilimsel çözümleme aşamasında başarılı sonuçlar elde edilememektedir, dolayısı ile bu çalışmada biçimbilimsel özellikler yerine kelimenin ilk N ve son N harfleri ile biçbilimsel bilgiler yakalanmıştır. Şöyle ki kelimenin ilk 3-4 harfi kelimenin kök bilgisini içerebilmekteyken, son 3-4 harfi ise kelimenin aldığı eklerin bilgilerini içerebilmektedir. Her iki yöntemde kurallı ve kuralsız metinlerde denenmiştir, kurallı metinler türünde haber metinleri, kuralsız metinler türünde tweetler kullanılmıştır. Test sonuçlarına göre heber metinlerinde her iki yöntemle neredeyse aynı başarım elde edilirken, tweet metinlerinde başarım yaklaşık %6 oranında yükselmiştir. Bu demektir ki ilk yöntemde kullanılan biçimbilimsel çözümleme ve belirsizlik giderme araçlarına ihtiyaç duymadan kelimenin ilk ve son N harfleri ile kabaca biçimbilimsel özellikler elde edilerek varlık ismi tanıma probleminde kullanılabilir. Temel yöntem ve geliştirilen yöntemlerde biçimbilimsel aşamaların farklılıklarına ek olarak sözcüklerin küçük/büyük harf bilgileri, cümle başlangıcında bulunup bulunmamaları bilgisi ve sözlük bilgilerinden yararlanılmıştır. Geliştirilen yöntemde bunlara ek olarak tüm eğitim, sınama verileri ve sözlükler asciification işleminden geçirilmiştir. Asciification metindeki Türkçe karakterlerin (ö, ç, ş, ı, ğ, ü) ASCII tablosu karşılıklarına (o, c, s, i, g, u) dönüştürülmesini kapsayan bir terimdir. Tweet metinleri genellikle Türkçe karakterlerin kullanımına dikkat edilmeden yazıldıkları için Asciification işlemi uygulanmıştır, yanlış yazılan kelimeleri normalize etmek yerine tüm verilerden Türkçe karakterleri kaldırma yöntemi tercih edilmiştir. Varlık isimlerini içeren geniş sözlüklerin kullanımına varlık ismi tanıma sistemlerinden sıklıkla başvurulur. Bu çalışmada kişi, yer ve organizasyon olmak üzere üç adet isim sözlüğü kullanılmıştır, sisteme verilen girdi metindeki sözcükler sözlükler ile eşleştirilerek varlık ismi olup olmadığına karar verilebilir. Geliştirilen yöntemde temel alınan yönteme ek olarak sözlük eşleştirmesinde kısmı eşleşme yöntemi kullanılmıştır. Kısmi eşleşmenin amacı tweetlerde kelimelerin birkaç harfini atlayarak yanlış yazılan varlık isimlerinin tespitini sağlamaktır. Örneğin "Mehmet" yerine "Mhmet" yazılabilmektedir. Böyle yanlış yazılmış varlık isimlerini tespit etmek amacıyla girdi metindek sözcükler ile sözlükteki kelimelerin Levenshtein mesafe algoritması ile uzaklıkları hesaplanmış ve küçük uzaklıktaki kelimeler aday varlık ismi olarak gösterilmiştir.
Author
Dr. Beyza Eken
Institution
How to Cite
Beyza Eken (Yüksek Lisans Tezi). Kısa metinlerde varlık ismi tanıma, 2015, Istanbul Technical University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Istanbul Technical University
- Investigation Of Stretching Effect With Mixed Finite Element Formulations For Laminated Beams And Plates(2023)
- Veri madenciliği yöntemlerini kullanarak anemi sınıflandırılmasına yönelik bir uygulama(2015)
- Moebius elektrolizi anot çamurlarından platin grubu metallerin uzaklaştırılması ve geri kazanımı(2015)
- Bir II. Alman İmparatorluğu projesi: Kaiser Wilhelm Anıtı'ndan Alman çeşmesine(2015)
- Soil salinity mapping by integrating remote sensing data with ground measurements; a case study in Lower Seyhan Plate, Adana, Turkey(2015)
- Kil çekirdekli toprak dolgu atık barajlarında sızmanın nümerik metotlarla araştırılması(2015)
