Türkçe metinlerde duygu analizi
2015
0 görüntülenme
0 i̇ndirme
Danışman: Yrd. Doç. Dr. Ahmet Cüneyd Tantuğ
Özet (TR)
Başkalarının ne düşündüğü, biz insanlar için her zaman merak konusu olmuştur. "İnsanlar ne düşünüyor?" sorusu, aynı zamanda üretim, pazarlama, hizmet ve reklamcılık firmaları için de toplumun, ürün, hizmet ve marka isimleri hakkındaki görüşlerini öğrenmeleri açısından son derece önemlidir. Genel olarak firmalar, kullanıcı/müşteri analizini, ya müşterilerden görüşlerini içeren geri bildirim formları toplayıp, elle analiz edip, çıkarımlarda bulunarak ya da bir anket firmasına yüklü miktarlar ödeyerek, anketler ile yapmaya çalışırlar. Ancak bu yöntemler istatistiksel olarak geniş kitlelere ulaşılmasında çok yetersiz, insan emeği bağlamında masraflı yöntemlerdir. Sosyal medya platformları ve diğer internet ortamları özellikle hedef kitleden geri dönüşüm alabilmek için önemli ve yeterince geniş kaynaklardır. Ancak bunları insan eliyle analiz etmek neredeyse imkansızdır. Bu noktada Duygu (Sentiment) Analizi (DA) araçları devreye girerler ki bunların, sosyal platformları gözlemlemek için en işlevsel araçlar olduğu söylenebilir. Bir metinde ilgili konu hakkındaki tutum, ancak DA yapılarak anlaşılabilir. DA bir metnin duygu barındırıp barındırmadığı ve bu duygunun olumlu ya da olumsuz olma durumunun saptanması sürecidir [1]. Duygu barındıran metinler genellikle görüş ya da değerlendirme içerirler. Bu görüş ve analizler herhangi bir konu, şahıs, marka ya da siyasi görüş hakkında olabilir. İnternet olmadan önce dijital ortamdaki veri ve bu veriye ulaşım imkanları çok kısıtlıydı. İnternet'in yaygınlaşmasıyla beraber insanlar belli konular hakkındaki görüşlerini forumlar, bloglar ve sosyal medya platformlarında paylaşmaya başladılar. Bu paylaşımlardaki görüşler, sosyal analiz ve anketler için olduğu gibi firmaların da kendileri, ürünleri veya hizmetleri ile ilgili araştırmaları ve analizleri için değerli kaynaklar oluştururlar. Dijital platformlarda hızla biriken büyük oranda verinin insanlar tarafından işlenmesi çok zor olduğundan otomatik olarak bilgisayarlarla yapılması kaçınılmaz bir durum olmuştur. Bu verilerin bilgisayarlar tarafından hızlı bir şekilde işlenebilmesi ise, bu kaynakların, piyasada kullanılabilmesine imkan sağlamıştır. Duygu analizi, Doğal Dil İşleme (DDİ) ve metin madenciliği için zor bir çalışma alanıdır. Piyasa değerinin olması ve pratik sonuçlar alınabilmesi hem akademik çalışmaların hem de endüstrinin bu alana ciddi bir şekilde yönelmesini sağlamıştır. Ancak görüş/duygu bildiren kaynakları WEB üzerinde bulmak ve onlara ulaşıp işlemek hâlâ zorlu bir görev olarak karşımızda durmaktadır. Çünkü her biri büyük miktarda görüş/duygu barındıran geniş sayıda farklı kaynaklar mevcuttur ve bu kaynakların birçoğunda, görüş/duygu uzun metinler içerisinde gizli bir şekilde yer alır. Bir insan için ilgili kaynakları bulmak, o kaynaklardan ilgili görüş/duygu içeren kısımları bulup onları özetlemek ve kullanılabilir bir biçimde organize etmek çok zor ve zahmetli bir iştir. Bundan dolayı, otomatik olarak görüş/duygu keşfetmek, analiz etmek ve özetlemek için özel sistemlere ihtiyaç vardır. Görüş madenciliği olarak da bilinen DA, bu ihtiyaçlardan doğar. Sosyal analiz ve anketlerin otomatik olarak yapılabilmesi için DA'nin büyük veri kümeleri üzerinde otomatik olarak bilgisayarlara yaptırılması gerekir. Otomatik DA yapılırken belli teknikler kullanılmaktadır. Bunlardan en çok kullanılanları Makine Öğrenmesi (MÖ) ve sözlük tabanlı DA teknikleridir. Bu tekniklerin kullanıldığı çalışmaların birçoğu İngilizce üzerinde yoğunlaşmasına rağmen diğer diller için de çalışmalar popüler olmaya başlamıştır. Bu tez çalışmasında hem İngilizce hem de Türkçe için yapılan çalışmalarda kullanılan MÖ ve sözlük tabanlı DA metotları yeni özellikler eklenerek oluşturulup farklı iki veri kümesi üzerinde değerlendirildi. Bu çalışmada daha önce İngilizce ve Türkçe için çalışılmış metotlardan MÖ ve sözlük tabanlı DA olmak üzere iki ayrı DA metodu Türkçe için gerçeklenmiştir. Bu metotları kısa ve uzun metinler olmak üzere iki farklı Türkçe veri kümesine uygulayıp başarımlarını ölçtük. Türkçenin yapısal özelliklerini de göz önüne alacak şekilde ön işlemler uyguladı. Öncelikle bir deasciifying (Türkçeleştirme) ve düşük seviye normalleştirme uygulanarak Türkçeye uygun yazılmayan ve çok tekrarlı harfler içeren kelimeler düzeltildi. Kelimeler asıl anlamlarını köklerinde barındırdığıdan gereksiz ekler atılıp, asıl anlamı içeren kelime kökülerine ulaşıldı. Bunu yaparken varlık/yokluk (-lı,-li,-sız,-siz) eklerini ve olumsuzluk bildiren ekleri (-me,-ma) ya kaldırmadık ya da ona özel bir işaret koyarak muhafaza ettik. şimdiye kadar yapılan çalışmalardan farklı olarak hem MÖ hem de sözlük tabanlı DA için bazı yeni özellikler eklendi. Bu yeni özellikler sözlük tabanlı DA için bileşik kelimeler ve varlık/yokluk eki barındıran kelimelerdir. Sözlük tabanlı DA için her kelimesi taşıdığı duygu yönelimine göre puanlandırılmış bir sözlük kullanılarak bir metnin duygu yönelimini bulmaya çalıştık. Kullanılan sözlüğü oluşturmak için Thellwal ve diğ. [2] çalışmalarında kullanıldıkları Sentistrength sözlüğünü Türkçeye çevrildi. Ayrıca sözlükte eksik olan diğer gerekli sözcükler, birleşik kelimeler ve varlık/yokluk eki barındıran kelimeler eklemek kaydıyla sözlük genişlettilmiştir. Kelime köklerine inildiğinden dolayı kelimler ad-sıfat veya fill olmak üzere iki ayrı etiketle etiketlenmiştir. Sözlük tabanlı DA olumlu-olumsuz ve olumlu-olumsuz-nötr senaryoları olarak uygulandı ve sonuçları değerlendirildi. Genel olarak, işlenecek metindeki kelimelerden duygu sözlüğünde yer alanlarının sözlükteki puanlarının toplanmasıyla elde edilen puana göre sınıflandırma yapılmıştır. Diğer taraftan MÖ tabanlı DA için n-gram'lar öznitelik olarak bag-of-words şeklinde kullanılmıştır. Bu iki metodun güçlü ve zayıf yönlerini görülebilmesi için kısa ve uzun yorum metinler içeren iki farklı veri kümesi üzerinde test edildi. Bu veri kümeleri; diğerine kıyasla daha kısa ve kuralsız yorumlardan oluşan Twitter veri kümesi ve görece daha uzun, nispeten daha kurallı yazılmış film yorumlarından oluşan Film Yorumları veri kümesidir. Twitter veri kümesine uygulandığında sözlük tabanlı DA metodu ile %75.2, MÖ tabanlı DA metodu ile ise, Karar Destek Makineleri (KDM) sınıflandırıcısı kullanılarak, %85 başarı elde edilmiştir. Film yorumları veri kümesine uygulandığında ise sözlük tabanlı DA metodu ile %79,5, MÖ tabanlı DA metodu ile KDM sınıflandırıcısı kullanılarak %89 başarı elde edilmiştir. Twitter verisi, gramer ve yapısal kural eksikliğinden dolayı DDİ çalışmaları için ez zor verilerden biridir. Film yorumları veri kümesi daha kurallı ve düzgün metinlerden oluştuğundan ve tek hedefe (film) odaklı olduğundan, her iki yaklaşımda da daha iyi sonuç vermiştir. Bu çalışmada birçok ön işlem uygulanmıştır. Bu ön işlemler duygu analizi ve özellikle Türkçe için önemlidirler. Bileşik kelimelerin yakalanması ve varlık/yokluk eklerinin kullanılması sözlük tabanlı duygu analizi yaklaşımında önemli etki yaratmıştır. Bu yöntemlerin etkisi, gizli bilgilerin ortaya çıkarılıp işlenmesinin umut verici olduğu göstermiştir. Gizli bilginin yanında varolan bilginin cümledeki hangi nesneye yönelik olduğu da çok önemlidir. Daha ileriki çalışmalar için bağlılık analizi yapılarak sadece ilgilendiğimiz nesne ile ilgili kelimelerin dikkate alınması sağlanabilir. MÖ metodu KDM sınıflandırıcısıyla beraber, birçok çalışmada olduğu gibi bizim çalışmamızda da en yüksek başarımı sağlamaktadır. Fakat, eğitilme ihtiyacı olduğundan ve eğitim kümesi için büyük miktarlarda etiketli veri gerektiğinden, MÖ tabanlı yaklaşım tercih edilmeyebilir. Sözlük tabanlı duygu analizi için herhangi bir eğitim kümesi gerekmediğinden etiketleme işine de gerek kalmamaktadır. Oluşturduğumuz sözlük her ne kadar elle oluşturulmuş olsa da genel amaçlı olduğundan, dışarıdan girilen herhangi bir metni sözlüğe göre değerlendirip sınıflandırabileceğinden, alan bağımsızdır ve hiçbir eğitim kümesi gerektirmez. Elimizdeki eğitim kümesini kullanarak daha alana özel bir sözlük oluşturmak ve başarımı daha da yükseltmek mümkündür. Ancak bu durumda sözlük tabanlı DA'nin avantajlarından olan eğitim seti gerektirmemeyi kaybetmiş oluruz. Sözlük tabanlı duygu analizi denetimsiz ve alan bağımsız bir çalışma olmasına rağmen elde ettiğimiz başarı umut vericidir.
Yazar
Dr. Cumali Türkmenoğlu
Bu Yayına Nasıl Atıf Yapılır
Cumali Türkmenoğlu (Yüksek Lisans Tezi). Türkçe metinlerde duygu analizi, 2015, Istanbul Technical University.
Anahtar Kelimeler
Lisans
Tüm Hakları Saklıdır
Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.
Istanbul Technical University tezlerinden daha fazlası
- Investigation Of Stretching Effect With Mixed Finite Element Formulations For Laminated Beams And Plates(2023)
- Veri madenciliği yöntemlerini kullanarak anemi sınıflandırılmasına yönelik bir uygulama(2015)
- Moebius elektrolizi anot çamurlarından platin grubu metallerin uzaklaştırılması ve geri kazanımı(2015)
- Bir II. Alman İmparatorluğu projesi: Kaiser Wilhelm Anıtı'ndan Alman çeşmesine(2015)
- Soil salinity mapping by integrating remote sensing data with ground measurements; a case study in Lower Seyhan Plate, Adana, Turkey(2015)
- Kil çekirdekli toprak dolgu atık barajlarında sızmanın nümerik metotlarla araştırılması(2015)
