Efficiency and effectiveness of xml keyword search using full element index
2010
0 views
0 downloads
Advisor: Prof. Dr. Özgür Ulusoy
Abstract (TR)
Son yıllarda akademide ve endüstride, XML veritabanları ve belge derlemlerinde anahtar sözcük aramak için çeşitli teknikler önerilmiştir. Bu tekniklerin pek çoğunda kullanılan veri yapısı, dünya çapında ağ (WWW) gibi büyük metin verileri üzerinde anahtar sözcük aramada en gelişmiş teknik olan ters indekstir. Bir tam eleman indeksi her bir XML elemanını, metni, kendisinin doğrudan içeriği ve torunlarının içeriklerinden oluşan ayrı bir belge olarak düşünür ve indeksler. Tam eleman indekse yöneltilen önemli bir eleştiri (XML belgelerinin iç içe yapısından dolayı) yüksek derecede fazlalık içermesidir. Bu durum tam eleman indeksin büyük ölçekli XML erişimi durumlarında kullanımını azaltır.Bu tezde XML anahtar sözcük arama için tam eleman indeksinin kullanımının verimlilik ve etkiliği araştırılmaktadır. Öncelikle, kayıpsız indeks sıkıştırma tekniklerinin tam eleman indeksinin büyüklüğünü önemli ölçüde azaltabileceği, böylece tipik bir arama motorundaki sorgu işleme stratejilerinin böyle bir indeks üzerinde verimli bir şekilde çalışabileceği öne sürülmektedir. Bir tam eleman indeksinin en önemli dezavantajı boyutunun büyüklüğüdür. Bu sorun çözüldüğü takdirde bu tip indeks kullanımının, sonuç kalitesi (etkililik) ve sorgu işleme performansını (verimlilik) son zamanlarda önerilen diğer tekniklere kıyasla geliştirebileceği gösterilmektedir. Ayrıca tam eleman indeksi kullanmak, birleşik bir taslakta sorgu sonuçlarını, sıralı belge listesi (bir arama motorunun kullanıcısının beklediği şekilde) ya da sorgu sözcüklerinin tümünü içeren eleman listesi (bir veritabanı sistemi kullanıcısının beklediği şekilde) gibi farklı formlarda oluşturmaya olanak sağlar.Bu tezin ikinci bir katkısı olarak, tam eleman indeksin büyüklüğünü daha da azaltmak için kayıplı bir yaklaşım olan statik budama tekniğinin kullanılması önerilmektedir. Bu şekilde, bir elemanın sözcüklerinin yukarı seviyelerdeki tekrarının, elemanın metinsel içeriği ve arama motorunun sıralama işlevi dikkate alınarak, uyarlanabilir bir şekilde azaltılması amaçlanmaktadır. Yani indeksteki tekrarlamaların, çıkarılmaları sonuç kalitesini azaltmadığı takdirde, ortadan kaldırılmasına çalışılmaktadır. Deneysel çalışmalarla, budanmış indeks dosyalarının çok yüksek budama seviyelerine kadar, erişim etkililiği açısından, tam eleman indeksiyle karşılaştırılabilir, hatta ondan daha iyi olduğu gösterilmektedir.Son olarak, indeks budama stratejilerinin, bir XML derleminin belge vektörlerinin büyüklüklerinin azaltılarak gruplama performansının geliştirilmesinde kullanılması önerilmektedir. Deneyler, belli durumlar için, koleksiyonun %70 kadarı budanarak, bir grup değerlendirme metriğine göre, orijinal koleksiyonla aynı kaliteyi sağlayan bir gruplama yapısı oluşturulabildiğini göstermektedir.
Author
Dr. Duygu Atılgan
How to Cite
Duygu Atılgan (Yüksek Lisans Tezi). Efficiency and effectiveness of xml keyword search using full element index, 2010, Bilkent University.
Keywords
License
Tüm Hakları Saklıdır
This work is shared under the specified license terms.
More theses from Bilkent University
- The Lower Danube in Late Antiquity: The case of Histria(2023)
- Oil price surges and the yield curve(2024)
- Essays on forward guidance(2014)
- Multi-armed bandit algorithms for communication networks and healthcare(2022)
- Comparative constitutional happiness in the light of the jurisprudence of the Turkish Constitutional Court(2023)
- Density functional theory investigation of linear carbon chains(2023)
