Master'sOpen Access

Crawling the web using Apache Nutch and Lucene

Is this your thesis?

This record came from a bulk archive import. If it’s yours, link it to your profile.

2014
0 views
0 downloads

Abstract (TR)

Webde yer alan geniş boyuttaki bilgilerin varlığı, kullanıcıların ihtiyacı olan bilgiyi seçmesini zorlaştırmaktadır. Bu bilgiler ile internet kullanıcıları arasındaki bağlantı yolu arama motorlarıdır. Arama motorları. Crawler, bot veya örümcek adı verilen yazılımlar aracılığıyla web'deki veri koleksiyonları üzerinde çalışır. Birçok arama motoru kullanıcısı arama motorlarının çalışma mekanizmasını bilmezler. Örneğin arama motorları nasıl çalışır veya web üzerinde bilgiyi nasıl yakalar yahut bilgiyi nasıl sıralar. Bu çalışmada açık kaynak tabanlı arama motorlarının nasıl çalıştığını detaylı incelenmiştir. Bu çalışmada, açık kaynak kod tabanlı Web Crawler programlarını izah ederken apache nutch ve lucene yazılımlarını tek tek kullanılmıştır. Bunlar Apache yazılım kurumu tarafından yayınlanmıştır. Nutch bir web crawler olup, world wide web üzerinde indeksleme yapabilmektedir. Nutch bir lucene mimarisi üzerinde geliştirilmiştir. Bilgi erişimi teknolojileri kullanır. Büyük boyuttaki verileri indeksleyebilmek için birçok yazılım kütüphanesi mevcuttur. Lucene web üzerinde var olan PDF, TEXT veya MS WORD gibi bilgiler ile ilgilenmez. Bu dökümanları indeksleyerek, faydalı olabileceği türe dönüştürür. Bu çalışmada Nutch ve Lucene'nin birarada kullanılmasının faydası, birbirinden bağımsız olmalarının yanısıra Nutch ve Lucene'nin ikisinin de Java ile geliştirilmesidir. Ayrıca Lucene içeriğini veya indeksini görüntülemek ve analiz edebilmek için Tag Cloud Technology'i kullanılmalıdır.

Author

Nıbras Abdulwahıd

How to Cite

Nıbras Abdulwahıd (Yüksek Lisans Tezi). Crawling the web using Apache Nutch and Lucene, 2014, Çankaya University.

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Çankaya University