Web kazımada kullanılan Python kütüphanelerinin incelenmesi
2025
0 görüntülenme
0 i̇ndirme
Danışman: Dr. Öğr. Üyesi Naim Karasekreter
Özet (TR)
Veri, günümüzde kuruluşlar için önemli bir varlık haline gelmiş ve internet, başlıca veri kaynağı olmuştur. Web kazıma, HTML (Hyper Text Markup Language - Hiper Metin İşaretleme Dili) dokümanlarından yapılandırılmış verileri otomatik olarak çekmeyi sağlar. Bu veriler; ürün ve hizmet bilgilerini toplama, fiyat karşılaştırması yapma, iletişim bilgileri edinme, haber ve blog takibi yapma, müşteri geri bildirimlerini analiz etme gibi çeşitli amaçlar için kullanılabilir. Web kazıma süreci, bir web sayfası ile web robotu arasındaki otomatik veri aktarımını ifade eder. Bu tez çalışmasında, BeautifulSoup, Selenium ve Scrapy gibi web kazımada kullanılan Python kütüphaneleri detaylı olarak incelenmiş, hangi tür web sitelerinde ve hangi amaçlar için daha uygun oldukları belirlenmeye çalışılmıştır. Web kazıma, web sitelerinden otomatik olarak veri toplama tekniği olup, günümüzde veri analizi, makine öğrenimi ve veri madenciliği gibi çeşitli alanlarda kullanılmaktadır. Web sayfalarının yapısını tanımlamak için HTML işaretleme dili kullanılırken, stil özelliklerini tanımlamak için CSS (Cascading Style Sheets - Basamaklı Stil Sayfaları) stil dili kullanılır. Python, web geliştirme, veri bilimi ve yapay zeka gibi birçok alanda kullanılan yüksek seviyeli bir programlama dilidir. BeautifulSoup, Selenium ve Scrapy kütüphaneleri, web kazımada kullanılan başlıca Python kütüphanelerdir. Belirtilen kütüphaneler (BeautifulSoup, Selenium, Scrapy) kullanılarak çeşitli web sitelerinden (emlak ilan sitesi, haber sitesi, online market ve e-ticaret sitesi) veri kazıma kodları yazılmış ve çalışma süreleri ölçülmüştür. Ölçümler, Windows, Linux ve bulut sunucu sistemlerinde ayrı ayrı gerçekleştirilmiştir. Scrapy 'de yazılan kodlar, diğer kütüphanelere göre daha fazla satır içerebilir, ancak daha yapılandırılmış bir yaklaşım sunar. BeautifulSoup, basit ve statik siteler için hızlı sonuçlar verirken, dinamik içerikler için Selenium ve Scrapy daha etkilidir. İşletim sistemleri kodların çalışma sürelerini fazla etkilemezken, bulut sunucudaki kodlar biraz daha yavaş çalışmıştır. BeautifulSoup, veri kazımaya yeni başlayanlar için basit ve kullanıcı dostu bir seçenektir. Statik veya az dinamik siteler için uygundur. Selenium, dinamik içeriğe sahip JavaScript içeriği yoğun olan sitelerden veri çekmek ve kullanıcı etkileşimlerini simüle etmek için güçlü bir araçtır. Scrapy ise, büyük ölçekli projeler ve karmaşık siteler için yüksek performanslı bir araçtır. Bilimsel çalışmalar ve projeler için doğru kütüphanenin seçilmesi, web kazıma tekniklerinin verimliliği ve başarısı için önemlidir. Bu tez, web kazıma kullanılarak yapılan bilimsel çalışmalara rehberlik edecek nitelikte olup, gelecekteki araştırmalar için de referans niteliği taşımaktadır.
Yazar
Dr. Murat Ali Öz
Bu Yayına Nasıl Atıf Yapılır
Murat Ali Öz (Yüksek Lisans Tezi). Web kazımada kullanılan Python kütüphanelerinin incelenmesi, 2025, Afyon Kocatepe University.
Anahtar Kelimeler
Lisans
Tüm Hakları Saklıdır
Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.
Afyon Kocatepe University tezlerinden daha fazlası
- Viyola eğitimcilerinin öğrenme sürecine etkin katılım sağlamaya yönelik uygulamaları üzerine bir araştırma(2019)
- Temettuât defterlerine göre Nevâhî- Barçın kazasının sosyo- ekonomik yapısı(2008)
- XVIII. yüzyıl Osmanlı Şam valilerinin Emirü'l-Hacc olarak hizmetleri(2017)
- Temettuat defterlerine göre İskilip'in sosyal ve ekonomik yapısı(2011)
- Yenidoğan sepsisinin tanı ve izleminde töllner skorlamasının CRP ve lökosit sayısı ile karşılaştırılması(2011)
- Tersine eğitim modelinin İngilizce öğretiminde akademik başarıya ve çevrimiçi öz düzenleme becerilerine etkisi(2023)
