
171
Archived Theses
1
DOIs Assigned
1%
DOI Rate
Archived Theses
Yeni makine öğrenmesi metotları ve ilaç tasarımına uygulamaları
Makine öğrenmesi (yapay öğrenme), eldeki verileri en iyi temsil eden modeli ve parametrelerini bulmak amacıyla geliştirilen algoritmaları içerir. Tezde çeşitli makine öğrenmesi algoritmaları geliştirilmiştir. Günümüzde incelenmesi ve yorumlanması gereken veri miktarı üssel bir biçimde artmaktadır. Bu durum makine öğrenmesinin tüm sektörlerin ihtiyaç duyduğu bir alan haline gelmesine sebep olmuştur. Tezin uygulama alanı olarak, bu sektörlerden biri olan ilaç tasarımı seçilmiştir.İlaçların insan sağlığına olan olumlu etkisi bilinmektedir. Yeni ilaç tasarımı bu nedenle çok önemli ve vazgeçilmezdir. Buna karşılık çok emek ve uzun zaman isteyen ve buna bağlı olarak çok büyük maliyetler içeren bir sektördür. Yüksek maliyet sebebiyle az sayıda firma tarafından gerçekleştirilebilmektedir. Türkiye'de bu alandaki mevcut çalışmalar sınırlı olmakla birlikte TÜBİTAK tarafından yayınlanan raporda ilaç tasarımı, 2003-2023 yıllarını kapsayan dönemde öncelikli teknolojik faaliyet konuları içinde yer almaktadır.İlaç tasarımı sürecinin ve maliyetinin önemli bileşenlerinden biri olası ilaç moleküllerinin seçilmesi işlemidir. Bu seçim işlemleri genelde; sınıflandırma, kümeleme, özellik seçimi/çıkarımı, regresyon (eğri uydurma) problemlerinden bir ya da birkaçını içermektedir. Bu tarz problemlere çözüm üretmeyi amaçlayan makine öğrenmesi metotları yardımıyla ilaç tasarımının süresi ve maliyeti azaltılabilmektedir.Görüldüğü gibi ilaç tasarımı problemlerinde makine öğrenmesinin neredeyse tüm alanlarına ihtiyaç duyulmakta ve kullanılmaktadır. Bu nedenle de tezde makine öğrenmesinin birçok alanını kapsayacak bir çalışma gerçekleştirilmiştir.Sınıflandırma problemleri için Cline adı altında bir algoritma ailesi tasarlanmıştır. Geliştirilen algoritmalar temelde karar ağacı oluşturma algoritmalarıdır. Karar ağaçları, yüksek performansları ve ürettikleri kuralların verinin yapısına ait çıkarımlar yapmayı kolaylaştırması sebebiyle oldukça popüler olmuş makine öğrenmesi algoritmalarındandır. Yapılan denemelerde geliştirilen algoritmaların basitliklerine rağmen UCI ve ilaç veri kümelerinde mevcut algoritmalarla yarışabilecek performansta algoritmalar oldukları görülmüştür.Sınıflandırıcı komiteleri literatürdeki birçok çalışmada tekil sınıflandırıcılardan daha başarılı sonuçlar üretmiştir. Bu çalışmada da buna paralel sonuçlar alınmış ve Cline algoritma ailesine Cline karar ormanları eklenmiştir. UCI ve ilaç veri kümeleri üzerinde Cline karar ormanları mevcut algoritmalardan çok daha iyi sonuçlar sergilemiştir. Cline karar ağacı ve karar ormanları algoritmaları ClineToolbox adlı bir yazılımla kullanıcıların hizmetine sunulmuştur. Yazılıma tez sahibinin web sayfasından erişilebilir.Özellik seçimi problemleri için karar ağaçları ve karar ormanlarından yararlanan bir yaklaşım geliştirilmiş ancak tatmin edici sonuçlar elde edilememiştir.Kümeleme problemleri için Clusline adı altında bir algoritma ailesi geliştirilmiş ve mevcut algoritmalarla çeşitli kümeleme performans kriterlerine göre yarışan sonuçlar elde edilmiştir.Kümeleme komiteleri, sınıflandırıcı komitelerinin üstün performanslarından esinlenilerek geliştirilmiştir. Literatürdeki kümeleme komitelerinin farklı karar birleştirme teknikleri incelenmiş ve geniş bir veri kümesi üzerinde bu teknikler karşılaştırılmıştır. Literatürdeki mevcut karşılaştırmalardan daha kapsamlı olan bu çalışma bu konuda çalışanlara yol gösterici niteliktedir.Regresyon problemleri için verileri çeşitli alt uzaylarda kümelemeye dayalı bir yaklaşım geliştirilmiş ancak tatmin edici sonuçlar alınamamıştır.Regresyon komiteleri için, literatürdeki komite oluşturma, karar birleştirme metotlarının ve komitelerde yer alan regresyon algoritmalarının ilaç tasarımı veri kümelerinde performans üzerindeki etkileri incelenmiştir. Bu kapsamlı çalışmada, ilaç veri kümelerinde regresyon komitelerinin kullanımının sınıflandırma da olduğu kadar sonucu iyileştirmediği görülmüştür.Bütün veri kümelerinde diğer tüm algoritmalardan daha iyi sonuç veren global bir algoritma bulunmamaktadır. Bu nedenle, bir veri kümesinin hangi algoritma ile en iyi sonucu vereceği genelde deneme yanılma metoduyla bulunmaktadır. Literatürde bu eksikliği gidermek ve son kullanıcılara yardımcı kurallar dizisi oluşturabilmek için algoritmaların performanslarının veri kümesinin çeşitli özelliklerine göre tahmin edilmesi amacını taşıyan yaklaşımlar geliştirilmiştir. Bu yaklaşımların genel adı Meta-Öğrenim'dir. Mevcut Meta-öğrenim çalışmalarında genelde sınıflandırma problemleri üzerine çalışılmıştır. İlaç veri kümelerindeki problemlerin büyük bir kısmı regresyon türünden problemler olduğu için bu çalışmada yeni bir Meta-Regresyon yaklaşımı da geliştirilmiştir. Geliştirilen yaklaşımda Meta-öğrenimde kullanılan standart veri kümesi özelliklerine ek yeni özellikler de kullanılmıştır. Çalışma sonunda bir veri kümesi üzerinde bir algoritmanın performansı veri kümesinin çeşitli özelliklerine bakarak tahmin edilebilen bir model geliştirilmiştir. Bu sayede bir veri kümesinde en iyi performansı gösterecek algoritma da tahmin edilebilmektedir. Ayrıca veri kümelerinin ve algoritmaların birbirlerine benzerliklerine göre kümelenmesi konusunda da çalışılmıştır.Sonuç olarak bu tezde, makine öğrenmesinin çeşitli konularında birçok yeni yaklaşım geliştirilmiş ve bu konuda çalışan araştırmacılar ve son kullanıcılar için faydalı olacak sonuçlar üretilmiştir. Bu tezin hem ilaç tasarımı hem de makine öğrenmesi konularında Türkiye'de ve Dünya'da yapılan çalışmalara katkıda bulunması dileğimizdir.
Türkçe metinlerin benzerliğinin hesaplanması için yeni bir yöntem
Verilen iki metinin birbirleri ile benzerlik oranını hesaplamak için çok sayıda yöntem bulunmaktadır. Bu yöntemlerin bazıları doğrudan metinlerin benzerliklerini klasik yöntemlere göre hesaplarken, diğer bazı yöntemler ise daha akıllı bir şekilde çalışarak daha doğru ve insan zekasına yakın benzerlikler hesaplayabilmektedirler. Bu ikinci kısım yöntemler genel olarak Bulanık Metin Benzerliği olarak adlandırılmaktadır.Bulanık metin eşleme yöntemleri genellikle İngilizce dili ve İngilizce metinler düşünülerek geliştirildiğinden, İngilizce metinler için yüksek başarı gösterseler bile Türkçe metinlerde çoğu kez bu kadar başarılı sonuçlar üretememektedirler.Bu nedenle bu çalışmada Türkçe metinlerin eşlenmesinde ve benzerliklerinin hesaplanmasında sık karşılaşılan bazı hata durumları modellenerek yeni bir benzerlik hesaplama yöntemi geliştirilmiştir. Bu yöntem özellikle yazım yanlışlarını algılayıp, metinlerin benzerliklerini daha tutarlı bir şekilde hesaplamaktadır. Burada metin olarak ifade edilen kavram, birkaç harften oluşan bir kelime olabileceği gibi yüzlerce kelimeden oluşan paragraf gibi uzun bir metin parçası da olabilir.Geliştirilen bu yöntemin başarısını ölçmek için farklı seviyelerde ve farklı özelliklere sahip bilgisayar kullanıcılarından, farklı şekillerde veri girişi yapmaları talep edilerek, kullanıcıların hatalı girdikleri bu veriler kullanılmıştır. Bu kullanıcıların hatalı girdikleri metinler ve bu metinlerin doğru hallerinden oluşan metin çiftlerinin benzerlik oranları, Geliştirilen yöntem, Edit Distance Benzerliği ve Jaro-Winkler Benzerliği olmak üzere 3 farklı yöntem ile hesaplanarak, karşılaştırmalı olarak başarıları ölçülmüştür. Ayrıca bahsedilen 3 yöntemi kullanarak, herhangi bir Oracle veritabanı sisteminde bulunan tablolardaki tekrarlı veya benzer kayıtları bulan bir yazılım gerçekleştirilmiştir.Yapılan bu çalışma Türkçe Doğal Dil İşleme, veritabanı sistemlerinde bulunan benzer kayıtların bulunması, Türkçe işletim sistemi, Türkçe arama motorları, entegrasyon projeleri ve e-Devlet çalışmalarında faydalı olabilir.
Veri madenciliğinde market sepet analizi ve birliktelik kurallarının belirlenmesi
Günümüzde teknoloji sayesinde çok büyük miktarda veri elde edilip saklanabilmektedir. Ancak bu büyük miktardaki verilerden gözle görülemeyecek, elle analiz edilmesi zor bilgilerin gelişen bilgisayar teknolojisi ve bilgisayar programları ile otomatik olarak analiz edilmesinin gerekliliği ortaya çıkmaktadır. Verikümelerinden örüntülerin, eğilimlerin ve anormalliklerin bulunarak basit modeller şeklinde özetlenmesi, bilgi çağındaki büyük uğraşıların başında gelir. Veri madenciliği, büyük miktardaki mevcut veri içinden anlamlı, potansiyel olarak kullanışlı, gelecekle ilgili tahmin yapılmasını sağlayan bağıntı ve kuralların bilgisayar programları kullanarak bulunmasıdır. Birçok sektörde kullanımı giderek yaygınlaşan veri madenciliğinin uygulama alanlarından biri de süpermarketlerdeki müşteri, ürün ve satış bilgilerinden yararlanarak ilişki ve kuralların elde edildiği market sepet analizidir. Market sepet analizinde ürünlerin birbiriyle olan satış ilişkilerinin elde edilmesi ve veri madenciliği konularından biri olan birliktelik kurallarının çıkarılması, şirketlerin kârını arttırıcı etkenlerdir. Birliktelik kuralları, satış hareket verileri içinde birlikte hareket eden nesnelerin ve nesneler arasındaki bağıntıların keşfedilerek geleceğe yönelik tahminlerin üretilmesini sağlar. Bu kuralların elde edilebilmesi için 90'lı yılların başından itibaren birçok algoritma geliştirilmiştir. Bu algoritmaların birbirine göre farklı koşullar altında üstünlükleri ve farklı çalışma yöntemleri mevcuttur. Veritabanının taranması, birleştirme, budama yöntemlerinin uygulanması ve minimum destek değeri yardımı ile nesneler arasındaki birliktelik ilişkilerinin bulunması, algoritmaların genel mantığını teşkil eder.Bu tez çalışmasında, veri madenciliği ile ilgili kavramlar ve özellikle market sepet analizinde kullanmak üzere birliktelik kuralları üreten temel algoritmalar detaylı bir şekilde ele alınmış ve birbiriyle karşılaştırılmıştır. Ayrıca, örnek veri setlerinden iki farklı algoritma ile birliktelik kurallarını bulan bir uygulama geliştirilmiştir.Anahtar Kelimeler: Veri madenciliği, Market sepet analizi, Birliktelik kuralları, Birliktelik kural madenciliği algoritmaları, Apriori algoritması, FP-Growth algoritması.
Uzaktan algılamalı görüntülerin bant çıkarımı ve matematiksel biçim bilim ön işlemleri kullanılarak sınıflandırılması
Hiperspektral görüntüler, uzaktan algılama yöntemleri kullanılarak elde edilen ve geniş bir bant aralığından alınan yüzlerce imgeyi içerir. Bu imgeler kullanılarak, görüntüyü oluşturan her bir piksel için dalga boyuna bağlı olarak kesikli olmayan bir spektrum bilgisi oluşur. Bu spektrumlardan yararlanarak, sınıflandırma için gerekli olan bilgilerde artış sağlanmaktadır. Bu da sınıflandırma aşamasında, başarımı daha yüksek sonuçlar elde edilmesini olanaklı kılar.Hiperspektral görüntülerin, çok fazla tekrar eden bilgi içermesi nedeniyle son zamanlarda birçok uygulamada özellik çıkarımı yöntemleri kullanılarak bant azaltma yapılmaktadır. Bu yöntemlerin içinden, Temel Bileşen Analizi (TBA), bu çalışmada sınıflandırma öncesi kullanılan önişlemlerin ilk adımını oluşturmaktadır.Matematiksel biçimbilim işlemeleri ise TBA sonucunda elde edilen bantlardaki uzamsal verilerin ortaya çıkarılması amacıyla kullanılmaktadır. Temel işlemlerden olan açma ve kapama işlemleri, pikseller arası komşuluk ilişkilerini arttırarak sınıflandırma öncesindeki ikinci adımı oluştururlar.Bu çalışmada, Destek Vektör Makineleri (DVM) ve İlgililik Vektör Makineleri (İVM), sınıflandırma yöntemleri kullanılmaktadır. Daha önceki çalışmalarda bahsedilen DVM ile sınıflandırma başarımının arttırılması ve İVM ile bir karşılaştırması gözlemlenmiştir. DVM ve İVM sınıflandırma performansını artırmak ve sınıflandırma hesapsal yükünü azaltmak üzere, sınıflandırma öncesi hiperspektral görüntülere Temel Bileşen Analizi (TBA) ve biçimbilimsel yöntemler uygulanması önerilmiştir. Ön işlem olarak TBA ile bant sayısı azaltılmakta, biçimbilimsel işlemler ise veri kümelerinin sahip olduğu spektral özellikteki bilgilerin yanısıra, uzamsal özelliğe sahip bilgilerin ortaya çıkması olanaklı kılınmaktadır. TBA sonucu kullanılan her bir banta, biçimbilimsel işlemler uygulanarak, elde edilen bantlar İVM ile sınıflandırmaya sokulmaktadır. Önerilen yöntem, ön-işlem uygulanarak elde edilen düşük bant miktarında İVM sınıflandırmanın, doğrudan İVM ile karşılaştırıldığında daha iyi sonuçlar verdiğini göstermektedir.
Yapay bağışıklık sistemlerini kullanarak türkçe metinlerde tür, yazar ve cinsiyet tanıma
İnternet kullanımının hızla yaygınlaşmasıyla birlikte her geçen gün farklı kategorilerde bir çok doküman elektronik ortamda yerini almaktadır. Artan doküman sayısıyla birlikte bu dokümanların benzer olanlarının önceden belirlenmiş gruplara ayrılması ihtiyacı ortaya çıkmıştır. Doküman sınıflandırma dediğimiz bu işlem sayesinde dokümanlar önceden belirlenmiş sınıflara ayrıştırılmaktadır. Bu çalışmada dokümanlar, dokümanların türüne, yazarına ve yazarının cinsiyetine göre olmak üzere üç ana başlık altında sınıflandırılmıştır.Yapay Bağışıklık Sistemleri, doğal bağışıklık sisteminden esinlenerek, bu sistemin mühendislik açısından incelenerek karmaşık problemlerin çözümünde kullanılan yöntemlerden biridir. Daha önce örüntü tanıma, hesapsal güvenlik, anomali tespiti, optimizasyon, makine öğrenmesi, robotik, kontrol, çizelgeleme, hata teşhisi gibi alanlarda ve bunların alt dallarında; ayrıca ekoloji, üretim sistemleri, akıllı evler, adaptif gürültü nötralizasyonu, indüktif problem çözümü, açık web sunucu koordinasyonu, protein yapısı tahmini gibi alanlarda başarıyla kullanılmış ve etkili sonuçlar alınmış olan bu yöntem doküman sınıflandırma alanında ilk kez bu çalışmada kullanılmıştır.Çalışmada 16 farklı özellik vektörü oluşturularak, Yapay Bağışıklık Sistemi algoritmalarıyla ve literatürde daha önce bu alanda sıkça kullanılan diğer sınıflandırma yöntemleri olan Naive Bayes, K-En Yakın Komşuluk, Destek Vektör Makinesi ve Rastgele Orman gibi sınıflandırıcılarla deneyler gerçekleştirilerek Türkçe dokümanlar üzerinde dokümanın türü, yazarı ve yazarının cinsiyeti belirlenmeye çalışılmıştır.Özellik vektörleri üzerinde boyut indirgeme işlemleri uygulanarak sınıflandırma yöntemlerinin başarılarının arttığı gözlenmiştir.Yapılan denemelerde karakter n-gram'ları, kelime kökleri ve kelime gövdeleri gibi uygun özellik vektörlerinden YTU boyut indirgeme algoritmasıyla oluşturulmuş yeni özellik vektörleriyle Yapay Bağışıklık Sistemi algoritmalarının Türkçe dokümanların türünü, yazarını ve yazarının cinsiyeti belirlemede çok başarılı sonuçlar verdiği ve bu alanda geliştirilecek olan sistemlerde kullanılabileceği görülmüştür.
Artificial neural network-based solutions of the interprocess communication problems
Interprocess Communication directly effects process management and operation performanceof the operating system. The performance for the current operating systems can be increased by faster and more efficient process management and scheduling algorithms. In this thesis, Artificial Neural Network-based solution methods areproposed for classical Interprocess Communication problems. Proposed solution is applied to the dining philosophers, readers and writers, producer-consumer, and sleeping barber problems. And, these proposed solutions are compared with semaphore-based solutions. Finally, significant performance improvement is acquired in the dining philosophers and readers and writers problem.
Indirgenmiş komut setli işlemci tasarimi
Reduced instruction set computer (RISC) processors are designed according to the principle ?simple is better.? The RISC processors are widely using in; embedded systems to work stations. Even the complex instruction computers (CISC) use RISC type micro instructions internally. This thesis presents a 32-bit pipelined reduced instruction set processor design that has 32-bit basic arithmetic, logic, control and system instructions. Most of the pipeline hazards are eliminated by hardware support. The design is modeled with VHDL (Very High Speed Integrated Circuit Hardware Description Language) hardware description language and simulated with the Mentor Graphics Corporation?s Modelsim simulator. The processor model is mapped on a low cost FPGA (Field Programmable Gate Array) chip.
A fluid dynamics based image segmentation approach and pap-smear image data classification
Today, cancer is one of the most important health issues of humanity. Diagnosis of cancer is based on examination of tissue samples, taken from patients by pathologists. One of the most common types of cancer is cervical cancer and it?s diagnosis is made by Pap-smear test which is based on visual examinations of biopsy samples under microscope for detection of anomalies. In order to reduce human error and accelerate the Pap-smear test, computer based decision and detection systems are required. In this study, development of a computer aided analyses system is aimed which is capable of detect anomalies on Pap-smear samples. Morphological features of cells on the samples, such as growth of cell nucleus or deformation on shape of cytoplasm area may provide crucial information about existence of cancer to such a computer aided system. However, in most cases of pap-smear image data, cytoplasm areas are overlapped and there are several types of artifacts on the samples which makes it difficult to extract features from cells for detection of abnormalities. Therefore a new segmentation method is developed and used in this study in addition to conventional morphological methods. Proposed method is based on fluid dynamics. Modeled fluid during the segmentation process is capable of penetrate entire cytoplasm areas even where high degree of cell overlapping occurs. In this way, extracted features form cell are used for classification after segmentation process. Besides, some of the machine learning algorithms are examined and compared in this study for classification of Pap-smear samples for development of a analyses system which is capable of recognize abnormalities on sample cells.
Multifeedback-layer neural network controller design using particle swarm optimization algorithm for hard disk drive control
In this paper, the weights of the Multifeedback-Layer Neural Network (MFLNN) which has recently proposed are trained by the Particle Swarm Optimization (PSO) algorithm. To improve training capability of the PSO, it is enhanced by some modifications. This method (MFLNN-PSO) is applied to two different problems to prove accomplishment of the method. Then, the closed loop identification of the reader head position of a disk drive system is proposed by using the MFLNN-PSO algorithm. Finally, a new type of neuro controller is put forward by using the MFLNN-PSO. Initially, this neuro controller is applied to two different kinds of dynamic systems. Later, it is applied to a hard disk drive system as a real physical example. Simulation results show that the MFLNN-PSO controller is effective and efficient on the control of dynamic systems and hard disk drive system.
Kaotik ikeda haritası ile güçlü kriptografik özetleme fonksiyonu elde edilmesi
Elektronik ortamda güvenliğimizi sağlayacak araçlara olan ihtiyacımız hızla artmıştır. Busebeple bilgisayar ortamında güvenliğimizi sağlayacak unsurlar ve hayatımıza etkileri giderekönem kazanmıştır. Güvenlik uygulamalarının gücü bu uygulamaların temelini oluşturanalgoritmaların dayanıklılığına, hızına ve etkinliğine bağlıdır. Bu noktada elektronik imza,mesaj doğrulama gibi önemli sistemlerin alt yapısında bulunan özetleme algoritmalarındakiçakışmaları önlemek için son yıllarda kaotik fonksiyonlarla entegrasyonu çokça yapılmıştır.Kaotik fonksiyonların başlangıç koşullarındaki küçük değişiklikler sonuç değerini çok fazladeğiştirir. Bu da değişen giriş verisine göre farklı özetler üreten özetleme algoritması için bir avantajdır.Kaotik özetleme fonksiyonu açık metinde özet üretirken kaotik fonksiyonları kullanır. Buçalışmada İkeda haritası tabanlı kaotik fonksiyon kullanılmış ve sonuçları test edilmiş, diğerkaotik özetleme algoritmalarıyla karşılaştırılmıştır. Test sonuçları geliştirilen algoritmanınçakışma ihtimalinin daha düşük olduğunu göstermektedir bu da geliştirilen algoritmanın dahadayanıklı olduğunu belirtmektedir.Anahtar Kelimeler : Kaotik Özetleme Algoritmaları, İkeda Harita, Özetleme Algoritmaları, Bilgi Güvenliği