DoktoraAçık Erişim

Kanser biyolojisi için etkin yapay öğrenme modelleri

2022
0 görüntülenme
0 i̇ndirme
Danışman: Doç. Dr. Mehmet Gönen

Özet (TR)

Yakın geçmişte yapay öğrenme için birçok çoklu çekirdek öğrenimi yöntemi önerilmiştir. Çekirdek genel anlamda bir benzerlik ölçütüdür; çoklu çekirdekler de bir veri kümesi için farklı kaynaklardan sağlanan ayrı benzerlik ölçütleri olarak düşünülebilir. Çoklu çekirdek öğrenimi ise özetle farklı kaynaklardan gelen çoklu benzerlik ölçütlerini öğrenme modeline dahil etmektedir. Bu tez, çoklu çekirdek öğrenimi için üç yeni yöntem önermekte ve bu yöntemlerin kanser veri kümeleri üzerinde gerçekleştirilmiş deneylerini raporlamaktadır. Kanser çağımızın en yaygın ve ölümcül hastalıklarından biridir. Kanser hastalarında, yeni hastalık tedavi kılavuzlarının belirlenmesi için hastalığın ilerleyişinin altında yatan moleküler mekanizmaların tanımlanması ön şarttır. Mevcut yapay öğrenme modellerinin performans sonuçları ümit vadediyor olsa da, eş zamanlı olarak verinin anlamlı ve kayda değer kısımlarının tespiti ile öğrenme işinin yapılması, çözümü zor bir problemdir. Bu zorluk temel olarak genomik verilerin çok boyutlu, yüksek korelasyonlu ve doğrusal olmayan ilişkileri içeren yapısıyla ilişkilidir. O halde, kanser ilerlemesini tahmin eden bir model kurulurken bu modelin bir öncül bilgi kümesiyle (örneğin, yolak/gen kümesi bilgileri) birlikte çalışabilmesi, bu öncül bilgi kümesinin kanser ilerleyişi için önemli olan kısımlarının öğrenirken bulunmasına ihtiyaç vardır. Sonuç olarak altta yatan moleküler dinamiklerin anlaşılmasıyla, kanserin ilerlemesinin ve agresifliğinin daha iyi anlaşılması beklenmektedir. Bu tezde ilk olarak eniyileme ve çoklu çekirdek öğrenimini birlikte kullanan yeni bir yapay öğrenme modeli önermekteyiz. Öncül bilgi olarak kanser yolak/gen kümesi bilgisi kullanıldığında, bu öncül bilginin önce önemli kısımlarının seçilip sonra öğrenme işinin yapılması yerine, eş zamanlı olarak öncül bilgiden önemli kısımları çıkararak öğrenme işini gerçekleştiren bir algoritma geliştirdik. Bu algoritmayı Kanser Genom Atlası tiroit kanseri hasta verisi üzerinde kanser için özel olarak hazırlanmış yolak/gen kümesi öncül bilgilerini kullanarak test ettik. Yeni çoklu çekirdek öğrenimi algoritmamızın tahmin performansının temel referans algoritması olarak seçtiğimiz rassal orman (RO) ve regresyon destek vektör makinesi (RDVM) algoritmalarının tahmin performanslarıyla karşılaştırabilir ve hatta onların tahmin performanslarından daha iyi olduğunu gösterdik. Ayrıca, önerdiğimiz algoritmanın bu performansı RO ve RDVM algoritmalarının kullandıklarının onda birinden daha az öznitelik kullanarak gösterdiğini; çalışılan kanser türüne ilişkin önemli yolak/gen kümesi bilgilerini belirlediğini gösterdik. Öte yandan, algoritma tarafından seçilen genlerin ekspresyonlarını tümör ve normal dokularda karşılaştırdık; tümör dokusunda normale göre daha fazla veya daha az ifade edilen genlerin yeni biyolojik belirteç bulunması açısından nasıl faydalı olabileceği konusunu tartıştık. Bu tezde ayrıca yeni bir hızlı, ölçeklenebilir ve yorumlanabilir çoklu yaklaşıklanmış çekirdek öğrenimi (ÇYÇÖ) yöntemi sunduk. Hesaplamalı biyoloji alanında gün geçtikçe gelişen veri toplama araçları ve büyüyen hasta kohortları ile veri boyutları hızla artmaktadır. Sağladığı yorumlanabilme ve verideki doğrusal olmayan ilişkileri yakalayabilme özellikleri sayesinde biyolojik veri analizinde özellikle tercih edilen çekirdek temelli öğrenme algoritmaları ölçeklenebilir olmadıklarından büyüyen veri kümesi boyutlarıyla birlikte çalışmamaya başlamışlardır. Bu problemi çözmek için hızlı ve etkin, büyük ölçekli veri ile kullanıma uygun, çekirdek yaklaşıklama ve grup Lasso tekniklerini birlikte yeni bir şekilde kullanan bir algoritma geliştirdik. Bu yöntem etkin bir şekilde sınıflandırma yapmayı öğrenirken genomik verinin anlamlı ve kayda değer kısımlarını belirlemektedir. Çekirdek matrislerini hesaplamak yerine yaklaşıkladığı için artan veri kümesi boyutlarıyla kullanıma uygun ve ölçeklenebilirdir. ÇYÇÖ yöntemini Kanser Genom Atlası'ndan çoklu kanser hasta kohort verilerini kullanarak oluşturduğumuz iki veri kümesi üzerinde ve melanoma tek hücre dizileme verisi üzerinde test ettik. ÇYÇÖ yönteminin temel referans algoritmanın performansından daha üstün bir performansa girdi özniteliklerin yalnızca çok küçük bir kısmını kullanarak ulaştığını gösterdik. Ayrıca, yolak/gen kümelerinin ilişkili olduğu yaklaşıklanmış çekirdeklerin seçilme sıklığını çalışılan sınıflandırma problemi için bu yolak/gen kümelerinin önemini işaret etmek amacıyla raporladık. Bu hızlı ve yorumlanabilir çoklu çekirdek öğrenimi yöntemi ve yolak/gen kümesi temelinde verdiği seyrek ve anlamlı bilgiler ile yüksek korelasyonlu genomik veri kümelerinin analizinin kolaylaşması sağlanmıştır. Bu yöntemin, daha önceden analizi yapılamayan büyük veri kümeleriyle çalışmayı mümkün kılarak yeni tedavi kılavuzlarının hazırlanması ve yeni biyolojik belirteçlerin bulunması konusunda yardımcı olması beklenmektedir. Literatüre bir diğer katkı olarak bu tez, yeni bir çoklu yaklaşıklanmış öbekleme yöntemi sağlamaktadır. Çekirdek temelli öbekleme yöntemleri genomik veri analizi için öncül bilgi ile bütünleşerek yorumlanabilirlik sunmaları ve verideki doğrusal olmayan ilişkileri bulmaya yardımcı olmaları açısından önemli gözetimsiz öğrenme yöntemleridir. Bu amaçla, ölçeklenebilir bir çoklu yaklaşıklanmış çekirdek k-ortalama öbekleme yöntemi geliştirdik. Bu yöntem çekirdek yaklaşıklama yapıp k-ortalama öbekleme algoritmasıyla bu yaklaşıklamayı birleştirmektedir. Algoritmamızı test etmek için Kanser Genom Atlası veri kümelerinden çoklu kohort genomik verisini birleştirdik. Algoritma, öbekleme sonuçlarını iyileştirmek için "silhouette" katsayısını eniyilerken öncül bilginin önemli kısımlarını bulmak üzerine tasarlanmıştır. Öbekleme için oluşturduğumuz bu tekniğin sonuçlarını test etmek üzere, tüm veri kümesine k-ortalama öbekleme yöntemini uyguladık. 19814 geni kullanan referans deneyin sonucu yalnızca dört gen kümesinden gelen bilgiyi kullanarak öbekleme yapan önerdiğimiz öbekleme algoritmasından %35,8 daha az çıkmıştır. Önerilen öbekleme algoritmasının sonuçları literatür verileri ile desteklenmektedir. Kolay kullanılabilirliği ve ölçeklenebilir olması ile bu çalışma yeni kanser alt tiplerinin ve yeni tedavi yöntemlerinin keşfedilmesi açısından umut vericidir.

Yazar

Dr. Ayyüce Begüm Bektaş

Bu Yayına Nasıl Atıf Yapılır

Ayyüce Begüm Bektaş (Doktora Tezi). Kanser biyolojisi için etkin yapay öğrenme modelleri, 2022, Koç University.

Lisans

Tüm Hakları Saklıdır

Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.

Koç University tezlerinden daha fazlası