DoctorateOpen Access

Gen ifade tahmini için veri bütünleştirme

2019
0 views
0 downloads
Advisor: Prof. Dr. Hasan Oğul

Abstract (TR)

Canlı formunun sürdürülebilirliğinin temelinde protein sentezi yer almaktadır. Protein sentezinde, insan genomundaki kodlayıcı genleri düzenleyen küçük nükleotid dizilerinin (mikro RNA) ve diğer yönetici genlerin (Transkripsiyon Faktör, TF) önemli görevleri vardır. Bu çalışmanın amacı, mikro RNA ve TF'lerin düzenleme bilgisinin protein kodlayıcı genlerin ifade tam değerlerinin kestirim performansına etkisini araştırmaktır. Gen ifade tam değerini tahmin etmek için regresyon tabanlı modelleri içeren sistematik yaklaşımlar ortaya konulmuştur. Öncelikle, gen ifade ölçümlerinde yaygın olarak karşılaşılan kayıp veri (missing data) problemini çözmek için doğrusal, k-NN ve İlişkisel Vektör Makinesi (RVM) regresyon modelleri uygulanmıştır. Regresyon modelinin eğitiminde genellikle aynı genin farklı deneylere ait ifade değerlerinden oluşan vektörler kullanılmaktadır. Daha sonra, bu ifade vektörlerine aynı deneye ait farklı gen ifade değerlerinin dâhil edilmesinin gen ifade tahminine etkisi araştırılmıştır. Bunun için İki Yönlü İşbirlikçi Filtreleme (Two-way collaborative filtering) yöntemi kullanılarak gen ifade değerlerinden oluşan tek yönlü veri matrisi iki yönlü veri matrisine dönüştürülmüş ve regresyon modeli bu yeni veri matrisi ile oluşturulmuştur. Gen ifade tahmini için ilk defa kullanılan bu yeni öznitelik sunum tekniği ile kestirim performansının artırıldığı görülmüştür. Ayrıca farklı kanser türlerine ait gen ifade verilerinin bütünleştirilmesinin gen ifade tahminine etkisi de araştırılmıştır. Burada, prostat kanserine ait gen ifade değerlerinin tahmin edilmesinde kolon kanseri verisinin model öğrenmede kullanılmasının kestirim performansını artırdığı görülmüştür. Literatürde gen ifade değerleri kullanılarak gen düzenleyici moleküller ile genler arasındaki ilişkinin tespit edilmesine yönelik çok sayıda çalışma bulunmaktadır. Ancak hücrede meydana gelen bu etkileşimler kullanılarak gen ifade tam değerinin tespitine yönelik çalışmalar oldukça kısıtlıdır. Son olarak, farklı veri yapısındaki miRNA-gen ve TF-gen regülasyon bilgileri ile gen ifade değerleri bütünleştirilmiş olup doğrusal ve RVM regresyon modelleri kullanılarak kestirim performansına etkisi araştırılmıştır. Veri bütünleştirme yaklaşımlarında Öklid, Affine Dönüşüm ve Bhattacharya uzaklık ölçütleri kullanılmıştır. Gen ifade matrisleri; Gene Expression Omnibus veritabanından, TF-gen regülasyon bilgisi TRANSFAC veritabanından ve miRNA-gen regülasyon bilgisi ise mirDB, mirTarbase ve mirConnX veri tabanlarından alınmıştır. Kestirim performansının değerlendirilmesinde Spearman benzerlik katsayısı, Pearson benzerlik katsayısı ve Hata Kareleri Ortalamasının Karekökü (RMSE) ölçütleri kullanılmıştır. miRNA-gen regülasyon bilgisinin bütünleştirilmesi ile gen ifade tahmini performansının artırıldığı görülmüştür.

Author

Tuncay Bayrak

How to Cite

Tuncay Bayrak (Doktora Tezi). Gen ifade tahmini için veri bütünleştirme, 2019, Başkent University.

Keywords

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Başkent University