Master'sOpen Access

Assessment and correction of errors in DNA sequencing technologies

2017
0 views
0 downloads
Advisor: Yrd. Doç. Dr. Can Alkan

Abstract (TR)

Yeni Nesil Dizileme teknolojileri birçok değişkende birbirleri arasında farklılık göstermektedir. Kısa parçalı dizileme ya da uzun parçalı dizileme teknolojileri arasında yapılacak bir seçim ise parçaların doğruluk oranı ya da uzunlukları arasında bir tercih gerektirir. Bu tezde ilk olarak, kısa parçaların kullamıyla yapılan analizlerin yeniden üretilebilirliği konusundaki problemleri belirtiyorum. Yeni nesil dizileme teknolojileri kullanılarak genomik farklılıkların karakteristikleri üzerinde yaptığımız geniş çalışma göstermektedir ki tekrarlayan dizileme parçaları, dizilerin muğlak bir şekilde haritalanmasına sebep olabilir. Kısa parçalar tekrarlamaya daha yatkın olduklarından dolayı bu parçaların kullanıldığı deneylerin yeniden üretilebilmesinde problemler yaşanması mümkündür. Bu tezde ikinci olarak, özgün bir algoritma olan Hercules'i sunuyorum. Hercules, uzun parçalardaki hataların düzeltilmesi için makine öğrenimi tekniğini kullanan ilk algoritmadır. De novo yöntemiyle haritalama, yapısal farklılıkların araştırılması gibi birçok araştırma uzun ve hatasız parçaların kullanımını gerektirmektedir. Bu durumlarda, araştırmacılar genellikle uzun parçalardaki hataların düzeltilmesini kısa parçalar ile yapmaktadırlar. çizge yapısı ve hizalama temelli güncel düzeltme yöntemleri, dizileme teknolojisinin hata profilini göz ardı etmektedirler. Hata profilini el alan, hafıza ve zaman konusunda elverişli makine öğrenimi teknikleri, hataları daha iyi düzeltme ve daha her iki teknolojiyi daha iyi birleştirme konusunda potansiyele sahiptirler. Sunduğumuz algoritma, her bir uzun parçayı, kullanılan teknolojinin hata profiline uygun bir profile Hidden Markov Model'i şeklinde tasarlamaktadır. Algoritmamız, geçiş ve emisyon olasılıklarını bütün uzun parçalar için öğrenip, değiştirerek uzun parçalardaki hataların düzeltilmesini sağlamaktadır. DNA diziliminden iki adet veri dizisi (CH17-157L1 ve CH17-227A2) ve RNA diziliminden bir adet veri dizisi (human brain cerebellum polyA) kullanarak, Hercules tarafından hataların giderildiği parçaların, diğer algoritmalar kullanılarak hataların düzeltilmesine kıyasla en yüksek haritalama oranına ve uzun parçaların büyük bölümü kısa parçalarla kaplandığı durumlarda en yüksek hatasızlık oranına sahip olduğunu gösteriyoruz.

Author

Dr. Can Fırtına

How to Cite

Can Fırtına (Yüksek Lisans Tezi). Assessment and correction of errors in DNA sequencing technologies, 2017, Bilkent University.

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Bilkent University