Theses supervised by Yrd. Doç. Dr. Nilgün Güler Bayazıt
10 theses · Yıldız Technical University
Çizge tabanlı metin özetleme
Günümüzde teknolojinin katkısıyla veri miktarı çok artmıştır dolayısıyla doğru orantılı olarak doküman sayısındaki artış da ivme kazanmıştır. Bu denli bir artış bilgiye ulaşımı zorlaştırır veya bilginin gözden kaçmasına sebep olabilir. Bu tür problemleri çözmek için metin özetleme sistemleri kullanılabilir. Metin özetleme verilen metindeki ana fikri koruyarak onun kısaltılması işlemidir. Genellikle çıkarıma ya da soyutlamaya dayalı olmak üzere iki çeşit sistem üzerinde çalışma yapılır. Soyutlamaya dayalı özetleme derin bir doğal dil işleme gerektirdiğinden yapılan çalışmaların da çoğu çıkarıma dayalı sistemler içindir. Çıkarıma dayalı özetlemede ana metinden cümleler olduğu gibi seçilerek özet çıkartılır. Burada önemli olan en fazla bilgiyi içeren cümleyi özette olması için seçmektir. Çıkarıma dayalı özetlemelerde de anahtar olan nokta cümle seçim aşamasıdır. Cümle seçmek için önerilen birçok yöntem vardır; kelime frekansı kullanan yöntemler, cümle kümeleme, çizge tabanlı puanlama yöntemleri, makine öğrenmesi metotları vb. üstünde çalışılmış yöntemlerin arasındadır. Çizge metotları metin özetleme sistemlerinde çokça kullanılan bir yöntemdir. Çünkü çizge olarak yapılan temsil verinin daha farklı bir şekilde yorumlanmasına yardımcı olduğundan diğer yöntemler ile kolay bir şekilde ortaya çıkamayacak özellikleri ortaya koyabilir. Bu çalışma kapsamında da çizge tabanlı metin özetleme üstünde araştırma yapılmıştır. Araştırma kapsamında performansı ispatlanmış olan "TextRank" yöntemi kullanılmıştır. Bu yöntem ağ sayfalarının puanlamasının yapıldığı "PageRank" yönteminden esinlenilerek ortaya konulmuştur. Ağ sayfalarını önem derecesine göre puanlayabilmek için sayfaların birbirlerine vermiş olduğu linkleri kullanarak hesaplama yapar. Metin özetleme sisteminde de bu yöntemi kullanabilmek için cümleler arası ilişki tanımlanması gerekmektedir. Bu çalışma kapsamında 4 farklı ilişkilendirme yönteminin "TextRank" yöntemine olan etkisi araştırılmıştır. Deneysel çalışmalar DUC 2002 ve CAST veri seti kullanarak yapılmıştır. DUC veri setiyle yapılan testlerde en iyi sonucu içerik çakışması, CAST veri setinde ise NGD vermiştir. Bu çalışmaya ilave olarak daha önce yapılmamış bir sistem geliştirilmiştir. Bu sistem hiyerarşik birleştirici kümeleme ve "TextRank" yöntemleri kullanarak elde edilmiştir. Önerilen yeni yöntemde cümleler belli bir kritere göre kümelenmiştir, kümelerden cümle seçebilmek için "TextRank" uygulanmıştır. Yeni yöntemin deneysel çalışmaları, bir önceki çalışmadaki gibi DUC 2002 ve CAST veri setiyle yapılmıştır; böylece "TextRank" ile kıyaslama imkanı elde edilmiştir. Yapılan çalışmalara göre DUC 2002 kullanıldığında önerilen sistemin daha performanslı çalıştığı tespit edilmiştir. CAST veri setinde ise 4 farklı ilişkilendirme yönteminden 2 yöntemi geçtiği, diğer 2 yöntemle de arasındaki farkın az olduğu tespit edilmiştir. Dolayısıyla önerilen yeni yöntem farklı metin türlerine göre de başarılı performans gösterebilmektedir.
Destek vektör makineleri ile karakter tanıma
Karakter tanıma, görüntü dosyaları içinde yer alan yazı karakterlerinin görüntü işleme ve makine öğrenmesi algoritmaları kullanılarak metin dosyaları halinde elde edilmesi yöntemlerinin genel adıdır. Tezde karakter tanıma probleminde destek vektör makinelerinin başarısı incelenmiştir. Bunun yanısıra temel bileşen analizi ve bağımsız bileşen analizi yöntemleri ile kullanılan örnek verilerin, daha az bileşen ile ifade edilmeleri durumunda uygulanan sistemin başarısında meydana gelen değişimler incelenmiştir. Bu amaçla tez içerisinde öncelikle destek vektör makineleri, temel bileşen analizi ve bağımsız bileşen analizi hakkında bilgi verilmiştir. Ardından uygulama aşamasında elde edilen sonuçlar karşılaştırılarak, değerlendirmesi yapılmıştır. Anahtar kelimeler: Karakter Tanıma, Destek Vektör Makineleri, Temel Bileşen Analizi, Bağımsız Bileşen Analizi
Makine öğrenmesi teknikleri ile metinlerin otomatik olarak sınıflandırılması
Bu tezin amacı, veri madenciliginin bir alt dalı olan metin madenciligi kapsamında günümüzün en önemli sorunlarından olan metin sınıflama algoritmalarının matematiksel modelinin incelenmesi ve bir uygulamasının yapılmasıdır. Literatürde bu konu ile ilgili birçok çalısma yapılmıstır. Tez çalısmasında bu çalısmalar incelenmis ve sonuçlar yorumlanmıstır. Tez çerçevesinde ilk önce metin madenciligi ve metin sınıflama problemi tanıtılacaktır. Ardından metin sınıflama probleminin matematiksel ifadesi üzerinde durulacaktır. Metin sınıflama problemi uygulanmadan önce problemde kullanılacak olan metinsel verilerin üzerinde yapılan ön islem asamaları incelenecektir. Ön islem asamalarından sonra metinlerden bilgi çıkarımı, vektör uzay modeli ve metinlerin dogru sınıflandırılma yüzdesinin arttırılmasına yönelik gelistirilen özellik seçim algoritmaları ele alınacaktır. Bunun yanı sıra metin sınıflama için gelistirilmis olan sınıflama algoritmalarından bahsedilecek, bu algoritmaların olumlu ve olumsuz yönleri üzerinde durulacak ve algoritmalar kıyaslanacaktır. Tezin son bölümünde ise algoritma performanslarının sayısal sonuçları yer alacaktır. Elde edilen sonuçlardan yola çıkarak özellik seçim algoritmalarının sınıflama yüzdesini ne ölçüde etkiledigi tartısılacaktır. Sonuçlar tablolar yardımı ile yorumlanacak ve öneriler sunulacaktır. Anahtar Kelimeler: Metin Sınıflama, Vektör Uzay Modeli, Naive Bayes, Çoklu Naive Bayes, Tamamlayıcı Naive Bayes, En Yakın K Komsuluk, Bilgi Kazancı, Oransal Kazanç, Ki-Kare.
Metin madenciliği ile metin sınıflandırma
Bilgisayarların çıkısı ve gelismesiyle her geçen gün biraz daha değisen ve gelisen bir dünyada yasamaktayız. Bilgisayarlar yasantımıza birçok kolaylık katmakta, yapılan islerin yükünü hafifletmekte, daha iyi sonuçlara, daha kısa yollardan ulasmamızı sağlamaktadır. Bilgisayarlar aynı isi otomatik olarak ve daha verimli yapacağından insan kaynaklı hatalar en aza indirgenir. Bilgisayarların gelisimine paralel olarak, insanlar daha fazla bilgiye erisim olanakları bulmus ve günden güne, çok sayıda veriyi depolayan sistemler, yani veritabanları olusturulmus ve bu veritabanlarının boyutları da günden güne büyümüstür. Çesitli tipte veritabanları mevcuttur. Metin halindeki verilerin bulunduğu veritabanlarından bilgiyi kolayca elde etmek için metin kategorizasyon yöntemleri uygulanır. ?lk zamanlarda insan aracılığıyla yapılan sınıflandırma, günümüzde doküman sayısının çok hızlı bir sekilde artması dolayısıyla otomatik olarak yapılır hale gelmistir. Bunun için, daha önceden kategorileri tanımlanmıs olan eğitim dokümanları yardımıyla metin halindeki veriler sınıflandırılabilmektedir. Tezde, amaç doğrultusunda, metin halindeki verilerin sınıflandırılmasında kullanılan metin kategorizasyon teknikleri (Naive Bayes, k-NN) ve çesitli ağırlıklandırma yöntemleri incelenmis olup, daha sonra bu teknikleri kullanarak VisualBasic.NET programlama dili ile metin kategorizasyon programı yazılmıs ve aynı zamanda ilgili tekniklerin doğru sınıflandırma olasılıkları açısından kıyaslamaları yapılmıstır. Bu tezde, metin sınıflandırması üzerinde çalısmak için Anadolu Ajansı adlı Türkçe bir veri kümesinin derlemesi sunulmustur. Anahtar Kelimeler: Metin kategorizasyonu, naive bayes ve k-nn algoritmaları, metin madenciliği, sınıflandırma, joker (wild card) yöntemi.
Finansal veri madenciliği
Veri madenciliği, büyük veritabanlarında yer alan verilerdeki gizli eğilimlerin ortaya çıkarılması sürecidir. Finans, pazarlama, telekomünikasyon gibi birçok alanda veri madenciliği teknikleri kullanılmaktadır.Finans alanında önemli bir yere sahip olan bankacılık sektörü, veri madenciliğinin yoğun olarak kullanıldığı sektörlerdendir. Banka müşterilerinin, sahip oldukları kredi kartı tipine ve aldıkları kredinin geri ödenebilirliğine bakılarak müşteri profillerinin ve müşteri segmentasyonlarının belirlenmesi süreci, veri madenciliği teknikleri ile başarılı bir şekilde gerçekleştirilmektedir.Bu tez çalışmasında, çeşitli veri madenciliği teknikleri kullanılarak, bir bankaya ait veri tabanından elde edilen kredi kartı ve kredilerin statüsü verileri üzerinde müşteri profili ve müşteri segmentasyonu uygulamaları gerçekleştirilmiştir. Sonuç olarak, veri madenciliği sürecinin, müşteri profili ve müşteri segmentasyonu uygulamalarını başarı ile gerçekleştirebildiği görülmüştür.Anahtar Kelimeler: Veri madenciliği, müşteri segmentasyonu, müşteri profili.
Video görüntülerinden yüz tanıma
Önemi ve kullanım alanı gün geçtikçe artan bir çalışma alanı olan yüz tanıma, önceden sisteme tanıtılan insanların sistem tarafından daha sonra otomatik olarak tanınmasını amaçlamaktadır.Bu tezde ise, video görüntüleri üzerinde çalışan bir yüz tanıma sistemi kurulmuştur. Her bir videoda bir kişi olacak şekilde poz, açı ve dönme kısıtı olmadan elde edilen videolarla eğitilen sistem, daha sonra yine aynı şekildeki farklı videoların kime ait olduğunu tanımaya çalışmaktadır.Çalışmanın temel amacı, videolardan yüz tanınırken tüm video karelerinin kullanılması yerine otomatik çalışabilecek bir sistem kurarak, bu sistemin seçeceği belli karelerin, belli ön işlemlerden geçerek kullanılması durumunda başarı oranı ve çalışma sürelerinin nasıl etkileneceğini incelemektir.Tez metninde, sistem kurulurken yüz ve yüz öğelerini bulma amaçlı kullanılan Haar-Benzeri Özellikler, boyut dönüştürme amaçlı kullanılan Temel Bileşenler Analizi ile Doğrusal Diskriminant Analizi ve sınıflandırma amaçlı kullanılan Destek Vektör Makineleri algoritmalarıyla beraber bu algoritmaları temel alarak geliştirilen sistem tanıtılmış ve deney sonuçları ile başarı durumu ölçülmüştür.
Otomatik metin özetleme sistemi
Otomatik metin özetleme, bir bilgisayar programı aracılığı ile bir metnin özetlenmesi işlemidir. Bu işlem ile bilgisayara bir metin verilir ve bilgisayardan bu metne ait olan bir özet dokümanı alınır. Elde edilen özet dokümanı kullanıcıların inceledikleri metne ait olan ana temayı etkili bir şekilde anlamasını sağlar ve onların arama zamanını kısaltır.Bir otomatik metin özetleme sistemi, çıkarıma ve yoruma dayalı olan özetleme görevlerini gerçekleştirebilir. Çıkarıma dayalı olan özetleme işlemi var olan cümleler arasından en önemli olanlarını seçmeye dayalı iken, yoruma dayalı olan özetleme işlemi yeni cümlelerin üretilme aşamalarını kapsamaktadır. Yoruma dayalı olan özetleme yaklaşımları dokümanların derinlemesine incelenmesini gerektirir. Yoruma dayalı olan özetleme yaklaşımlarının aksine, çıkarıma dayalı olan özetleme yaklaşımları daha pratiktir. Bu yaklaşımların çoğu incelenen dokümanları, dokümanlara ait olan cümlelerin önem derecelerinin cümle skoru fonksiyonlarıyla ifade edilmesini sağlayan bazı yapısal ve anlamsal özellikler ile temsil etmektedir.Bu çalışma çıkarıma dayalı olan bir metin özetleme sistemi üzerinde yoğunlaşmıştır. Bu sistemde gizli anlamsal analiz temelli metin özetleme yöntemlerinde kullanılabilen yeni bir ağırlık değeri önerilmiştir. Önerilen yeni ağırlık değerine ait başarım sonucunun görülebilmesi için önerilen değer dört farklı gizli anlamsal analiz tabanlı yöntem üzerinde uygulanmış ve önerilen ağırlık değerinin tüm yöntem başarımlarını arttırdığı gösterilmiştir. Algoritmaların başarım analizleri insanlar tarafından oluşturulmuş olan dört farklı veri seti üzerinde analiz edilmiştir. Bu veri setlerinden ilk ikisi tez çalışması için hazırlanan yeni Türkçe veri setleridir. Son iki veri seti ise sık kullanılan İngilizce veri setlerini içermektedir. Başarım ölçüm değeri olarak ilk üç veri seti için ideal ve otomatik özetler arasındaki çakışan cümle sayısına dayalı olan F-ölçüm skoru kullanılmıştır. Son veri seti için ise ideal ve otomatik olarak oluşturulmuş özetler arasındaki çakışan Ngram sayısına bağlı olan ROUGE değerlendirme paketi kullanılmıştır.Tez çalışmasında ele alınan sistem aynı zamanda önemli cümle çıkarımı için yapısal ve anlamsal özelliklerin birleşimini sağlayan bir melez sistem önerisini de içermektedir. Önerilen sistem, içlerinden biri ilk kez tez çalışması kapsamında metin sınıflamadan metin özetlemeye adapte edilmiş olan, toplam on beş özelliği kapsamaktadır. Melez sistemde kullanılan özellikler iki farklı yaklaşım ile elde edilen ağırlıkların kullanılmasıyla birleştirilmiştir. Bu yaklaşımlardan ilki, özelliklerin ikili karşılaştırılmalarını içeren bir dizi uzman yargısına bağlı bir işlem olan bulanık analitik hiyerarşi sürecini kullanır. İkinci yaklaşım ise özellik ağırlıklarının otomatik olarak belirlenmesini sağlayan gerçek ve ikili kodlu genetik algoritmayı kullanmaktadır. Melez sisteminin başarım analizi Türkçe veri setleri üzerinde gerçekleştirilmiştir. Başarım ölçüm değeri olarak F-ölçüm skoru kullanılmıştır. Deneysel sonuçlar, özelliklerin birleştirilmesi suretiyle tüm özelliklerden yararlanılmasının, her bir özelliğin bireysel kullanımından daha iyi bir başarıma neden olduğunu göstermektedir.Sonuç olarak bu tezde metin özetleme konusu ile ilgili bir çok yaklaşım önerilmiş ve araştırmacılar için kullanışlı sonuçlar elde edilmiştir. Bu tezin metin özetleme alanında hem Türkiye'de hem de Dünya'da yapılan çalışmalara katkıda bulunması dileğimizdir.
Otomatik metin özetleme sistemi
Otomatik metin özetleme, bir bilgisayar programı aracılığı ile bir metnin özetlenmesi işlemidir. Bu işlem ile bilgisayara bir metin verilir ve bilgisayardan bu metne ait olan bir özet dokümanı alınır. Elde edilen özet dokümanı kullanıcıların inceledikleri metne ait olan ana temayı etkili bir şekilde anlamasını sağlar ve onların arama zamanını kısaltır.Bir otomatik metin özetleme sistemi, çıkarıma ve yoruma dayalı olan özetleme görevlerini gerçekleştirebilir. Çıkarıma dayalı olan özetleme işlemi var olan cümleler arasından en önemli olanlarını seçmeye dayalı iken, yoruma dayalı olan özetleme işlemi yeni cümlelerin üretilme aşamalarını kapsamaktadır. Yoruma dayalı olan özetleme yaklaşımları dokümanların derinlemesine incelenmesini gerektirir. Yoruma dayalı olan özetleme yaklaşımlarının aksine, çıkarıma dayalı olan özetleme yaklaşımları daha pratiktir. Bu yaklaşımların çoğu incelenen dokümanları, dokümanlara ait olan cümlelerin önem derecelerinin cümle skoru fonksiyonlarıyla ifade edilmesini sağlayan bazı yapısal ve anlamsal özellikler ile temsil etmektedir.Bu çalışma çıkarıma dayalı olan bir metin özetleme sistemi üzerinde yoğunlaşmıştır. Bu sistemde gizli anlamsal analiz temelli metin özetleme yöntemlerinde kullanılabilen yeni bir ağırlık değeri önerilmiştir. Önerilen yeni ağırlık değerine ait başarım sonucunun görülebilmesi için önerilen değer dört farklı gizli anlamsal analiz tabanlı yöntem üzerinde uygulanmış ve önerilen ağırlık değerinin tüm yöntem başarımlarını arttırdığı gösterilmiştir. Algoritmaların başarım analizleri insanlar tarafından oluşturulmuş olan dört farklı veri seti üzerinde analiz edilmiştir. Bu veri setlerinden ilk ikisi tez çalışması için hazırlanan yeni Türkçe veri setleridir. Son iki veri seti ise sık kullanılan İngilizce veri setlerini içermektedir. Başarım ölçüm değeri olarak ilk üç veri seti için ideal ve otomatik özetler arasındaki çakışan cümle sayısına dayalı olan F-ölçüm skoru kullanılmıştır. Son veri seti için ise ideal ve otomatik olarak oluşturulmuş özetler arasındaki çakışan Ngram sayısına bağlı olan ROUGE değerlendirme paketi kullanılmıştır.Tez çalışmasında ele alınan sistem aynı zamanda önemli cümle çıkarımı için yapısal ve anlamsal özelliklerin birleşimini sağlayan bir melez sistem önerisini de içermektedir. Önerilen sistem, içlerinden biri ilk kez tez çalışması kapsamında metin sınıflamadan metin özetlemeye adapte edilmiş olan, toplam on beş özelliği kapsamaktadır. Melez sistemde kullanılan özellikler iki farklı yaklaşım ile elde edilen ağırlıkların kullanılmasıyla birleştirilmiştir. Bu yaklaşımlardan ilki, özelliklerin ikili karşılaştırılmalarını içeren bir dizi uzman yargısına bağlı bir işlem olan bulanık analitik hiyerarşi sürecini kullanır. İkinci yaklaşım ise özellik ağırlıklarının otomatik olarak belirlenmesini sağlayan gerçek ve ikili kodlu genetik algoritmayı kullanmaktadır. Melez sisteminin başarım analizi Türkçe veri setleri üzerinde gerçekleştirilmiştir. Başarım ölçüm değeri olarak F-ölçüm skoru kullanılmıştır. Deneysel sonuçlar, özelliklerin birleştirilmesi suretiyle tüm özelliklerden yararlanılmasının, her bir özelliğin bireysel kullanımından daha iyi bir başarıma neden olduğunu göstermektedir.Sonuç olarak bu tezde metin özetleme konusu ile ilgili bir çok yaklaşım önerilmiş ve araştırmacılar için kullanışlı sonuçlar elde edilmiştir. Bu tezin metin özetleme alanında hem Türkiye'de hem de Dünya'da yapılan çalışmalara katkıda bulunması dileğimizdir.
Bankacılıkta müşteri terk modeli
Değişik sektörlerde yapılan araştırmalar, bir şirket için mevcut müşteriyi elde tutabilmenin, yeni müşteri kazanımından daha maliyetli olduğunu göstermiştir. Dolayısıyla şirketlerin iyi bir müşteri elde tutma stratejilerinin olması ve bunu pazarlama/müşteri ilişkileri yönetimi ile uygulamaya geçirmesi büyük önem taşımaktadır. İyi bir elde tutma stratejisine en iyi girdi ise, terk etme potansiyeli taşıyan müşterileri belli bir güven aralığında modelleyebilmektir. Bu müşteriler belirlendikten sonra gerekli önlem ve aksiyonlar alınabilir. Bu tez, Türkiye'de bankacılık sektörü için bir terk tahmini modeli geliştirmeyi amaçlamaktadır. Bankacılık sektöründe müşteri banka ilişkisinin süresi bir kontrata dayalı olmadığından, bu modeli bankacılık için geliştirmek diğer sektörlere oranla daha zorlu bir süreçtir. Model için öncelikle müşteri ham verilerinin kullanışlı ve anlamlı bir hale dönüştürülerek veri ambarına alınması çalışması yapılmıştır. Daha sonra hazırlanan bu veri kümesi üzerinde, veri madenciliği teknikleri kullanılarak bir terk tahmin modeli oluşturulmuştur. Klasik tekniklerin yanı sıra son dönemde öne çıkan rastgele orman tekniği de kullanılarak sonuçlar tahmin başarısı açısından karşılaştırılmıştır. Son olarak terk olasılığı tahmin edilmiş müşterilerin elde tutulabilmesi için, terke neden olan faktörler ışığında gerekli önlemlerin alınması ve stratejilerin geliştirilmesine yönelik önerilerde bulunulmuştur. Anahtar Kelimeler: Müşteri terk tahmini, müşteriyi elde tutma, CRM, veri madenciliği, karar ağaçları, yapay sinir ağları, lojistik regresyon, rastgele orman
Çizge tabanlı metin özetleme
Günümüzde teknolojinin katkısıyla veri miktarı çok artmıştır dolayısıyla doğru orantılı olarak doküman sayısındaki artış da ivme kazanmıştır. Bu denli bir artış bilgiye ulaşımı zorlaştırır veya bilginin gözden kaçmasına sebep olabilir. Bu tür problemleri çözmek için metin özetleme sistemleri kullanılabilir. Metin özetleme verilen metindeki ana fikri koruyarak onun kısaltılması işlemidir. Genellikle çıkarıma ya da soyutlamaya dayalı olmak üzere iki çeşit sistem üzerinde çalışma yapılır. Soyutlamaya dayalı özetleme derin bir doğal dil işleme gerektirdiğinden yapılan çalışmaların da çoğu çıkarıma dayalı sistemler içindir. Çıkarıma dayalı özetlemede ana metinden cümleler olduğu gibi seçilerek özet çıkartılır. Burada önemli olan en fazla bilgiyi içeren cümleyi özette olması için seçmektir. Çıkarıma dayalı özetlemelerde de anahtar olan nokta cümle seçim aşamasıdır. Cümle seçmek için önerilen birçok yöntem vardır; kelime frekansı kullanan yöntemler, cümle kümeleme, çizge tabanlı puanlama yöntemleri, makine öğrenmesi metotları vb. üstünde çalışılmış yöntemlerin arasındadır. Çizge metotları metin özetleme sistemlerinde çokça kullanılan bir yöntemdir. Çünkü çizge olarak yapılan temsil verinin daha farklı bir şekilde yorumlanmasına yardımcı olduğundan diğer yöntemler ile kolay bir şekilde ortaya çıkamayacak özellikleri ortaya koyabilir. Bu çalışma kapsamında da çizge tabanlı metin özetleme üstünde araştırma yapılmıştır. Araştırma kapsamında performansı ispatlanmış olan "TextRank" yöntemi kullanılmıştır. Bu yöntem ağ sayfalarının puanlamasının yapıldığı "PageRank" yönteminden esinlenilerek ortaya konulmuştur. Ağ sayfalarını önem derecesine göre puanlayabilmek için sayfaların birbirlerine vermiş olduğu linkleri kullanarak hesaplama yapar. Metin özetleme sisteminde de bu yöntemi kullanabilmek için cümleler arası ilişki tanımlanması gerekmektedir. Bu çalışma kapsamında 4 farklı ilişkilendirme yönteminin "TextRank" yöntemine olan etkisi araştırılmıştır. Deneysel çalışmalar DUC 2002 ve CAST veri seti kullanarak yapılmıştır. DUC veri setiyle yapılan testlerde en iyi sonucu içerik çakışması, CAST veri setinde ise NGD vermiştir. Bu çalışmaya ilave olarak daha önce yapılmamış bir sistem geliştirilmiştir. Bu sistem hiyerarşik birleştirici kümeleme ve "TextRank" yöntemleri kullanarak elde edilmiştir. Önerilen yeni yöntemde cümleler belli bir kritere göre kümelenmiştir, kümelerden cümle seçebilmek için "TextRank" uygulanmıştır. Yeni yöntemin deneysel çalışmaları, bir önceki çalışmadaki gibi DUC 2002 ve CAST veri setiyle yapılmıştır; böylece "TextRank" ile kıyaslama imkanı elde edilmiştir. Yapılan çalışmalara göre DUC 2002 kullanıldığında önerilen sistemin daha performanslı çalıştığı tespit edilmiştir. CAST veri setinde ise 4 farklı ilişkilendirme yönteminden 2 yöntemi geçtiği, diğer 2 yöntemle de arasındaki farkın az olduğu tespit edilmiştir. Dolayısıyla önerilen yeni yöntem farklı metin türlerine göre de başarılı performans gösterebilmektedir.