Master'sOpen Access

A comprehensive multi-prompt evaluation of large language models on Turkish datasets

2025
0 views
0 downloads
Advisor: Dr. Öğr. Üyesi Emre Uğur ; Prof. Ayşe Başar

Abstract (TR)

Bu çalışma, Türkçe dilinde hem anlama hem de güvenilirlik görevlerinde büyük dil modellerini (LLM'ler) kapsamlı bir şekilde değerlendirmeyi amaçlamaktadır. Ayrıca, modellerin istem sağlamlığı ve ince ayarlı LLM'lerin sohbet versiyonlarıyla kıyası üzerine analizler de içerir. Türkçe, kaynaklara sahip ancak yeterince araştırılmamış bir dildir. Bu, Türkçe dilinin doğal dil işlemedeki (NLP) son gelişmelerin gerisinde kalmasına yol açmıştır. Kapsamlı değerlendirmeler ve standartlaşmış kıyaslamalar, Türkçe LLM'lerin ilerlemesinde önemlidir, çünkü neyin işe yaradığını saptamaya yardımcı olurlar. Biz de Türkçe LLM'lerin ilerlemesine katkıda bulunmak için, 17 veri kümesi kullanarak 11 görevde 10 açık kaynaklı LLM'yi değerlendirdik. Hem orijinal Türkçe veri kümelerini hem de çevrilmiş veri kümelerini kullandık. Bazı görevlerde Türkçe veya çok dilli önceden eğitilmiş dil modellerini (PLM'ler) referans olarak kullandık. Gemma2-9b-it modelinin, değerlendirilen LLM'ler arasında hem anlama hem de güvenilirlik görevlerin-de net en iyi performansı gösteren model olduğunu bulduk. Ancak ince ayar deneylerinde net bir en iyi performans gösteren model olmadığını ve en iyi PLM'nin, deneylerin çoğunda en iyi LLM ile karşılaştırılabilir sonuçlara sahip olduğunu gördük. Modellerin başka şekilde ifade edilmiş istemlerdeki performanslarında önemli farklılıklar olduğunu bulduk; bu da sağlamlığın LLM'lerin üzerinde iyileştirme yapması gereken bir alan olduğunu gösteriyor. Ayrıca, çok dilli baz LLM'lerin Türkçe'ye uyarlanmasıyla elde edilen wiroai-turkish-llm-8b gibi modellerin, çoğunlukla baz alındıkları modellerden daha iyi performans gösterdiğini gözlemledik.

Author

Dr. Mustafa Burak Topal

How to Cite

Mustafa Burak Topal (Yüksek Lisans Tezi). A comprehensive multi-prompt evaluation of large language models on Turkish datasets, 2025, Boğaziçi University.

License

Tüm Hakları Saklıdır

This work is shared under the specified license terms.

More theses from Boğaziçi University