DÜŞÜK KAYNAKLI DİLLERDE TRANSFORMER TABANLI DİL MODELLERİNİN ALAN ADAPTASYONU: TÜRKÇE HUKUK METİNLERİ ÜZERİNE BİR ÇALIŞMA

dc.contributor.advisorAYDOĞAN, MURAT
dc.contributor.authorİNCİDELEN, MERT
dc.date.accessioned2026-08-12T10:14:16Z
dc.date.issued2025
dc.departmentFÜ, Fen Bilimleri Enstitüsü, Yazılım Mühendisliği Anabilim Dalı
dc.description.abstractDoğal dil işleme alanındaki ilerlemelere rağmen, düşük kaynaklı diller için daha fazla çalışmaya ihtiyaç duyulmaktadır. Özellikle, Türkçe gibi karmaşık dil yapısına ve sınırlı kaynaklara sahip dillerde, hukuk gibi zengin terminolojiye sahip alanlar için Transformer tabanlı dil modellerinin yetenekleri önemli bir araştırma konusu olarak öne çıkmaktadır. Bu çalışmada, Transformer tabanlı dil modellerinin Türkçe hukuk metinleri ile alan adaptasyonu süreci incelenmiş ve bu sürecin modellerin performansına etkileri değerlendirilmiştir. Çalışma doğrultusunda Danıştay karar sorgulama sayfasından toplanan hukuki metinler kullanılmış ve bu metinler maskeli dil modelleme ve adlandırılmış varlık tanıma görevleri için yapılandırılarak özgün veri setleri oluşturulmuştur. Alan adaptasyonu için Türkçeyi de kapsayan çok dilli yapıya sahip mBERT modeli ve Türkçe için özelleştirilmiş BERTurk modeli kullanılmıştır. Alan adaptasyonu sürecinde modellerin kelime dağarcığı hukuk kelimeleri ile genişletilmiş, hukuki kelimelerin ve rastgele kelimelerin maskelendiği bir maskeli dil modelleme yaklaşımı uygulanmıştır. Modeller, adlandırılmış varlık tanıma görevi için ince ayarlanarak sonuçlar değerlendirilmiştir. Elde edilen bulgular, alan adaptasyonu uygulanan modellerin temel modellere kıyasla hukuk metinlerinde adlandırılmış varlık tanıma görevi için daha yüksek performans sağladığını göstermektedir. Alan adaptasyonu ile mBERT modelinde %3,147, BERTurk modelinde ise %1,130 oranında F1 Skoru artışı elde edilmiştir. Bu çalışma, düşük kaynaklı dillerde alan adaptasyonunun Transformer tabanlı dil modellerinin performansını artırmada önemli bir süreç olduğunu ortaya koymaktadır.
dc.description.abstractDespite advancements in natural language processing, further research is needed for low-resource languages. In particular, for languages with a complex language structure and limited resources like Turkish, the capabilities of Transformer-based language models in terminology-rich domains such as law have emerged as a significant research area. In this study, the domain adaptation process of Transformer-based language models with Turkish legal texts was examined and the effects of this process on the performance of the models are evaluated. Legal texts collected from the Turkish Council of State decision query page were used for the study, and these texts were structured for masked language modeling and named entity recognition tasks to create unique datasets. For domain adaptation, the mBERT model, which has a multilingual structure including Turkish, and the BERTurk model customized for Turkish were used. During the domain adaptation process, the vocabulary of the models was expanded with legal words and a masked language modeling approach was applied in which legal words and random words were masked. The models were fine-tuned for the named entity recognition task and the results were evaluated. The results show that the domain-adapted models achieved higher performance for the named entity recognition task in legal texts compared to the baseline models. The domain adaptation resulted in an F1 Score increase of 3.147% for the mBERT model and 1.130% for the BERTurk model. This study demonstrates that domain adaptation in low-resource languages is an important process in improving the performance of Transformer-based language models.
dc.identifier.citationİNCİDELEN, M. (2025). Düşük kaynaklı dillerde transformer tabanlı dil modellerinin alan adaptasyonu: Türkçe hukuk metinleri üzerine bir çalışma (Tez No. 925501) [Yüksek lisans tezi, Fırat Üniversitesi].
dc.identifier.urihttps://tez.yok.gov.tr/UlusalTezMerkezi/TezGoster?key=P3dtmmHrq-mzEcmCLi1CqQTCXLDKk9bc669swD1ljVUT9eRbzjhZavm5hWc_I8B0
dc.identifier.urihttps://hdl.handle.net/11508/24026
dc.identifier.yoktezid925501
dc.language.isotr
dc.publisherFırat Üniveristesi
dc.relation.publicationcategoryTez
dc.rightsinfo:eu-repo/semantics/openAccess
dc.snmzKA_TEZ_20260511
dc.subjectBilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol
dc.titleDÜŞÜK KAYNAKLI DİLLERDE TRANSFORMER TABANLI DİL MODELLERİNİN ALAN ADAPTASYONU: TÜRKÇE HUKUK METİNLERİ ÜZERİNE BİR ÇALIŞMA
dc.title.alternativeDomain adaptation of transformer-based language models in low-resource languages: A study on Turkish legal texts
dc.typeMaster Thesis

Dosyalar