DÜŞÜK KAYNAKLI DİLLERDE TRANSFORMER TABANLI DİL MODELLERİNİN ALAN ADAPTASYONU: TÜRKÇE HUKUK METİNLERİ ÜZERİNE BİR ÇALIŞMA
| dc.contributor.advisor | AYDOĞAN, MURAT | |
| dc.contributor.author | İNCİDELEN, MERT | |
| dc.date.accessioned | 2026-08-12T10:14:16Z | |
| dc.date.issued | 2025 | |
| dc.department | FÜ, Fen Bilimleri Enstitüsü, Yazılım Mühendisliği Anabilim Dalı | |
| dc.description.abstract | Doğal dil işleme alanındaki ilerlemelere rağmen, düşük kaynaklı diller için daha fazla çalışmaya ihtiyaç duyulmaktadır. Özellikle, Türkçe gibi karmaşık dil yapısına ve sınırlı kaynaklara sahip dillerde, hukuk gibi zengin terminolojiye sahip alanlar için Transformer tabanlı dil modellerinin yetenekleri önemli bir araştırma konusu olarak öne çıkmaktadır. Bu çalışmada, Transformer tabanlı dil modellerinin Türkçe hukuk metinleri ile alan adaptasyonu süreci incelenmiş ve bu sürecin modellerin performansına etkileri değerlendirilmiştir. Çalışma doğrultusunda Danıştay karar sorgulama sayfasından toplanan hukuki metinler kullanılmış ve bu metinler maskeli dil modelleme ve adlandırılmış varlık tanıma görevleri için yapılandırılarak özgün veri setleri oluşturulmuştur. Alan adaptasyonu için Türkçeyi de kapsayan çok dilli yapıya sahip mBERT modeli ve Türkçe için özelleştirilmiş BERTurk modeli kullanılmıştır. Alan adaptasyonu sürecinde modellerin kelime dağarcığı hukuk kelimeleri ile genişletilmiş, hukuki kelimelerin ve rastgele kelimelerin maskelendiği bir maskeli dil modelleme yaklaşımı uygulanmıştır. Modeller, adlandırılmış varlık tanıma görevi için ince ayarlanarak sonuçlar değerlendirilmiştir. Elde edilen bulgular, alan adaptasyonu uygulanan modellerin temel modellere kıyasla hukuk metinlerinde adlandırılmış varlık tanıma görevi için daha yüksek performans sağladığını göstermektedir. Alan adaptasyonu ile mBERT modelinde %3,147, BERTurk modelinde ise %1,130 oranında F1 Skoru artışı elde edilmiştir. Bu çalışma, düşük kaynaklı dillerde alan adaptasyonunun Transformer tabanlı dil modellerinin performansını artırmada önemli bir süreç olduğunu ortaya koymaktadır. | |
| dc.description.abstract | Despite advancements in natural language processing, further research is needed for low-resource languages. In particular, for languages with a complex language structure and limited resources like Turkish, the capabilities of Transformer-based language models in terminology-rich domains such as law have emerged as a significant research area. In this study, the domain adaptation process of Transformer-based language models with Turkish legal texts was examined and the effects of this process on the performance of the models are evaluated. Legal texts collected from the Turkish Council of State decision query page were used for the study, and these texts were structured for masked language modeling and named entity recognition tasks to create unique datasets. For domain adaptation, the mBERT model, which has a multilingual structure including Turkish, and the BERTurk model customized for Turkish were used. During the domain adaptation process, the vocabulary of the models was expanded with legal words and a masked language modeling approach was applied in which legal words and random words were masked. The models were fine-tuned for the named entity recognition task and the results were evaluated. The results show that the domain-adapted models achieved higher performance for the named entity recognition task in legal texts compared to the baseline models. The domain adaptation resulted in an F1 Score increase of 3.147% for the mBERT model and 1.130% for the BERTurk model. This study demonstrates that domain adaptation in low-resource languages is an important process in improving the performance of Transformer-based language models. | |
| dc.identifier.citation | İNCİDELEN, M. (2025). Düşük kaynaklı dillerde transformer tabanlı dil modellerinin alan adaptasyonu: Türkçe hukuk metinleri üzerine bir çalışma (Tez No. 925501) [Yüksek lisans tezi, Fırat Üniversitesi]. | |
| dc.identifier.uri | https://tez.yok.gov.tr/UlusalTezMerkezi/TezGoster?key=P3dtmmHrq-mzEcmCLi1CqQTCXLDKk9bc669swD1ljVUT9eRbzjhZavm5hWc_I8B0 | |
| dc.identifier.uri | https://hdl.handle.net/11508/24026 | |
| dc.identifier.yoktezid | 925501 | |
| dc.language.iso | tr | |
| dc.publisher | Fırat Üniveristesi | |
| dc.relation.publicationcategory | Tez | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.snmz | KA_TEZ_20260511 | |
| dc.subject | Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol | |
| dc.title | DÜŞÜK KAYNAKLI DİLLERDE TRANSFORMER TABANLI DİL MODELLERİNİN ALAN ADAPTASYONU: TÜRKÇE HUKUK METİNLERİ ÜZERİNE BİR ÇALIŞMA | |
| dc.title.alternative | Domain adaptation of transformer-based language models in low-resource languages: A study on Turkish legal texts | |
| dc.type | Master Thesis |







