Ön Eğitimli Dil Modelleri Kullanarak Türkçe Tweetlerden Cinsiyet Tespiti

dc.contributor.authorSel, İlhami
dc.contributor.authorHanbay, Davut
dc.date.accessioned2026-08-12T15:06:17Z
dc.date.issued2021
dc.departmentFırat Üniversitesi
dc.description.abstractYazar profili oluşturma (Author Profiling) bir metnin üslup ve içeriğine bakarak yazarın çeşitli özelliklerinin ortaya çıkarılmasına yönelik bir metin kümesi analizidir. Bu özellikler yaş, cinsiyet, kişilik özellikleri ve hatta meslek gibi unsurları barındırır. Cinsiyet belirleme yazar profili oluşturma çalışmalarının alt alanlarından birisidir. Siber suçlar başta olmak üzere sahte haber yayma gibi adli olayların yanında pazarlama (reklamcılık), sosyolojik ve psikolojik olayların incelenmesinde cinsiyet belirleme oldukça önemlidir. Twitter gönderileri dil kurallarına uymayan, kısaltılmış kelimeler ve anlamsız cümle yapıları da içerme ihtimallerine rağmen cinsiyet belirleme görevi için yaygın bir şekilde kullanılmaktadır. Bu çalışmada Türkçe Twitter gönderilerinden cinsiyet tespiti yapılmaya çalışılmıştır. Problem bir sınıflandırma görevi olarak ele alınmıştır. Yapılan çalışmada makine öğrenmesi metotları(TF-IDF + SVM), derin öğrenme yöntemleri (LSTM, CNN) ve Türkçe için ön eğitimli dil modelleri(BERT, DistilBert, Electra) kullanılmıştır. Yapılan deneyler sonucunda en yüksek başarımı (%80.1) kelime boyutunun 128k olduğu Bert modeli sağlamıştır. Bu çalışma diğer metin sınıflandırma görevleri için de detaylı bir çalışma olma özelliği göstermektedir.
dc.description.abstractAuthor Profiling is a text set analysis to reveal various characteristics of the author by examining the style and content of a text. These features include factors such as age, gender, personality traits and even profession. Gender identification is one of the subfields of author profile creation. Gender identification is very important in the investigation of marketing (advertising), sociological and psychological events, as well as forensic events such as spreading fake news, especially cybercrime. Twitter posts are widely used for gender identification, although they may include ungrammatical structures, abbreviated words and meaningless sentence structures. In this study, it was attempted to determine gender from Turkish Twitter posts. The problem is handled as a classification task. In the study, machine learning methods (TF-IDF + SVM), deep learning methods (LSTM, CNN) and pre-trained language models for Turkish (BERT, DistilBert, Electra) were used. As a result of the experiments, Bert model with the word size of 128k provided the highest success (80.1%). This study also features as a detailed study for other text classification tasks.
dc.identifier.doi10.35234/fumbd.929133
dc.identifier.endpage684
dc.identifier.issn1308-9072
dc.identifier.issue2
dc.identifier.startpage675
dc.identifier.urihttps://doi.org/10.35234/fumbd.929133
dc.identifier.urihttps://hdl.handle.net/11508/27809
dc.identifier.volume33
dc.language.isotr
dc.publisherFırat University
dc.publisherFırat Üniversitesi
dc.relation.ispartofFırat University Journal of Engineering Science
dc.relation.ispartofFırat Üniversitesi Mühendislik Bilimleri Dergisi
dc.relation.publicationcategoryMakale - Ulusal Hakemli Dergi - Kurum Öğretim Elemanı
dc.rightsinfo:eu-repo/semantics/openAccess
dc.snmzKA_DergiPark_20260511
dc.subjectEngineering
dc.subjectMühendislik
dc.titleÖn Eğitimli Dil Modelleri Kullanarak Türkçe Tweetlerden Cinsiyet Tespiti
dc.title.alternativeGender Identification from Turkish Tweets Using Pre-Trained Language Models
dc.typeArticle

Dosyalar