Tıpta uzmanlık sınavı göz hastalıkları sorularına yapay zeka ve araştırma görevlilerinin yanıtlarının değerlendirilmesi: Kesitsel çalışma

dc.contributor.authorBalbaba, Mehmet
dc.contributor.authorYıldırım, Hakan
dc.contributor.authorCanleblebici, Mehmet
dc.contributor.authorDal, Ali
dc.contributor.authorErdag, Murat
dc.contributor.authorÇalışkan, Tunahan
dc.date.accessioned2026-09-08T07:06:57Z
dc.date.issued2026
dc.departmentFırat Üniveristesi
dc.description.abstractAmaç: Bu çalışmanın amacı, yapay zekâ tabanlı büyük dil modellerinin (ChatGPT-4.o, Google Gemini Advanced 2.0 ve DeepSeek), Tıpta Uzmanlık Sınavı’nda (TUS) Türkçe olarak sorulmuş göz hastalıkları sorularını yanıtlama performanslarını değerlendirmek ve bu modellerin yanıt düzeylerini, göz hastalıkları alanında görev yapan araştırma görevlilerinin performansıyla karşılaştırmaktır. Yöntem: Bu kesitsel çalışmada, 1987–2021 yılları arasında TUS’ta sorulmuş göz hastalıklarına ait 70 çok- tan seçmeli soru seçilerek, kornea-oküler yüzey, lens, retina, glokom, nörooftalmoloji ve genel oftalmoloji olmak üzere altı ana başlıkta sınıflandırılmıştır. Çalışmaya katılan 19 göz hastalıkları araştırma görevlisi, uzmanlık eğitiminde geçirdikleri yıl sayısına göre dört gruba ayrılmıştır. Seçilen sorular hem araştırma görevlilerine hem de üç büyük dil modeline (ChatGPT-4.o, Google Gemini Advanced 2.0 ve DeepSeek) yöneltilmiş; elde edilen yanıtlar ki-kare testi ile karşılaştırılmıştır. Bulgular: Araştırma görevlileri arasında en yüksek doğruluk oranı %97.1 ile üçüncü yıl grubunda görü- lürken, dil modelleri arasında Gemini ve DeepSeek %92.9 oranıyla öne çıkmıştır. ChatGPT-4.o ise %85.7 oranında başarı göstermiştir. Lens hastalıkları grubunda dil modelleri, retina hastalıklarında ise araştırma görevlileri en düşük başarıyı göstermiştir. Tüm dil modelleri genel olarak %85’nin üzerinde doğruluk ora- nına ulaşmıştır ve birbirleriyle anlamlı fark görülmemiştir (p>0,05). Sonuç: Büyük dil modelleri, oftalmolojiye yönelik sınav sorularında yüksek doğruluk oranları elde edebil- mekte ve insan performansına yakın sonuçlar sunabilmektedir. Bu bulgular, söz konusu modellerin tıbbi eğitim ve değerlendirme süreçlerinde yardımcı araçlar olarak kullanılabileceğini göstermektedir. Bununla birlikte, bu modellerin klinik ortamlarda güvenle kullanılabilmesi için daha geniş katılımlı çalışmalarla doğ- ruluklarının test edilmesi ve her uzmanlık alanı için özel olarak geliştirilmesine ihtiyaç vardır.
dc.identifier.doi10.21673/anadoluklin.1727989
dc.identifier.endpage253
dc.identifier.issn2149-5254
dc.identifier.issn2458-8849
dc.identifier.issue2
dc.identifier.startpage246
dc.identifier.trdizinid1414062
dc.identifier.urihttps://doi.org/10.21673/anadoluklin.1727989
dc.identifier.urihttps://search.trdizin.gov.tr/tr/yayin/detay/1414062
dc.identifier.urihttps://hdl.handle.net/11508/64823
dc.identifier.volume31
dc.indekslendigikaynakTR-Dizin
dc.language.isoen
dc.relation.ispartofANADOLU KLİNİĞİ TIP BİLİMLERİ DERGİSİ
dc.relation.publicationcategoryMakale - Ulusal Hakemli Dergi - Kurum Öğretim Elemanı
dc.rightsinfo:eu-repo/semantics/openAccess
dc.snmzKA_TR_20250903
dc.subjectGöz Hastalıkları
dc.subjectBilgisayar Bilimleri
dc.subjectYapay Zeka
dc.titleTıpta uzmanlık sınavı göz hastalıkları sorularına yapay zeka ve araştırma görevlilerinin yanıtlarının değerlendirilmesi: Kesitsel çalışma
dc.title.alternativeEvaluation of large language models and ophthalmology trainees on ophthalmology questions from the Turkish medical specialty examination: A cross sectional study
dc.typeArticle

Dosyalar