DERİN ÖĞRENME YÖNTEMİ KULLANARAK SPEKTROGRAM VERİ KÜMESİNDENYAPILANDIRILMIŞ MOTİF ÇIKARIMI İLE AÇIKLANABİLİR SES SINIFLANDIRMA
| dc.contributor.advisor | KAYA, MEHMET | |
| dc.contributor.author | BOZTAŞ, FATMA | |
| dc.date.accessioned | 2026-08-12T10:09:56Z | |
| dc.date.issued | 2026 | |
| dc.department | FÜ, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Anabilim Dalı | |
| dc.description.abstract | Yakın zamanda ses sınıflandırma, derin öğrenme temelli yapay zeka uygulamaları ve sistemleri arasında önem kazanan bir araştırma alanı olmuştur. İnsan konuşmaları, çevresel sesler veya endüstriyel gürültüler gibi çeşitli akustik ve karmaşık verilerin sınıflandırılması günlük yaşamda; güvenlik, gözetleme, akıllı şehir uygulamaları, milli savunma ve istihbarat, sağlık-tanı sistemleri ve otonom araçlar gibi çok çeşitli alanlarda kritik bir rol oynamaktadır. Özellikle gürültülü ortamlarda veya sınırlı veriye sahip senaryolarda yüksek doğruluklu sınıflandırma yapmak, mevcut sistemlerin sınırlamalarını ortaya koymakta ve yeni yöntemlerin geliştirilmesini gerekli kılmaktadır. Bu bağlamda bir derin öğrenme modeliyle ses sinyallerinin görsel temsilleri olan spektrogramlar üzerinde çalışılmıştır. Spektrogramlar, zamana bağlı frekans dağılımlarını görselleştirerek karmaşık akustik özelliklerin analizini kolaylaştırmaktadır. Ancak bu görsel temsiller üzerinde doğrudan sınıflandırma yapmak genellikle modele gereksiz bilgi yüklenmesine, işlem süresinin uzamasına, daha karmaşık hesaplamalara girilmesine veya sınıflandırma hatalarına sebep olmaktadır. Bu çalışmada evrimsel bir algoritmanın yanlış sınıflandırma oranını azaltmak üzere genetik algoritma ile görüntü optimizasyonu ardından optimize edilmiş görüntülerden yapılandırılmış motif çıkarımıyla elde edilen görüntülerle bir CNN modelini eğitip yüksek doğruluğa yakınsayacak bir metodoloji önerilmiştir. CNN modeli ile sınıflandırma görevinde ağ performansını iyileştirmek için yapılandırılmış motif girdileri kullanılarak büyük veri setlerindeki veri yükünün azaltabilmesi, çok sınıflı ve karmaşık veri kümelerinde sınıf özelinde detaylı çalışmalar yapılabilmesine alan oluşturmuştur. Bu çalışma, UrbanSound8K veri seti üzerinde spektrogram tabanlı bir yaklaşım kullanarak ses sınıflandırma performansını optimize etmiş ve daha az veri ile daha optimum doğruluk oranlarına ulaşmıştır. Bu yaklaşım; ses sinyallerinde tekrar eden anlamlı desenlerin belirlenmesine odaklanarak daha yüksek yorumlanabilirlik ve verimlilik sağlamış, dikkate alınmak istenen sınıflar özelinde daha detaylı ve hassas çalışmalar yürütülebileceğini göstermiştir. | |
| dc.description.abstract | Recently, audio files have become an important research area among deep learning AI applications and systems. Classification of various acoustic and complex data such as human speech, explosion sounds or industrial noises plays a critical role in a wide range of areas such as security, surveillance, smart city applications, national defense and intelligence, health-diagnostic systems and autonomous vehicles in daily life. Especially in scenarios with large or limited data, achieving high accuracy reveals the limitations of current systems and necessitates the development of new methods. This is found on spectrograms, which are visual representations of the organization of sound with a structural deep learning model. Spectrograms facilitate the analysis of complex acoustic features by visualizing frequency distributions over time. However, performing classification directly on these visual representations usually results in loading unnecessary information into the model, increasing processing time, requiring more complex calculations, or causing classification errors. In this study, a methodology is proposed to reduce the misclassification rate of an evolutionary algorithm by training a CNN model with images obtained by extracting structured motifs from optimized images followed by image optimization with a genetic algorithm and converging to high accuracy. In the classification task with the CNN model, the ability to reduce the data load in large data sets by using structured motif inputs to improve the network performance has created space for detailed studies on classspecific multi-class and complex data sets. This study optimized the sound classification performance using a spectrogram-based approach on the UrbanSound8K dataset and achieved more optimum accuracy rates with less data. This approach; It provided higher interpretability and efficiency by focusing on the determination of repetitive meaningful patterns in sound signals, and showed that more detailed and sensitive studies can be carried out on the classes to be considered. | |
| dc.identifier.citation | BOZTAŞ, F. (2026). Derin öğrenme yöntemi kullanarak spektrogram veri kümesindenyapılandırılmış motif çıkarımı ile açıklanabilir ses sınıflandırma (Tez No. 992898) [Yüksek lisans tezi, Fırat Üniversitesi]. | |
| dc.identifier.uri | https://tez.yok.gov.tr/UlusalTezMerkezi/TezGoster?key=KOgdn9H3uVnWeb15j2W4h3iFCScYPBHSgA6s8w25zX7NkgC8xkyyrWXsAumMSfEy | |
| dc.identifier.uri | https://hdl.handle.net/11508/22593 | |
| dc.identifier.yoktezid | 992898 | |
| dc.language.iso | tr | |
| dc.publisher | Fırat Üniveristesi | |
| dc.relation.publicationcategory | Tez | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.snmz | KA_TEZ_20260511 | |
| dc.subject | Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol | |
| dc.title | DERİN ÖĞRENME YÖNTEMİ KULLANARAK SPEKTROGRAM VERİ KÜMESİNDENYAPILANDIRILMIŞ MOTİF ÇIKARIMI İLE AÇIKLANABİLİR SES SINIFLANDIRMA | |
| dc.title.alternative | Explainable sound classification through structured motif extraction from spectrogram datasets using deep learning methods | |
| dc.type | Master Thesis |







