MFCC 기반 환경음 분류 CNN에서 커널 사이즈와 풀링 레이어에 의한 성능분석

Performance analysis by kernel size and pooling layer in MFCC-based environmental sound classification CNN

초록

오디오 분류에 대한 연구는 청각장애인 및 고령층의 더 나은 삶과 오디오 관련 산업의 발전을 위하여 활발히 진행되고 있다. CNN은 오디오 분류에 사용되는 신경망 중 하나로, 입력 데이터의 특징을 스스로 학습하여 이미지를 분류할 때 주로 활용된다. 커널 사이즈와 풀링은 합성곱 신경망에서 파라미터 개수의 설정에 영향을 미치는 중요한 변수이다. 본 논문에서는 환경음 분류 연구에서 많이 사용되는 오디오 데이터 셋 UrbanSound8K에서 MFCC를 추출하여 CNN에 학습을 진행했다. 세 가지 CNN 시나리오를 설정하고, 각 시나리오에서 커널 사이즈와 풀링 레이어의 개수를 변화시키며 두 값과 정확도 및 파라미터 수의 관계를 알아보는 실험을 진행하였다. 실험을 통해 커널 사이즈와 풀링 레이어의 개수를 증가시킬수록 정확도 및 파라미터가 개선되었음을 확인하였다.

키워드

인공지능딥러닝합성곱 신경망파이썬소리 분류Artificial IntelligenceDeep LearningConvolution Neural NetworkPythonSound classification
제목
MFCC 기반 환경음 분류 CNN에서 커널 사이즈와 풀링 레이어에 의한 성능분석
제목 (타언어)
Performance analysis by kernel size and pooling layer in MFCC-based environmental sound classification CNN
저자
정윤아김동회
DOI
10.9728/dcs.2022.23.5.913
발행일
2022-05
유형
Y
저널명
디지털콘텐츠학회논문지
23
5
페이지
913 ~ 920