통계적 단순모형과 머신러닝·딥러닝 기반 복잡모형의 방법론 우수성 비교: 의료 데이터 분석 사례

Comparative Methodological Superiority of Statistical Simple Models and Machine Learning·Deep Learning–Based Complex Models: Evidence From the Medical Data Analysis

초록

본 연구는 의료 데이터 분석에서 단순모형과 복잡모형의 방법론적 우수성을 비교하였다. 두 모형의 우수성 비교를 위한 실증분석을 위해 피마 인디언 당뇨(Pima Indians Diabetes) 자료를 사용해 0값을 결측으로 처리하고 중앙값 대치·표준화를 거친 뒤 70:30 분할 및 동일 전처리 파이프라인으로 로지스틱 회귀(단순), 랜덤포레스트, 다층퍼셉트론(MLP)을 학습·평가하였다. 두 모형의 성능평가를 위해서는 임계값 의존 지표(정확도, 민감도, 특이도, 정밀도(PPV), 음성예측도, 조화평균(F1), 균형정확도, 매튜스 상관계수(MCC))와 임계값 무관·보정 지표(ROC-AUC, PR-AUC, Brier(↓), 보정 절편/기울기, Hosmer-Lemeshow(HL), 임상 순이득(DCA))를 적용하였다. 실증분석 결과, 로지스틱 회귀는 정확도 0.7662, 민감도 0.7160, F1 0.6824, 균형정확도 0.7547, MCC 0.4995로 전반적으로 가장 견조했으며 ROC-AUC 역시 0.8365로 최고였다. 반면 랜덤포레스트는 특이도 0.8733과 PPV 0.6885로 확증 성능이 우수했고, 보정 품질에서도 Brier 0.1594, 보정 절편 0.1356, 기울기 0.9914, HL p=0.7606으로 이상적 수준에 근접했다. 다층퍼셉트론은 동일 조건에서 상대적으로 열세를 보였다. 한편 DCA 차원에서는 전 구간 공통으로 모형 간 격차는 크지 않되, 임계값 선택에 따라 승자가 바뀌었다(0.10: 랜덤포레스트, 0.20~0.30: 로지스틱 회귀). 따라서 실제 적용 시 목표 pt와 FN/FP 비용구조를 먼저 정하고, 그 범위에서 순이득이 가장 큰 모형-컷오프 조합을 선택하는 것이 합리적이다. 종합하자면, 특정 모형의 방법론적 우수성은 절대적이지 않고 상대적이며, 분석목적에 따라 선택이 필요하다. 구체적으로 선별(미탐 최소화)이 목표일 때는 로지스틱 회귀가 적합하며, 확증(위양성 최소화)이나 확률 기반 의사결정에는 보정이 우수한 랜덤포레스트가 적합하다. 따라서 분석모형의 최적 선택은 유병률·FN/FP 비용·임계확률을 반영한 DCA와 함께 이뤄져야 한다.

키워드

단순모형복잡모형머신러닝딥러닝의료 데이터예측력성능평가로지스틱 회귀렌덤포레스트다층퍼셉트론Simple modelComplex modelMachine learningDeep learningMedical dataPredictive performancePerformance evaluationLogistic regressionRandom forestMultilayer perceptron
제목
통계적 단순모형과 머신러닝·딥러닝 기반 복잡모형의 방법론 우수성 비교: 의료 데이터 분석 사례
제목 (타언어)
Comparative Methodological Superiority of Statistical Simple Models and Machine Learning·Deep Learning–Based Complex Models: Evidence From the Medical Data Analysis
저자
양오석
DOI
10.71429/kmcr.2025.25.05.35
발행일
2025-10
유형
Y
저널명
경영컨설팅연구
25
5
페이지
461 ~ 474