인코더 기반 거대 언어 모델의 초기 계층이 코드 분류에 효과적인가?

Are Early Layers of Encoder-based Large Language Models Effective in Code Classification?

초록

인코더 기반 모델은 데이터를 잘 표현하여 코드 분류 태스크에 활용된다. 최근에 제안된 방법론인 EarlyBIRD는 인코더 기반 모델의 초기 계층의 결과물을 사용하여 효과적으로 태스크를 수행할 수 있음을 보였다. 하지만 해당 연구에서는 CodeBERT 모델만 사용하였으며, 특정 태스크에서만 효과를 보였다. 본 논문에서는 인코더-디코더 기반 CodeT5 모델을 이용하여 여러 태스크에서 EarlyBIRD를 적용하고 그 효과를 논의한다. 실험 결과, 태스크에서 다루는 프로그래밍 언어를 언어 모델이 사전 학습하지 않았을 때 13.79%p 성능이 향상되었지만, 비슷한 언어를 사전 학습한 경우 0.41%p밖에 성능이 향상되지 않았다. 또한 EarlyBIRD 방법론을 적용하지 않은 인코더-디코더 기반 모델의 성능이 EarlyBIRD를 적용한 인코더 기반 모델의 최고 성능과 비슷하였으며 어떤 초기 계층을 사용해야 할지 사전에 선택하기 어렵기 때문에 EarlyBIRD가 효과적이지 못함을 확인하였다.

키워드

encoder modelearly layercode classificationfine-tuning인코더 모델초기 계층코드 분류미세조정
제목
인코더 기반 거대 언어 모델의 초기 계층이 코드 분류에 효과적인가?
제목 (타언어)
Are Early Layers of Encoder-based Large Language Models Effective in Code Classification?
저자
이창섭지수환임현승
DOI
10.5626/jok.2025.52.8.654
발행일
2025-08
유형
Y
저널명
정보과학회논문지
52
8
페이지
654 ~ 659