효율적인 학습 모델 버저닝을 지원하는 Kubernetes 기반 분산 빅데이터 처리 프레임워크

Kubernetes-Based Distributed Big Data Processing Framework Supporting Efficient Machine Learning Model Versioning
  • 이수현
  • 장호준
  • 길명선
  • 문양세

초록

빅데이터 및 실시간 데이터 처리를 위한 분산 시스템은 이미 많은 분야에 활용되는 기반 기술이다. 본 논문에서는 Kubernetes 상에서 Apache Kafka, Apache Spark, CephFS를 통합하여 빅데이터 오프라인 학습, 실시간 데이터 기반 모델 재학습, 모델 버저닝(versioning)을 모두 지원하는 분산 프레임워크를 제안한다. 이는 실시간 분석 및 예측 서비스에서 최신 모델을 자동으로 빠르게 갱신할 수 있으며, 학습 모델의 버전 연계 추론이 가능한 새로운 구조이다. 모델 버저닝의 실용성을 검증하기 위해, 제안 프레임워크 기반 택시 운임료 예측 서비스 구축 및 평가를 진행하여 최신 데이터 기반 모델이 반드시 향상된 성능을 제공하지 않음을 보였다. 제안 프레임워크는 대규모 데이터 처리와 자원 관리 효율성을 높임과 동시에 모델 버저닝을 통해 실시간 분석 및 예측 서비스의 정확도와 유연성을 높일 수 있는 유용한 사례라 생각된다.

키워드

KubernetesBig DataDistributed Parallel ProcessingModel VersioningOpen-source Integrated Platfrom쿠버네티스빅데이터분산병렬처리모델 버저닝오픈소스 통합 플랫폼
제목
효율적인 학습 모델 버저닝을 지원하는 Kubernetes 기반 분산 빅데이터 처리 프레임워크
제목 (타언어)
Kubernetes-Based Distributed Big Data Processing Framework Supporting Efficient Machine Learning Model Versioning
저자
이수현장호준길명선문양세
발행일
2024-12
유형
Y
저널명
데이타베이스연구
40
3
페이지
50 ~ 59