맵리듀스를 이용한 정렬 기반의 데이터 큐브 분산 병렬 계산 알고리즘

Sort-Based Distributed Parallel Data Cube Computation Algorithm using MapReduce
  • 이수안
  • 김진호

초록

최근 많은 응용 분야에서 대규모 데이터에 대해 온라인 다차원 분석(OLAP)을 사용하고 있다. 다차원 데이터 큐브는 OLAP 분석에서 핵심 도구로 여긴다. 본 논문에서는 맵리듀스 분산 병렬 처리를 이용하여 효율적으로 데이터 큐브를 계산하는 방법을 연구하고자 한다. 이를 위해, 맵리듀스 프레임워크에서 데이터 큐브 계산 방법으로 잘 알려진 PipeSort 알고리즘을 구현하는 효율적인 방법에 대해서 살펴본다. PipeSort는 데이터 큐브의 한 큐보이드에서 동일한 정렬 순서를 갖는 여러 큐보이드를 한 파이프라인으로 한꺼번에 계산하는 효율적인 방식이다. 이 논문에서는 맵리듀스 프레임워크에서 PipeSort의 파이프라인을 구현한 네 가지 방법을 20대의 서버에서 수행하였다. 실험 결과를 보면, 고차원 데이터에 대해서는 PipeMap-NoReduce 알고리즘이 우수한 성능을 보였으며, 저차원 데이터에 대해서는 Post-Pipe 알고리즘이 더 우수함을 보였다.

키워드

Multidimensional Data CubeMapReduceDistributed Parallel ComputingPipeSort
제목
맵리듀스를 이용한 정렬 기반의 데이터 큐브 분산 병렬 계산 알고리즘
제목 (타언어)
Sort-Based Distributed Parallel Data Cube Computation Algorithm using MapReduce
저자
이수안김진호
발행일
2012-09
유형
Y
저널명
전자공학회논문지
49
9
페이지
196 ~ 204