BERT 기반 한국어 개방형 정보 추출

BERT-based Korean Open Information Extraction

초록

개방형 정보 추출은 자연어로 된 문장에서 구조화된 정보인 트리플을 추출하는 기술이다. 기존의 개방형 정보 추출은 입력 문장에서 관계 정보를 추출해야 하는 특성 때문에 품사 패턴, 의존 구문 분석 정보, 의미역 결정 정보 등을 이용한 복잡한 방법을 사용하였다. 본 논문에서는 한국어 개방형 정보 추출을 순차열 분류 문제로 보고 사전학습 된 BERT 모델을 적용하는 방법을 제안한다. 실험 결과 본 논문에서 제안한 모델이 정답이 아닌 자동으로 구축된 학습데이터 만을 사용했음에도 기존의 규칙기반의 방법보다 F-1 measure 2~3% 정도의 성능향상을 보였다.

키워드

BERT개방형 정보 추출딥러닝Sequence LabelingBERTopen information extractiondeep learningsequence labeling
제목
BERT 기반 한국어 개방형 정보 추출
제목 (타언어)
BERT-based Korean Open Information Extraction
저자
황현선이창기
DOI
10.5626/KTCP.2020.26.9.414
발행일
2020-09
유형
Y
저널명
정보과학회 컴퓨팅의 실제 논문지
26
9
페이지
414 ~ 418