교정사전과 신문기사 말뭉치를 이용한 한국어 철자 오류 교정 모델

A Spelling Error Correction Model in Korean Using a Correction Dictionary and a Newspaper Corpus
  • 이세희
  • 김학수

초록

인터넷 및 모바일 환경의 빠른 발전과 함께 신조어나 줄임말과 같은 철자 오류들을 포함하는 텍스트들이 활발히 통용되고 있다. 이러한 철자 오류들은 텍스트의 가독성을 떨어뜨림으로써 자연어처리 응용들을 개발하는데 걸림돌이 된다. 이러한 문제를 해결하기 위해서 본 논문에서는 철자오류 교정사전과 신문기사 말뭉치를 이용한 철자 오류 교정 모델을 제안한다. 제안 모델은 구하기 쉬운 신문기사 말뭉치를 학습 말뭉치로 사용하기 때문에 데이터 구축비용이 크지 않다는 장점이 있다. 또한 교정사전 기반의 단순 매칭 방법을 사용하기 때문에 띄어쓰기 교정 시스템이나 형태소 분석기와 같은 별도의 외부 모듈이 필요 없다는 장점이 있다. 신문기사 말뭉치와 실제 휴대폰에서 수집한 문자 메시지 말뭉치를 이용한 실험 결과, 제안 모델은 다양한 평가 척도에서 비교적 높은 성능(오교정률 7.3%, F1-척도 97.3%, 위양성율 1.1%)을 보였다.

키워드

Spelling Error Correction ModelNewspaper CorpusSpelling Error Correction DictionarySpelling Error Correction ModelNewspaper CorpusSpelling Error Correction Dictionary철자 오류 교정 모델신문기사 말뭉치철자 오류 교정 사전
제목
교정사전과 신문기사 말뭉치를 이용한 한국어 철자 오류 교정 모델
제목 (타언어)
A Spelling Error Correction Model in Korean Using a Correction Dictionary and a Newspaper Corpus
저자
이세희김학수
발행일
2009-10
유형
Y
저널명
정보처리학회 논문지
16
5
페이지
427 ~ 434