상세 보기
초록
인터넷 및 모바일 환경의 빠른 발전과 함께 신조어나 줄임말과 같은 철자 오류들을 포함하는 텍스트들이 활발히 통용되고 있다. 이러한 철자 오류들은 텍스트의 가독성을 떨어뜨림으로써 자연어처리 응용들을 개발하는데 걸림돌이 된다. 이러한 문제를 해결하기 위해서 본 논문에서는 철자오류 교정사전과 신문기사 말뭉치를 이용한 철자 오류 교정 모델을 제안한다. 제안 모델은 구하기 쉬운 신문기사 말뭉치를 학습 말뭉치로 사용하기 때문에 데이터 구축비용이 크지 않다는 장점이 있다. 또한 교정사전 기반의 단순 매칭 방법을 사용하기 때문에 띄어쓰기 교정 시스템이나 형태소 분석기와 같은 별도의 외부 모듈이 필요 없다는 장점이 있다. 신문기사 말뭉치와 실제 휴대폰에서 수집한 문자 메시지 말뭉치를 이용한 실험 결과, 제안 모델은 다양한 평가 척도에서 비교적 높은 성능(오교정률 7.3%, F1-척도 97.3%, 위양성율 1.1%)을 보였다.
키워드
Spelling Error Correction Model; Newspaper Corpus; Spelling Error Correction Dictionary; Spelling Error Correction Model; Newspaper Corpus; Spelling Error Correction Dictionary; 철자 오류 교정 모델; 신문기사 말뭉치; 철자 오류 교정 사전
- 제목
- 교정사전과 신문기사 말뭉치를 이용한 한국어 철자 오류 교정 모델
- 제목 (타언어)
- A Spelling Error Correction Model in Korean Using a Correction Dictionary and a Newspaper Corpus
- 저자
- 이세희; 김학수
- 발행일
- 2009-10
- 유형
- Y
- 저널명
- 정보처리학회 논문지
- 권
- 16
- 호
- 5
- 페이지
- 427 ~ 434