기관회원 [로그인]
소속기관에서 받은 아이디, 비밀번호를 입력해 주세요.
개인회원 [로그인]

비회원 구매시 입력하신 핸드폰번호를 입력해 주세요.
본인 인증 후 구매내역을 확인하실 수 있습니다.

회원가입
서지반출
한국어 품사 및 동형이의어 태깅을 위한 단계별 전이모델
[STEP1]서지반출 형식 선택
파일형식
@
서지도구
SNS
기타
[STEP2]서지반출 정보 선택
  • 제목
  • URL
돌아가기
확인
취소
  • 한국어 품사 및 동형이의어 태깅을 위한 단계별 전이모델
저자명
신준철,옥철영,Shin. Joon-Choul,Ock. Cheol-Young
간행물명
정보과학회논문지. Journal of KIISE. 소프트웨어 및 응용
권/호정보
2012년|39권 11호|pp.889-901 (13 pages)
발행정보
한국정보과학회
파일정보
정기간행물|
PDF텍스트
주제분야
기타
이 논문은 한국과학기술정보연구원과 논문 연계를 통해 무료로 제공되는 원문입니다.
서지반출

기타언어초록

한국어 의미처리시스템은 어절의 형태소를 분석하고, 품사와 동형이의어를 분별해야 한다. 이를 위해 최근의 연구들은 말뭉치를 기계학습하여 품사 및 동형이의어 태깅하는 방법들을 제안하고 있으며, 기계학습에서 자료부족 문제를 해결하는 것에 집중하고 있다. 본 논문에서는 말뭉치를 기계학습하여 품사와 동형이의어를 동시에 태깅하는 방법을 제안한다. 이 방법은 자료부족 문제를 해결하기 위해 단계별 전이모델을 사용하며, 각 전이모델마다 다른 가중치를 적용한다. 또한 부분적으로 전이빈도가 0인 경우를 위해 최소 전이점수를 계산하는 예외 처리 루틴을 포함한다. 실험을 위해 1천만 어절의 세종 말뭉치를 사용하였으며, 이 중 90%를 학습하고 나머지 10%를 테스트하였다. 실험 결과 품사와 동형이의어 둘 다에 대해 96.44%의 태깅 정확률을 보였으며, 품사만을 고려할 경우 98.0%의 태깅 정확률을 보여 본 논문에서 제안하는 단계별 전이모델이 한국어와 갈은 교착어의 품사 및 동형이의어 태깅에 적합한 방법임을 알 수 있다.

기타언어초록

A Korean semantic processing system must analyze morpheme and disambiguate the POS and homograph for words. The recent researches proposed machine learning model using corpus, and focused on resolving the data sparseness problem. This paper proposes a method of simultaneous tagging for the POS and homograph using machine learning of corpus. The proposed method uses stage transition model for resolving the data sparseness problem, and applies different weight to each transition model. The tagging system includes exception routine that calculates minimum transition score in the case of no transition between words. For the experiment we used the 10 million words Sejong corpus and learned 90% of the Sejong corpus and tested 10%. The experiments shows that the accuracy is 96.44% for the POS and homograph tagging and 98.0% for the only POS tagging. From the experiment. the proposed stage transition model is adequate for tagging POS and homograph of agglutinative language like Korean.