Morphology Analysis

 

어형론은 형태론이라고도 부르며 단어를 만들어 주기 위하여 사용된 의미있는 구성들을 다룬다. 예를 들면, 접두어인 un, non, anti, dis 및 접미어인 ing, ly등을 다루어 원래 단어의 의미를 변형시키는 것을 다루는 것이다.

형태소(morpheme)는 문을 구성하는 최소의 언어 단위를 말한다. 특히 엄밀하게 언어학적으로 형태소를 단어 혹은 접두어(prefix) 혹은 접미어(subfix)라고 생각해도 지장이 없다.

영어의 경우 형태소 처리의 예는 다음과 같다.

자연어 처리를 위한 단어의 최소단위인 형태소로 분리하는 형태소 해석에서는 입력된 문장을 구성하는 단어를 문장의 element로 분석하는 것인데 형태소 사전이 준비되는 것으로서 문제가 없어지는 것이 아니고 많은 경우에서는 한국어나 일본어의 어형변화 및 첨가에서 발생하는 어절분리가 애매모호한 부분이라든가 영어에 있어서의 시제변화 동사의 활용 등에서 규칙변화가 아닌 한에는 사전의 entryword 로서는 해결되지 않는다. 따라서 입력된 문장을 형태소 해석하는 것이 불가능해지는데 이러한 어형 변화 규칙은 비교적 단순하여 컴퓨터가 해석하는 것은 그리 어렵지는 않다. 다만 한국어의 경우에는 띄어 쓰기가 확립되어 있다 하더라도 작문자의 판단이 정확하지 못한 철자법이 발생할 수 있으므로 유의할 필요가 있다. 현재는 형태소 해석이 불가능한 경우에 대해서 구문해석 기법을 병행 처리함으로써 형태소 해석의 정도(精度)를 향상시키는 연구가 진행중이다.

형태소해석 : 최기선 : 한국어 문장은 어절의 나열로 이루어진다. 각 어절은 하나 이상의 단어가 복잡한 법칙에 따라 붙여쓰기를 한다. 따라서 한국어 해석에 있어 또 하나 중요한 점은, 한 어절 안의 붙여쓴 단어들을 단어별로 나누는 문제이다. 영문에서는 각 단어 뒤에 띄어쓰기를 해서 단어를 잘라주기 때문에, 한국어에서와 같은 문제가 발생하지 않는다. 그러나 한국어에서는 어절 별로 띄어쓰기를 하여, 기계가 어절 안의 단어를 식별하지 않으면 안된다. 이러한 어절 안에서 나누어 주어야 할 단어를 좀더 전문적인 용어로 형태소 (形態素) 라고 부른다. 따라서 위와 같은 해석의 가정을 형태소 해석이라고 하는데, 구문해석 전에 반드시 이 과정을 거쳐야 한다.

그러면, '나는 오늘 컴퓨터 책을 샀다.' 라는 문장에 대한 형태소 해석의 예를 보자. 아래에서 [] 로 묶은 것은 한 어절을 뜻한다.

나

는

오늘

컴퓨터

책

을

샀다

[명사

조사]

[부사]

[명사]

[명사

조사]

[동사(완료형)]