자연어 처리란 무엇인가?
인간을 정의할 때 '인간은 언어를 사용하는 동물이다' 라고 표현하기도 한다. 이렇듯 말을 하고 (또는 글을 쓰고) 그것을 이해하는 것은 인간만이 지닐 수 있는 능력이다. 그런데 이러한 인간 고유의 능력을 기계가 할 수 있도록 하는 것이 바로 자연언어처리라고 불리는 분야이다 ........ 자연언어를 이해하는 데는 두 가지 측면이 있다. 첫째는 문법 (구문) 적 이해이다. 각 단어의 품사를 인식하여, 한 문장 안에서 단어가 어떻게 구성되었는가를 인식하는 것이다. 또 한 측면은 의미적 이해이다. 문장을 문법적 지식만으로는 완전히 이해할 수 없다. 예를 들면, "아름다운 한국의 나 " 라는 문구에서 '아름답다' 가 '한국' 을 수식하는가 '나' 를 수식하는가는 문법적인 문제라기 보다는 의미적인 문제이다. 따라서 자연언어의 의미적 구조를 명확히 하기 위한 문법도 고려되고 있다 ....... (최기선 1992)
최근에 우리들이 자연어를 학습하거나 이해하는 과정의 연구가 인지심리학이다. 인공지능 연구에서는 자연어를 컴퓨터에 이해시키는 연구가 진행되고 있다. 이것을 자연어 이해 시스템 (natural language understanding system) 이라고 부르고 있다. 또한 자연어에 관한 문제는 철학인 논리학에서도 받아들여지고 있다. 이상과 같이 자연어를 학문적으로 연구하는 것이 인지과학이다. 인지과학에서는 자연어의 연구가 하나의 큰 기둥이 되고 있다. 또한 보다 좁은 의미이지만, 컴퓨터를 사용하여 자연어의 처리를 행하는 계산언어학 (computational linguistics) 도 있다. 이 학문은 진행중에 있지만, 앞으로 인지언어학, 인공지능의 연구 등과 관련을 가지면서 언어학의 새로운 형태로 성장될 것으로 생각된다 ........ (김길준 1996)
지능을 가진 Robot 가 우리인간의 말을 어떻게 이해하고 구문 해석하여 우리가 내린 명령에 대답을 하고 행동하는가? .... 어떠한 것을 이해한다는 것은 이를 한 표현으로부터 다른 표현으로 변환시키는 것을 뜻한다. 컴퓨터가 언어를 이해할 수 있다는 것은 입력문 (자연어) 을 응용시스템이 조작 가능한 표현형 (의미표현) 으로 컴퓨터가 변환할 수 있음을 말한다 ...... ELIZA 프로그램은 정신병환자가 의사가 없이도 컴퓨터 화면을 이용해서 서로 간단한 대화를 주고받을 수 있는 프로그램이다. 컴퓨터에서 HOW ARE YOU THIS BEAUTIFUL DAY? 의 내용을 의사가 물어 보듯이 언어가 자동 생성되고, 환자가 대답 I DON'T KNOW, I FEEL BAD. 이라고 키보드로 입력하면 프로그램에서 다시 언어가 자동 생성되어 CRT 에 DISPLAY 될 것이다.............. (이광형 1998)
자연어 처리는 그 목적을 아래의 3 가지로 요약할 수가 있다.
첫째로 대량의 자연어 데이터 처리이다. 대량어 데이터 처리를 행하는 것보다 그 언어 데이터에 포함되어 있는 다른 언어의 수, 다른 말과 함께 사용되는 빈도분포, 문자 종류의 빈도분포 등 언어 데이터가 가지는 각종의 통계 데이터를 수집분석할 수가 있다. 시대와 함께 그것들이 어떻게 변화했는가를 조사할 수도 있다. 따라서 대량의 언어 데이터의 통계적 분석에 컴퓨터에 의지한 자연어 처리기술이 달성한 역할은 대단히 큰 것이다. 통계적인 분석만이 아니고 대량어 데이터를 소재로 KWIC (Key Word In Context) 등을 작성하고 언어학자의 연구를 도와서 '자료' 를 만드는 데에 자연어 처리가 위력을 발휘하는 장면도 근년에 증가해 가고 있다.
둘째는 컴퓨터에
자연어를 이해시키는 자연어 이해 시스템 (natural language understanding system)
의
연구이다. 그 응용으로서 질문 응답 시스템 (machine translation system), 요약 시스템
등이 있다. 자연어 이해 시스템은 컴퓨터와 인간 사이에 존재하는 사용언어가
서로 다름으로써 생기는 불편의 해소를 목적으로 하는 시도이다.
주로
인공지능 연구자가 1970 년대에 처음으로 받아들여서 현재까지 연구가 활발하게 진전되고
있는 것이다. 그 응용인 질문응답 시스템, 기계번역 시스템, 요약 시스템 모두 의미
이해를 포함한 자연어의 처리가 요구되고 있는 것이다. 그러나 곤란한 문제 해결에는
인간의 도움을 받아 인간과 협조해서 자연어 처리를 향상시킬 생각을 받아들였던
실용 시스템의 실현으로 이제는 그다지 곤란하지 않다고 생각된다.
셋째는 컴퓨터 상에서 자연어 처리의 모델을 작성하는 것보다 인간이 사용하는 언어 이해의 과정을 설명한다. 컴퓨터 상에 언어이해의 모델을 작성하고 그 움직임의 모양 때문에 인간의 언어이해의 과정을 미루어 추측하려고 하는 것으로서, 최근의 인지과학의 큰 연구과제가 되고 있다. 거기에서는 인간의 언어 이해에 있어서 추론 (inference) 의 방식, 상식 (commonsense) 의 이용, 기억의 구조 (memory organization) 가 큰 문제가 되고 있고, 이상의 어떠한 것도 지식 표현 (knowledge representation) 의 문제와 깊게 관련되어 있으며, 그것들의 해결은 자연어 이해의 실현에 큰 역할을 다한다고 생각되고 있다.