미래의 컴퓨터와 한글공학

 

한국어와 인공지능 : 고창수 편저, 태학사, 1999, Page 121~136

국민대  자연언어 정보검색 연구실, 강승식

 

1. 컴퓨터와 한글

2. 한국어 정보처리의 필요성

3. 한국어 정보처리

4. 한글공학

5. 미래의 S/W 에서 한글공학의 역할

 

"신문에서 인터넷 관련 기사들만 스크랩 해줄래?"
대부분의 사람들은 이와 같이 단순하지만 시간이 빼앗기는 작업에 많은 시간을 소모하고 있다. 시키는 대로 척척 일을 처리해 주는 비서라도 있으면 좋겠지만 여의치가 않다. 더 많은 정보를 쉽게 얻을 수 있다면 더 좋은 결과를 가져올 수 있을 텐데 단순 반복작업에 할당될 시간이 부족하다. 이러한 단순 반복작업을 싫어하여 주위 사람에게 부탁하기도 한다. 우리의 선조들은 궂은 일을 시키기 위해 하인을 두었고, 요즘에는 컴퓨터나 기계의 도움을 얻고 있다. 그런데 컴퓨터나 기계를 작동하려면 스위치 혹은 특정 명령어를 입력해야 하기 때문에 작동방법을 익혀야 하는 번거로움이 있다.
컴퓨터의 기능이 많아지고 작동방법이 복잡해지면서 사람이 컴퓨터를 활용하는 것이 아니라 컴퓨터의 기능에 맞춰 사람이 행동해야 하는 사태가 일어나기도 한다. 또한 컴퓨터의 기능이 많아질수록 사람-기계 접촉 (man-machine interface) 이 더욱 복잡해지고, 명령어를 잘못 입력하면 컴퓨터의 작동이 멈추거나 오동작이 발생한다. 어쩌면 컴퓨터의 기능을 잘 모르는 일반인들에게는 컴퓨터 때문에 일을 마치게 되는 애물단지로 작용할 수도 있으며, 컴퓨터의 작동 원리에 따라 사고해야 하는 컴퓨터 종속적인 사고방식이 보편화될지도 모른다.
사용하기 편리한 컴퓨터를 만들기 위한 노력은 빌 게이츠가 컴덱스기조연설에서 "미래의 응용 소프트웨어는 사용자들의 습성과 특성을 알아내 쉽게 사용될 수 있도록 개발될 것이다" 라고 한 소프트웨어의 발전 방향과도 무관하지 않다. 즉 미래의 컴퓨터 환경은 사용설명서를 읽거나 소프트웨어의 사용법을 익히지 않더라도 원하는 기능을 자연스럽게 사용할 수 있을 것으로 예상된다. 이러한 사용자 위주 컴퓨터 환경이 현실화되기 위한 사람-기계 접촉 (man-machine interface) 은 자연언어 처리 (natural language processing) 기술의 활용이다. 사람이 컴퓨터에게 원하는 기능을 쉽게 전달하고 컴퓨터가 처리한 작업의 내용을 쉽게 전달받을 수 있기 위해서 컴퓨터에게 언어처리 기능을 부여하면 된다.
지금까지는 인간과 컴퓨터 사이에 의사소통 수단으로 컴퓨터 위주의 사용 환경, 즉 컴퓨터가 이해할 수 있는 명령어만을 사용해 왔으며 인간은 쉴새없이 글자판 (keyboard) 을 두드리고 있었다. 그러나 자연언어 처리 기술이 발전하면서 컴퓨터가 인간의 언어인 자연언어를 인식하게 되면 인간과 컴퓨터 사이의 대화는 컴퓨터 위주의 언어인 인공언어가 아니라 인간 위주의 언어인 자연언어가 될 것이다.

 

1. 컴퓨터와 한글

한국어는 아침에 일어나서 잠자리에 들 때까지 의사소통을 위한 필수불가결한 요소이다. 심지어는 잠꼬대를 할 때도 한국어가 필요하다. 그리고 한글은 한국어를 가장 정확하게 표현해 주는 문자이다.
부시맨이 살고 있다는 아프리카 지역이 아니더라도 바로 이웃 나라에 여행할 때도 말이 통하지 않으면 밥 한끼 먹는 것도 쉬운 일이 아니다. 컴퓨터 역시 사무실마다 없어서는 안되는 도구로 자리잡고 있다. "오늘 오후에 정전이다" 혹은 "컴퓨터가 고장났다" 라는 정보를 접하기라도 하면 여기저기서 야단이 난다. 책상을 정리하는 일밖에 할 일이 없다.
일상생활과 사무실에서 각각 필수적인 요소 가운데 하나인 한글과 컴퓨터는 서로 어떤 관련이 있는가? 대부분의 일반인들은 물론이고 컴퓨터 관련분야에 종사하는 많은 분들이 한글 문서편집 기 (word processor) 와 그것을 만드는 회사의 이름이라고 인식하고 있다. 컴퓨터에 대한 지식이 있는 사람은 영어권에 개발된 컴퓨터에서 한글을 사용할 수 있게 해주는 것이라고 대답한다. 불과 몇 년 전만 하더라도 컴퓨터에서 한글 입-출력 문제는 매우 중요한 관심사였고, 한글 관련 소프트웨어 분야는 운영체제의 한글화나 한글 문서편집기의 개발이 대부분을 차지했었다. 그러나 컴퓨터에서 한글을 사용할 수 있게 해주는 한글 운영체제와 문서편집기의 한글 입-출력 기능은 유니코드 (unicode) 가 보편화되면서 더 이상 문제가 되지 않을 전망이다.
컴퓨터에서 한국어 정보처리는 입-출력 기능이 주가 아니라 한국어 문장을 분석하는 데 필요한 기반기술, 그리고 그 기반기술을 이용하여 소프트웨어를 개발하는 응용기술에 중점을 두고 있다. 그런데 교육방송에서 방영되고 있는 '미리가본대학' 은 소프트웨어에 의하여 분석할 때 '미리 가 본 대학' 인지 아니면 '미리라는 사람이 본 대학' 인지를 판단하기는 어렵다. 또한 지하철 입구에 적혀 있는 '서류 보관함' 이 '서류를 보관하는 함' 인지 아니면 '서류를 보관한다'라는 의미인지를 구별하기는 거의 불가능하다. 이와 같이 자연언어 처리 기술은 결코 완벽할 수 없다. 그러나 의미를 정확히 이해하지 못하더라도 문장의 구조만 파악되면 이를 응용할 수 있는 분야는 매우 많다.
실제로 자연언어 처리 기술을 바탕으로 문서 편집기에서 맞춤법 검사 기능, 전자사전 기능이 제공되고 있으며, 자동 색인, 기계 번역, 자연언어 인터페이스, 문자 인식, 음성 인식 등 자연언어와 관련된 다양한 분야로 확대되고 있다. 한국어 정보처리 기술은 한글 입-출력뿐만 아니라 한국어 문장을 분석하는 자연언어 처리 기술이 주를 이루고 있으며, 궁극적으로 문장의 의미를 이해하는 것을 목표로 하고 있다. 특히, 인터넷과 관련된 정보 습득과정에서 기계 번역이나 문서 요약, 음성 인식이나 합성을 이용한 사용자 인터페이스 부분은 한국어 정보처리 분야의 발전을 가속화시키는 원동력이 되고 있다.

 

2. 한국어 정보처리의 필요성

1990년대에 컴퓨터 분야의 가장 큰 변화는 '정보를 당신 손끝에 (information on your fingertips)' 요약되는 정보 통신과 첨단 소프트웨어 기술의 활용이다. 마이크로소프트는 정보통신이나 첨단 소프트웨어에 엄청난 연구비를 투자하고 있다. 이러한 현상은 IBM 회장 거스너와 노벨 회장의 컴덱스 기조연설에서도 나타난다. "미 국회 도서관의 장서를 한 장의 디스켓에 저장할 수 있을 만큼 첨단 정보과학 기술은 아무도 예측할 수 없을 정도로 발전하고 있다" "세계의 모든 통신망을 하나로 연결한 전지구 통신망 (global smart network) 이 실현될 것이다".
2000년대의 컴퓨터 관련분야는 인터넷을 중심으로 한 정보통신이 가장 큰 관심사가 되고 있으며, 힘 (power) 을 가진 자가 승리하던 시대에서 정보를 가진 사람이 승리하는 시대로 급속히 변모하고 있다. 소프트웨어 분야에서는 정보 검색도구와 편리한 사용자 인터페이스가 매우 강조된다. 정보화 시대를 앞당긴 요소 가운데 하나는 정보검색시스템 (information retrieval system) 으로 정보검색시스템에서는 자연언어 처리 기술을 활용한 자동 색인 기능이 핵심적인 역할을 한다. 또한 인터넷 서비스가 일반화되면서 필요한 정보를 쉽고 빠르게 습득하기 위해 기계번역 시스템의 중요성이 부각되고 있으며, 문서를 자동으로 요약해 주는 문서 요약 시스템에 관한 요구가 증가하고 있다. 이와 같이 정보통신을 위한 소프트웨어 가운데에서 많은 부분이 자연언어 처리 기술을 필요로 한다.
자연언어 처리는 1950년대에 컴퓨터가 처음 등장하면서부터 연구되었으나, 1964년에 10여 년 동안의 연구 성과에 대한 ALPAC (Automatic Language Processing Advisory Committee) 보고서에서 부정적인 평가가 내려진 이후로 1970년대 후반부터 1980년대 초반에 맞춤법 검사기 (spelling checker) 와 자동 색인 (automatic indexing) 시스템이 상용화되면서 자연언어 처리 분야의 중요성이 인식되었고, 1980년대에는 기계 번역 기술을 중심으로 활발하게 연구되었다.
컴퓨터를 이용한 자연언어 처리 기술은 영어의 경우에 수십 년에 걸쳐 전자사전 (electronic dictionary) 을 비롯하여 전산언어학 (computational linguistics) 이론에 이르기까지 꾸준히 발전되어 왔다. 그러나 한국어 정보처리 분야는 1980년대 중반에 와서야 초보적인 수준의 연구가 시작되었고, 1990년 초에 와서야 비로소 한글 맞춤법 검사기와 일-한 기계 번역 시스템이 상용화되었다. 1993년에는 자동 색인 기능이 정보검색시스템에서 활용되었으며, 1995년에는 영-한 기계 번역 시스템이 등장하였다([표 1]).

 [표 1] 영어와 한국어의 응용 기술 비교

 

영       어

한  국  어

기초연구 시작

50년대 초

80년대 초

철자 검사

70년대 말

90년대 초

문법 검사

80년대 중

?

자동 색인

80년대 초

90년대 초

기계번역 상용화

80년대 중

90년대 중

영어와 관련된 자연언어 처리 기술의 응용분야는 1980년대 후반부터 문장 단위 분석인 구문 분석 (parsing) 기술을 부분적으로 응용 시스템에서 활용하고 있다. 그러나 한국어 정보처리 기술은 현재까지도 단어 단위의 분석인 형태소 분석 (morphological analysis) 기술을 황용하는 수준이다. 타 언어에 비해 한국어와 관련된 기반기술이 매우 취약한 편이며, 전자사전과 같은 기반기술과 자료의 축적이 미비하여 발전 속도가 더딘 편이다. 표 2에서 보는 바와 같이 기반기술 측면에서 한국어 관련분야는 선진국에 비해 분야별로 5~10년 이상 뒤떨어져 있다. 그 가운데서도 한국어 정보처리의 가장 기초가 되는 전자사전 편찬이나 국어 정보 베이스 구축 등 기초 연구에 관한 부분은 아직까지 만족할 만한 결과를 얻지 못하고 있다.

 [표 2] 영어와 한국어의 기반 기술 비교

 

영어

한국어

사전 및 기초연구

◎

□

형태소 분석

◎

○

구문 분석

□

△

의미 분석

△

△

음성 인식이나 합성

△

△

3. 한국어 정보처리

한국어 정보처리는 자연언어 처리 가운데에서 한국어와 관련된 부분이다. 자연언어 처리는 자연언어 문장을 분석하거나 자연언어를 생성하는 일, 그리고 두 언어 사이의 특성과 관련된 부분 등 자연언어 문장을 입-출력으로 하는 응용 시스템을 모두 포함한다. 즉 맞춤법 검사기, 기계 번역 시스템, 한국어 이해 시스템 등과 같이 자연언어의 분석이나 생성에 관한 기술이 필요한 소프트웨어를 구현하는 방법론에 대하여 연구한다. 자연언어 처리 시스템이 실용화되면 자동 통역이 가능해져서 컴퓨터의 활용 범위가 넓어지거나 자연언어 인터페이스를 활용하여 컴퓨터를 손쉽게 사용할 수 있는 등 그 응용 분야가 매우 넓다. 또한 기계 학습 (machine learning) 기능이 추가되면 인간과 같은 수준의 지능을 가진 컴퓨터 (intelligent computer) 가 등장할 수도 있다.
자연언어 처리 시스템의 대표적인 예로는 기계번역 시스템과 자연언어 이해 시스템이다. 영-한 기계번역 시스템은 영어의 분석과 영-한 변환, 한국어 생성 등 자연언어 처리에서 필요한 모든 기능을 포괄하고 있다. 한국어 이해 시스템 (Korean understanding system) 은 한글 문서의 내용을 분석하여 의미 네트워크로 저장한 후에 그 문서의 내용에 대한 질의 응답이나 문서 내용을 요약하거나 사용자가 원하는 형태로 생성해 주는 시스템이다. 한국어 정보처리는 한국어의 분석이나 생성에 관한 부분으로 한글맞춤법 검사기, 자동 색인, 한-영 기계 번역에서 한국어 분석이나 영-한 기계 번역 시스템의 한국어 생성 등 한국어와 관련된 부분이 모두 한국어 정보처리에 속한다. 그런데 언어의 분석과 생성을 위해서는 그 언어의 특성에 관한 기초 연구나 정보 자료가 쉽게 접근 가능하여야 한다.
한국어 정보처리는 컴퓨터로 접근 가능한 전자사전과 한국어의 표기 특성, 구조적 특성, 의미적 특성 등 언어의 특성과 밀접한 관련이 있다. 따라서 한국어 정보처리 시스템이 성공적으로 구현되려면, 한국어와 관련된 다양한 기반기술이 확보되어야 한다. 이러한 요구를 충족시키기 위하여 전자사전의 구축, 한국어의 특성에 적합한 분석 기법이나 생성 기법 등 한국어 정보처리에 필요한 온갖 기초 기술과 정보를 구축함으로써 실용적인 한국어 정보처리 시스템의 구현이 가능케 한다. 컴퓨터에서 한글이나 한국어를 처리하기 위한 모든 기반 기술을 체계적으로 연구하고 이와 관련된 국어 정보베이스를 구축하여 다양한 한국어 정보처리 응용 시스템에서 활용할 수 있는 기술이나 정보를 제공하는 분야가 한글공학이다.

 

4. 한글공학

자연언어 처리는 언어의 특성에 관한 기반기술이 가장 중요한 요소가 되며, 기반기술의 발전은 바로 응용 소프트웨어를 개발하는 데 활용된다. 컴퓨터에서 각 언어에 대한 기반기술을 연구하는 분야를 언어공학 (language engineering) 이라 하며, 한글공학 (KLE : Korean language engineering) 은 그 가운데에서 한국어와 관련된 부분이다. 한글공학은 한글 코드나 입-출력, 전자 사전 개발, 한국어 말뭉치 구축, 한국어 분석이나 생성 기법 등과 같은 기초기술과 맞춤법 검사, 한국어 정보 검색, 한글 인터페이스, 한국어 인식 시스템 등 컴퓨터에서 한글을 구현하거나 한국어의 특성과 관련된 응용기술로 구분된다.
기초기술 분야에서 전자사전의 구축은 한국어 정보처리를 위해서 필수적이며, 응용 기술 분야에서 필요로 하는 한국어 어휘 정보에 대하여 다양한 형태의 자료를 제공한다. 따라서 전자사전은 어휘 정보를 수록하고 있는 정보베이스와 수록된 정보를 다양한 요구 사항에 맞게 재구성하는 도구들로 구성된다. 전자 사전이 잘 구축되어 있으면 전자 사전에 수록된 정보를 이용하여 형태소 분석 사전이나 구문 분석 사전, 의미 분석 사전을 구축하려면 형태소 (morpheme) 와 품사 정보를 추출할 수 있어야 하고 한국어 어휘에 관한 빈도수 등 각종 통계자료를 활용함으로써 분석 결과의 신뢰도나 분석 효율을 증가시킬 수 있다.
전자사전은 기존의 국어사전에 수록되어 있는 품사, 낱말 풀이, 용례 정보뿐만 아니라 빈도수 혹은 어휘간의 관련성을 비롯한 여러 가지 정보들이 추가되어 한국어 정보처리에 필요한 모든 정보를 수록하고 있어야 한다. 그 가운데에서 동의어 (synonym), 상위어 (broader term), 하위어 (narrower term), 관련어 (related term) 등 어휘간의 관련성을 나타내는 정보는 시소러스 (thesaurus) 에 수록된다. 일반 전자사전에서 품사 정보와 범주 (subcategory) 정보는 주로 형태론적 혹은 구문론적 정보처리에 활용되고, 낱말 풀이와 용례 그리고 시소러스는 의미론적 정보처리에 활용된다. 또한 기계 번역을 위해서는 영-한, 한-영, 일-한, 한-일 사전 등과 같이 두 언어간의 변환 사전이 구축된다.
한국어 전자사전이 한국어 어휘 정보들을 수록하고 있는 데 비해 한국어 말뭉치는 실생활에서 사용되고 있는 어휘들에 대한 다양한 유형의 예제 문장들을 체계적으로 저장하고 있는 표본이다. 말뭉치에는 예제 문장에 대하여 기본적으로 형태소 분석 결과로 문맥에 적합한 어휘 정보가 부여되어 있으며, 구문 분석 결과에 대한 정보까지 수록되어 있으면 활용 가치가 더 크다. 말뭉치는 한국어 어휘 및 문장의 유형이나 문장의 구조, 자주 사용되는 어휘, 자주 사용되지 않는 문장 구조 등에 한국어에 대한 다양한 통계적 자료를 제공한다. 전자 사전과 말뭉치에서 추출된 자료를 잘 활용함으로써 한국어 문장을 분석하거나 생성할 때 더 정확한 결과를 얻을 수 있다.

한국어 분석과정은 단계적으로 형태소 분석 (morphological analysis), 구문 분석 (syntactic analysis 또는 parsing), 의미 분석 (semantic analysis), 담화 분석 (pragmatic analysis) 으로 구분된다. 형태소 분석은 띄어쓰기 단위로 분리되는 단어(어절이라고도 함)에서 단어를 구성하고 있는 형태소들을 인식하여 각 형태소에 대한 품사를 부여한다. 형태소는 '의미가 있는 최소 단위' 로 명사, 동사, 부사 등 전자 사전에서 제공되는 어휘를 형태소로 인식한다. "철수가 학교에 갔다."에 대한 형태소 분석의 예는 다음과 같다.

철수명사 + 가조사  학교명사 + 에조사  가동사 + ㅆ선어말어미 + 다어말어미.마침표

형태소 분석 결과는 품사의 세분화 정도에 따라 다를 수 있다. 예를 들어, 위 예제 문장에 대한 형태소 분석 결과에서 '가다' 의 품사는 동사로 부여되어 있으나 동사의 유형을 자동사, 타동사, 보조동사 등으로 세분화하면 '가다' 에 대하여 두 가지 이상의 품사가 부여될 수 있다. '가다' 와 같이 형태소 분석 결과가 두 가지 이상으로 나타나는 단어를 어휘 모호성 (lexical ambiguity) 이 있다고 하며 이는 어휘의 품사 모호성 때문에 발생한다. 또한 '감기는' 이 '감기명사 + 는조사', '감기동사 + 는어말어미', '감동사 + 기명사화접미사 + 는조사' 등으로 분석되는 경우도 있는데 이를 단어의 구조적 모호성 (structural ambiguity) 이라 한다.
형태소 분석은 문장을 구성하는 요소인 각 단어에 대한 분석이고 구문 분석은 형태소 분석 결과를 이용하여 주어진 구문 규칙 (syntactic rules) 에 따라 문장의 구조를 분석한다. 문장의 구조는 단어와 단어간에 수식 관계를 파악하고, 몇 개의 단어가 모여서 구 (phrase) 를 이루며, 구가 모여서 하나의 문장을 구성하는 구문구조 (syntactic structure) 를 규명한다. 한국어 구문분석에서는 입력 문장이 한국어의 구문 구조에 적합한지를 검사하고 그 문장의 구조를 목구조 (tree stucture) 형태로 출력한다. 한국어 구문 분석 결과의 예는 다음과 같다.

[[철수명사 + 가조사]NP    [[학교명사 + 에조사]NP    [가동사 + ㅆ선어말어미 +다어말어미]VP]VP [.마침표]]SENT

구문 분석 결과는 문장의 구조가 옳은지를 검사할 뿐이며 의미 관계는 고려되지 않는다. 따라서 한 문장에 대해서 구문 분석을 했을 때 구문 규칙에 맞는 분석 결과가 두 가지 이상 출력되기도 하며 심지어는 수백 가지의 결과가 생성되는 경우도 있다. 이로 인하여 영한 기계 번역에서 'Time flies like an arrow' 가 '시간 파리가 화살을 좋아한다.' 라고 번역이 되기도 한다. 그 이유는 'Time flies' 를 명사구로, 'like' 를 타동사로 분석이 가능한 모호성이 있기 때문이다. 구문 분석 단계에서는 구문 구조에 맞지 않은 일부 어휘 모호성 및 단어의 구조적 모호성이 제거되지만 여전히 모호성이 남아 있는 경우가 많으며, 이는 구절 단위의 구조적 모호성 혹은 의미 모호성 (semantic ambiguity) 을 유발하기도 한다.
'Time flies like an arrow' 는 어휘 모호성으로 인하여 구조적 모호성이 발생하는 예이다. 그러나 어휘 모호성이나 단어의 구조적 모호성이 없더라도 수식관계에 의해 구조적 모호성이 발생하는 경우가 많다. 예를 들어, '아름다운 꽃과 책을 샀다.' 라는 문장은 형태소 분석단계에서 모호성이 발생하지 않지만 '아름다운' 이 '꽃' 을 수식하거나 '꽃과 책' 을 수식하는 것이 모두 구문규칙에 어긋나지 않으므로 두 가지 수식관계를 각각 구문분석 결과로 출력하게 된다. 실험 결과에 의하면 구조적 모호성으로 인하여 한 문장에 대해 수백 개 혹은 수천 개의 분석 결과를 생성하는 경우도 자주 발생한다.
구문분석 단계에서 발생하는 모호성은 주로 문장내 단어간의 의미관계를 고려하지 않았기 때문에 발생하는 것으로 대부분의 모호성은 의미 분석 과정에서 해결이 가능하다. 의미 분석에서는 '꽃이 아름답다' 는 옳지만 '책이 아름답다' 라고 하지 않는 것과 같은 의미 정보를 이용하여 어휘나 구절의 의미 관계를 파악한다. 의미 정보를 기술하기 위하여 각 어휘에 의미 표지 (semantic marker) 를 부여하고 이를 사전으로 구축하여 사용하기도 한다. 그러나 모든 의미 정보를 사전으로 구축하기가 매우 어려우며, 어떤 경우에는 전문분야에 따라 어휘의 의미가 달라지는 경우도 있다. 따라서 의미 분석은 특수한 분야에서 부분적으로만 활용되고 있다.
구문 분석과 의미 분석은 한 문장에 대한 분석이며 자연언어 처리 시스템에서 그 결과만으로도 활용가치가 매우 높다. 그런데 자연언어 이해 시스템과 같이 문단 혹은 문서의 내용을 이해해야 하는 경우에는 의미분석만으로 부족한 경우도 있다. 즉, 의미분석이 되었다고 하더라도 문장과 문장 사이의 관계는 규명되지 않으며, 대명사를 이용하여 앞 문장에서 언급한 사람을 지칭하였을 때 그 대명사가 누구를 가리키는 지를 알아내는 대용어 문제 (anaphora resolution problem) 와 같이 문장들 사이의 관계를 파악해야 하는 문제가 발생한다.
문장과 문장 사이의 분석인 담화 분석은 각 문장에서 표출된 의미뿐만 아니라 그 문장이 기술된 시간 혹은 시대 상황이나 장소 등 배경 지식 (background knowledge) 이 있어야 하며 이러한 지식을 컴퓨터에서 사용할 수 있도록 구체적으로 기술하기는 거의 불가능하다. 그러나 음식점에서 차림표를 보고 음식을 주문하여 식사를 하고 값을 치르는 과정과 같이 특정한 주제에 대한 배경 지식을 구성할 수는 있으며 그 응용 분야는 매우 제한적이다.
한국어 생성은 영한 기계 번역에서 한국어 문장을 생성하는 일, 혹은 한글 문서의 내용을 요약하여 그 결과를 문장으로 생성하는 등 내부구조로 표현된 문장구조를 한국어 문장으로 생성하는 분야이다. 한국어 분석에서와 유사하게 한국어 생성은 하나의 문장구조가 여러 가지 표현으로 생성될 수 있다. 한국어 생성 시스템을 응용하면 문서를 작성할 때 문서의 주제만 개략적으로 입력하면 다양한 문장을 생성하는 작문 보조 기능이나 입력된 문장에 대하여 여러 가지 다양한 표현의 문장을 생성하는 데 활용이 가능하다.
이와 같이 한글공학은 한국어 문장을 분석해야 하는 응용 시스템과 분석된 문장 구조로부터 한국어 문장을 생성하는 기반 기술에 관한 연구를 중심으로 발전하고 있다. 그러나 한국어 정보처리를 위한 기반 기술 외에도 한국어와 타 언어 사이에 언어의 특성과 관련된 문제, 음성 인식이나 음성 합성 문제 등 한국어와 관련된 여러 문제를 포괄적으로 다루고 있다. 즉, 한글공학은 한국어 정보처리에 관한 다양한 응용분야에서 직접 혹은 간접적으로 활용될 수 있는 자료를 구축하는 국어 정보베이스와 한국어 분석이나 생성과 관련된 기반 기술이나 컴퓨터에서 한국어를 사용하는 데 관련된 여러 응용분야를 포함하는 매우 광범위한 시스템의 분야이다.

 

5. 미래의 S/W 에서 한글공학의 역할

소프트웨어 산업은 소프트웨어를 필요로 하는 사용자층의 요구와 더욱 편리한 소프트웨어의 개발로 수요를 창출하는 효과에 의해 발전되어 왔다. 그러나 운영체제와 문서편집기 등 일반 사용자들을 대상으로 하는 기존의 소프트웨어들은 발전 속도가 둔화되고 있으며, 새로운 수요 창출 효과에 의하여 정보통신 소프트웨어와 지리 정보 시스템과 같은 전문지식을 필요로 하는 분야에 대한 소프트웨어가 미래의 소프트웨어 산업을 이끌어갈 것으로 예상된다.
미래의 소프트웨어는 컴퓨터 네트워크와 멀티미디어 데이터베이스를 기반으로 하는 정보 통신 분야와 자연언어 인터페이스 등 첨단 정보과학 기술을 요구하는 방향으로 발전하고 있다. 이러한 추세에 따라 한국어 정보처리 기술은 응용 소프트웨어에서 차지하는 비중이 더욱 커지고 있으며, 한국어 정보처리 기술은 한글 관련 소프트웨어에서 핵심적인 역할을 할 것으로 기대된다.
"사람의 말을 알아듣고 명령대로 수행하는 로보트가 등장했다."
이러한 가정은 영화나 소설처럼 상상 속에서만 가능한 것은 아니다. 이미 사람의 말을 인식하는 컴퓨터와 장애인을 위한 음성 인식 자동차가 시제품으로 등장하였고, 가까운 미래에는 모든 사람이 지능을 가진 컴퓨터라는 멋있는 비서를 두게 될 가능성을 부인할 수 없다. 그러한 로보트 비서가 등장한다면 그 비서는 인간보다 훨씬 뛰어난 능력을 지니고 있으며 인간의 명령에 따라 궂은 일을 맡아서 충실하게 수행할 것이다.
이러한 꿈같은 얘기가 아니더라도 좀더 현실적으로 지금까지 스위치로 작동했던 기계들이 음성으로 작동할 수 있을 것이다. 'TV 를 채널 9번으로 돌려', '방안 온도를 20도로 유지해', '이 시각 현재 주식 시세가 어떻게 되지?' 등 컴퓨터에게 명령을 내리거나 컴퓨터와 대화가 가능한 시대가 현실화될 것이다. TV 에서 보고 싶은 영화를 녹화할 때 리모콘의 버튼을 이리저리 누르다가 잘못 누르면 처음부터 다시 해야 하는 짜증나는 일과 CD 에 수록된 가요를 순서를 바꿔 테이프에 녹음하려면 사용설명서를 보면서 처리해야 하는 번거로운 작업은 한국어 정보처리 시스템이 보편화되면 대화식 인터페이스로 가능하지 않을까?
이러한 미래의 컴퓨터 환경은 한글공학의 토대 위에서 가능하다.

 

*『여성정보인 협회지』, 96년 7월호