언어의 정보화
한국어와 인공지능 : 고창수 편저, 태학사, 1999, Page 27~44
예로부터 우리 조상들은 인물을 등용할 때 기준으로
삼던 것으로 '신언서' 의 네 가지 조건을 들고 있다. 이 기준은 오늘날에도 적용될
수 있으나 현대에도 그대로 적용되는 것은 아니다. 과학 기술의 발달과 전문적 지식이
요구되는 정보화시대에는 '신언서' 보다 업무처리 능력이 더 중요시되는 경우가 많다.
특히, 위 기준에서 세번째 요건은 시대의 흐름에 따라 손글씨가 타자기로, 타자기가
다시 컴퓨터의 문서편집기 (wordprocessor) 로 발전하면서 변화가 가장 심하다. 문서를
손으로 작성하던 시대는 이미 지났고, 안내장이나 보고서 등 거의 모든 문서가 문서편집기에
의해 작성되고 있다. 컴퓨터는 문서 편집 기능 외에도 전자우편, 업무 보고 등 일상생활에서
필수적인 도구로서 자리잡고 있으며, '컴맹'을 탈출하기 위해 많은 노력을 기울이는
이유가 여기에 있다.
컴퓨터가 일상생활에서 필수적인 이유는 복잡한 수식이나
단순 반복적인 계산을 처리하던 컴퓨터의 기능이 문자형 자료처리 기능, 더 나아가
정보처리 (information processing) 기능으로 확대되어 정보처리 기계로서 활용되고
있기 때문이다. 초기의 컴퓨터에서는 수식 계산을 위한 보조 기능으로 문자열 입출력이
사용되었으나, 요즘에는 대부분의 컴퓨터가 문서작성과 전자우편 등 자료처리 또는
정보처리 기능으로 사용된다. 컴퓨터의 기능이 수치형 자료에서 정보처리 기능으로
발전하면서 언어처리 기능이 필요하게 되었고, 한글 사용자에게는 컴퓨터에서 한국어
처리 기능이 필수적으로 요구되고 있다.
언어의 사용 분야가 말과 글에 의한 의사소통으로부터
컴퓨터를 이용한 정보교환으로 발전하면서 컴퓨터 환경에서 언어를 사용하는 방법을
규격화할 필요성이 발생하였다. 그런데 컴퓨터에서 자연언어를 구현하려면 여러 가지
제약이 따르기 때문에 그 범위 내에서 언어의 구현 및 사용이 가능하도록 하는 데
여러 가지 어려움이 발생하기도 한다. 그러나 컴퓨터의 활용은 언어의 표준화에 기여하고
있을 뿐만 아니라 언어의 체계적인 분석과 연구에도 많은 도움이 되고 있다. 이와
같이 정보화사회가 진행되면서 컴퓨터의 활용이 보편화되는 새로운 언어 사용 환경의
요구에 따라 언어의 발전과정은 언어의 표준화, 언어 습관 등 확장성과 과학적-분석적
접근 방법에 관한 많은 변화를 가져오게 되었는데, 이를 언어의 정보화라고 한다.
언어는 의사소통과 정보교환을 위한 기본적인 수단이라는
본질적 기능을 수행하기 위하여 문화적, 지역적, 계층적으로 이질화 현상이 나타나지
않도록 맞춤법, 표기법, 발음법 등을 표준으로 정하고 있다. 표준어 규정은 언어
사용자의 언어습관을 반영하게 되는데, 사회적 환경이나 언론-출판 매체가 언어습관에
미치는 영향이 매우 크다. 이와 더불어 컴퓨터의 활용이 보편화되면서 컴퓨터에서
언어의 사용과 관련된 표준규격, 컴퓨터 통신 이용자의 언어습관 등 컴퓨터가 언어에
미치는 영향이 점차 커지고 있다. 그 예로는 컴퓨터 글쇠판에서 자모의 배치문제를
비롯하여 한글 코드의 표준화, 고어의 표기법, 통신상에서 사용되는 약어 등이다.
컴퓨터는
언어 정보화와 관련하여 글쇠판 배치나 코드와 같은 표준화문제 외에도 언어 이론과
문법체계의 발전에도 많은 기여를 하였다. 예전에는 언어이론이나 문법체계에
대한 연구를 수행하면서 어떤 문장이 비문인지를 판단하거나 문법 규칙을 발견할
때 주로 언어 사용자의 직관에 의존하는 방식을 취하였다. 이에 비해 컴퓨터에서
언어를 구현하는 방법론으로 등장한 전산언어학(computational linguistics) 과 뭉치언어학(corpus
linguistics) 은 언어 이론과 문법체계를 과학적-분석적으로 접근하여 언어의 과학화를
추구하고 있다. 문장의 진위를 판단할 때 단지 직관적 판단에만 의존하지 않고 문학작품이나
신문, 잡지 등 대량의 문장 데이터베이스를 구축함으로써 실제로 언어 사용자들이
그러한 표현을 사용하는지를 조사하여 중요한 자료로서 활용한다.
컴퓨터에서
언어의 사용 습관은 언어의 표기법에 영향을 미치는 경우도 있다. 독일어에서는 컴퓨터의
영향으로 'ä' 를 'ae' 로, 'β' 를 'ss' 로 사용하는 것이 일반화되었고, 최근에는
'β' 대신 'ss' 로 표기할 수 있도록 표기법 자체를 수정하였다. 특히, 컴퓨터 통신상에서
약어를 사용하는 일이 빈번하게 발생하거나 맞춤법을 무시하는 예가 늘어나고 있다.
영어에서는 O I C(Oh, I see), C U L(See you later), T N X(Thanks) 등과 같은 약어가
자주 사용되고 있으며, 국어에서는 주로 맞춤법을 무시하고 소리나는 대로 쓰는 경향이
통신 이용자들 사이에 확산되고 있다. 이러한 현상은 글쇠판을 누르는 횟수를 감소시키고
자기 의견을 상대방에게 빠른 속도로 전달하기 위한 사용의 편의성에 기인한다.
컴퓨터와 관련된 한글 정보화의 가장 기본적인
논점은 컴퓨터 글쇠판과 한글 코드의 표준화 문제로 대표된다. 표준화는 일반 사용자들이
어떤 문제와 관련하여 불편한 점을 없도록 하는 사용의 편의성에 대하여 대두되기
때문에 초기에는 필요에 따라 다양한 형태로 존재하다가 어느 정도 보편성이 확보되었을
때 표준화의 필요성이 발생한다. 컴퓨터 글쇠판이나 한글 코드와 같이 사용자가 생산자의
의도를 따를 수밖에 없는 것은 업체별 사용자에 따라 이질화 현상이 나타나다가 우위를
점한 업체 혹은 몇몇 업체간 공동 표준을 거쳐 산업체 표준으로 자리잡게 된다.
영어
코드의 표준화과정을 살펴보면 초기에는 컴퓨터 산업을 주도하고 있던 IBM 의 BCD
코드를 확장한 EBCDIC(Extended Binary Coded Decimal Interchange Code) 코드가
대형 컴퓨터에서 가장 보편적으로 사용되엇다. 그러나 미국 표준안으로 마련되어
ISO 에 제시된 ASCII(American Standard Code for Information Interchange) 코드가
소형 컴퓨터를 중심으로 전세계에 보급되어 현재 국제적으로 통용되고 있다. 이와
같이 표준안이 보편화되는 경우도 있으나 어떤 경우에는 표준안이 아닌 특정한 기업체
혹은 이해집단에서 사용하는 방식이 보편화되는 경우도 있다. 이를 사실상의 표준(de
facto standard) 이라 한다.
컴퓨터 글쇠판은 한글이나 영어의 예에서 나타나는
바와 같이 사용자들의 습성이 표준화에 우선하고 있다. 한글 글쇠판은 현재 2벌식으로
통용되고 있으나 일부에서는 3벌식 글쇠판을 사용하기도 한다. 영어의 경우에는 1874년부터
타자기에서 QWERTY 배열의 글쇠판이 보급되어 1966년에 미국 표준으로 사용되고 있다.
그러나 타자기에서 출발한 QWERTY 배열은 타자기와 컴퓨터 글쇠판의 차이점이 고려되지
않았기 때문에 각종 문제점이 지적되었다. 이러한 문제점을 해결하려는 연구 결과와
과학적인 근거에 기초하여 1982년에 Dvorak 글쇠판이 미국 표준 협회에 의해 대체
글쇠판으로 승인되었다. Dvorak 배열은 양손의 부담률과 교타율, 손가락 부담의 적절성,
손가락 이동의 효율성 등의 관점에서 QWERTY 배열보다 전반적으로 우수한 것으로
알려져 있다. 하지만 대다수의 사용자들이 아직도 QWERTY 배열의 글쇠판을 사용하고
있다.
한글 글쇠판의 경우에도 현재 통용되고 있는 것은 과학적인 연구 결과에
의해 도출된 적합한 글쇠판 배열 문제와 함께 남북한간의 공동표준 문제가 제기되고
있다. 최근에는 1994년부터 매년 개최되고 있는 '코리안 컴퓨터처리 국제 학술대회'에서
남북한 학자들이 공동 표준안을 제시하였으나 기존의 글쇠판을 대체하기까지는 많은
시간이 소요될 것으로 예상된다.
컴퓨터 글쇠판보다 더욱 심각한 문제는 한글
코드의 표준화이다. ASCII 코드가 1963년에 미국 표준으로 제정된 것에 비해 한글
코드는 오랫동안 컴퓨터 제조업체별로 각기 다른 코드가 사용되었다. 한글이 매우
과학적이라는 명성이 무색할 정도로 다양한 코드 구현 방식이 제안되었는데 N 바이트
방식, 3 바이트 방식, 2 바이트 조합형 방식, 2 바이트 완성형 방식이 대표적이다.
더욱이 각 제조업체마다 다른 코드를 채택하여 수십 가지의 한글 코드가 난립함으로써
호환성 문제가 매우 심각하였다.
N 바이트 한글 코드는 처음으로 사용된 방식으로
주로 대형 컴퓨터에서 단말기를 이용하여 한글을 구현하는 데 사용되었다. 한글 자모를
각각 영문자로 대응시키고 한글 데이터의 양끝에 한글 시작 코드(SI : Shift In)
와 한글 끝 코드(SO : Shift Out) 를 삽입하여 영문 데이터와 구별한다. 따라서 한글은
자음이나 모음을 표현할 때는 한 바이트로 표현되기도 하지만 열린 음절과 닫힌 음절의
문자수가 다르게 표현되는 가변 길이 방식을 취하고 있다.
'국어교육' → '^NAsAWfArWwA^O' (^N 은 SI, ^O
는 SO 문자)
'한글코드' → '^N^bDAzI[IGz^O'
N 바이트 한글 코드가 각 글자마다 길이가 달라져서
발생하는 문제점을 해결하기 위하여 3 바이트 코드가 제안되었다. 3 바이트 코드는
초성, 중성, 종성을 각각 1 바이트씩 할당하는데 중성이나 종성이 없는 글자를 위하여
채움 코드(fill code) 를 정의하고 있다. 따라서 모든 한글은 3 바이트로 표현되므로
한글의 구성원리와 부합되며 N 바이트 체계의 문제점이 해결된다. 그러나 N 바이트
체계와 마찬가지로 한글 시작, 한글 끝 코드를 사용해야 하고 평균적으로 N 바이트
체계보다 데이터의 길이가 약간 길어지는 단점이 있다.
2 바이트 조합형 코드는
2 바이트(=16바이트)를 사용하여 한 글자를 표현한다. 맨 왼쪽 비트(MSB : most significant
bit) 를 1 로 설정하여 한글임을 표시하고 초성, 중성, 종성을 순서대로 5 bit 씩
할당함으로써 한 글자를 구성한다. 이 방식은 초성, 중성, 종성에 5 비트로 코드를
부여함으로써 이를 이용하여 한 글자를 조합하는 한글의 특성을 가장 잘 반영하고
있다. 이 방식 가운데 특히 상용 조합형 한글 코드는 표준 완성형 한글 코드(KS C
5601-1987)가 보편화되기 전까지 개인용 컴퓨터에서 가장 많이 사용되었으며, 완성형
코드가 보편화된 현재에도 통신 이용자들을 중심으로 널리 사용되고 있다.
완성형
한글 코드는 가능한한 ASCII 문자와 겹치지 않도록 2 바이트씩 순서대로 한글 코드를
할당하는 방식이다. 즉, 이 방식에서는 초성, 중성, 종성으로 구성되는 한글의 원리를
무시하고 단지 각 글자마다 코드를 할당한다. 대표적인 완성형 한글 코드 방식으로
KS C 5601-1987 은 현대 국어에서 자주 사용되는 2,350 자를 '가'부터 '힝'까지(0xB0A1~0xC8FE)
2 바이트씩 코드를 부여하고 있다. KS C 5601-1987 한글 코드는 초성, 중성, 종성을
조합하여 음절을 구성하는 한글의 근본적인 성질을 무시하고 자주 사용되는 2,350
자에 대해서만 코드를 부여하고 있다. 따라서 '똠방각하'의 '똠'자와, '웤스테이션(workstation)'
의 '웤'자 등을 표현하지 못하기 때문에 한글 사용자들이 불편을 겪어야 하는 치명적인
단점을 내포하고 있다.
1974년에는 최초로 한글 코드에 대한 정부 표준안이 마련되었으나
그 효과를 거두지 못하였고, 1980년 중반부터 1990년대 초반까지 2 바이트 상용 조합형
코드가 가장 많이 사용되었다. 몇 차례에 걸쳐 제시된 한글 코드 표준안은 제조업체들의
이해관계를 극복하지 못하고 모두 외면당했다. 1987년에 제정된 KS C 5601-1987만이
1990년대 초반부터 보편화되기 시작하였는데 이는 정부 및 관계 기관에서 수주하는
모든 컴퓨터의 한글 코드를 표준안으로 채택하도록 강제성을 부여하였기 때문이다.
이러한
완성형 한글 코드의 문제점을 보완하기 위한 임시 방편으로 보조 코드를 제정하였지만,
이는 제조업체에 거의 반영하지 않고 있을 뿐 아니라 코드 부여 순서가 '가나다'
순이 아닌 점 등 여전히 많은 문제점을 안고 있다. 특히 인터넷과 정보검색이 보편화되어
자동 색인, 기계번역 등 한국어 정보처리 기술이 필수적으로 요구되는 상황에서 완성형
한글 코드는 그 자체에 자음과 모음의 특성이 나타나지 않는 치명적인 약점이 있다.
최근에는
각국에서 사용되고 있는 모든 문자를 단일화하려는 노력의 결과로 유니코드(unicode)
체계가 국제적인 표준으로 제시되었다. 그러나 유니코드(unicode) 는 아직 각국에서
개발하는 소프트웨어에서 반영되지 않고 있으며 ASCII 코드와 한글의 경우에는 KS
C 5601-1987 이 보편적으로 사용되고 있다.
국어의 정보화와 표준화는 컴퓨터
자판과 한글 코드 문제를 중심으로 논의되어 왔으나 남북한 언어의 표준화 및 컴퓨터에서
사용되는 사전 구축을 비롯한 한국어 정보처리(Korean language processing) 문제가
대두되고 있다. 특히, 남북한 언어의 이질화 현상은 맞춤법이나 발음뿐만 아니라
컴퓨터와 관련된 표준화 문제가 큰 걸림돌이 되고 있다.
일반적으로 '언어' 라고 하면 한국어, 영어 등 자연
발생적으로 생겨난 자연 언어(natural language) 를 지칭하는데, 언어에는 컴퓨터에서
사용되는 프로그래밍 언어와 로보트가 인식하는 언어 등 인위적으로 만들어진 언어(artificial
language) 도 있다. 과학기술이 발전하면서 인위적인 언어가 보편화되어 자연 언어와
인위적인 언어를 구체적으로 지칭하는 것이 일반화되고 있다. 자연어 처리(natural
language processing) 는 컴퓨터에서 자연 언어를 인식하여 분석하고 생성하는 작업을
일컫는다.
자연어 처리 기술은 컴퓨터를 편리하게 사용하는 소프트웨어를 개발하는
과정에서 철자 검사(spell check) 나 맞춤법 검사(grammar check) 기능, 영어를 한국어로
한국어를 영어로 번역해 주는 기계 번역(machine translation), 정보검색시에 필요한
자동 색인(automatic indexing), 자연어 이해 시스템(natural language understanding
system) 등 컴퓨터의 활용 범위가 확대되거나 자연어 인터페이스를 추가하는 데 필수적으로
요구되고 있다. 선진 외국에서는 오랜 기간 동안 자연어 처리 기술을 연구해 왔는데
최근에는 그 결과를 상품화하는데 성공하고 있다. 특히, IBM 과 Microsoft 사에서
개발 중인 차세대 운영체제에서는 음성 인식과 자연어 처리 기술을 활용하여 사람의
말을 알아듣고 실행 결과를 음성으로 출력하는 컴퓨터를 선보일 예정이다.
자연어
처리 기술의 가장 핵심적인 요소는 자연 언어의 분석 기술이다. 자연 언어 분석은
단계별로 형태소 분석(morphological analysis) 과 구문 분석(syntactic analysis),
그리고 의미 분석(semantic analysis) 으로 구분되며, 이를 뒷받침하는 기초 기술로
어휘 사전(lexicon) 과 시소러스(thesaurus), 어휘 데이터베이스 등이 필수적이다.
영어의 경우에 1950년대부터 자연어 처리 연구가 진행되어 현재 응용 소프트웨어와
시스템 소프트웨어에서 활용 단계에 와 있는데 비해, 한국어 정보처리 분야는 1980년대
초반부터 사전 구축과 형태소 분석 등 기초연구가 시작되었는데 영어와 한국어의
자연어 처리 기술 격차는 [표 1]과 같다.
[표 1] 영어와 한국어의 자연어 처리 기술 비교
|
|
영어 |
한국어 |
|
사전 및 기초연구 |
◎ |
○ |
|
형태소 분석 |
◎ |
◎ |
|
구문 분석 |
□ |
△ |
|
의미 분석 |
△ |
△ |
|
음성 인식 |
□ |
△ |
◎ : 응용 및 활용 단계 ○
: 연구 및 응용 단계
□ : 연구 및 부분적 응용 △
: 연구 단계
자연어 처리 기술의 활용면에서 한국어 정보처리 부분은 타 언어에 비해 크게 뒤떨어진 편은 아니다. 1992년에 워드프로세서에서 철자 검사 기능이 활용되기 시작하였고, 1994년부터 형태소 분석기를 정보검색 시스템에서 자동 색인 기능으로 사용하고 있으며, 1995년에는 영-한 기계번역 시스템이 상품화되었다. 그러나 형태소 분석이나 구문 분석의 바탕이 되는 국어 정보 데이터베이스로 전자 사전과 코퍼스(corpus) 구축, 시소러스, 용례 사전 등 통계적 정보에 대한 기초 기술의 미비로 한국어의 다양한 언어현상을 처리하는 데 많은 어려움이 있다. 따라서 실용적인 시스템을 구현할 때 체계적-분석적인 토대가 부족하여 연구개발자의 경험과 직관에 의존하는 경우가 많다. 즉 선진 외국의 수준에 비추어 볼 때 한국어 정보처리 기술은 분야별로 평균 5년 이상의 격차를 보이고 있다.
[표 2] 자연어 처리 기술의 활용면에서 기술 격차
|
|
영 어 |
한 국 어 |
|
기초연구 시작 |
50년대 초 |
80년대 초 |
|
철자 검사 |
70년대 말 |
90년대 초 |
|
문법 검사 |
80년대 중 |
? |
|
자동 색인 |
80년대 초 |
90년대 초 |
|
기계번역 |
80년대 중 |
90년대 중 |
한국어 정보처리 기술의 토대가 되는 어휘 정보와 형태소 분석, 구문 분석 등에서 필요한 정보는 사람이 사용하는 것이 아니라 컴퓨터가 사용하는 것이므로 기계적인 관점에서 과학적-분석적인 방식으로 재정립되어야 한다. 어휘사전의 예를 들면, 용도면에서 기존의 사전과 차이가 있다. 기존의 사전은 주로 단어의 의미를 파악하기 위한 목적으로 사용되는 데 비해 컴퓨터에서 어휘사전은 자연어 처리과정에서 단어나 문장의 구조를 인식하기 위한 목적으로 사용된다. 따라서 어휘사전을 구축할 때는 어휘수가 많은 것보다 자연어 처리의 대상이 되는 문서에서 자주 출현하는 어휘에 대한 정보가 필요하다. 즉 어휘의 출현 빈도나 여러 가지 의미 혹은 여러 가지 품사로 사용되는 어휘의 경우에 각각에 대한 사용 빈도 등이 자연어 처리시에 유용한 정보로서 가치가 있다.
그림 1 단어 구성 전이도
형태소 분석은 어휘 사전을 기반으로 단어를 구성하고
있는 형태소들을 분리하여 인식하는 것이므로 형태소 분석에 적합한 단어의 유형분류와
형태소간의 결합 정보가 필수적이다. 단어의 유형은 가능한 유형을 모두 수집하여야
하며, 각 유형을 인식하는 단어 구성 전이도를 작성하여야 한다. 한국어 형태소 분석시에
단어를 인식하기 위한 단어 구성 전이도는 그림 1과 같다. 그림 1의 단어 구성 전이도는
전이과정에 적용되는 선택 제약 관계가 명시되지 않았으며, 접두사와 복합명사를
반영하지 않고 있다. 즉 형태소 분석을 위한 단어 구성 전이도는 형태소를 구분하는
기준에 따라 다를 수 있으며 의미 해석을 위한 전이도와도 차이가 있다.
형태소
분석에서는 선어말어미의 종류와 불규칙 용언을 처리하는 관점 또한 의미 분석을
위한 것과는 다르다. 형태소 분석을 위한 선어말 어미의 판단기준은 어미와 결합이
자유로운 정도에 따라 대부분의 어미와 결합하는 '시/었/겠'만을 선어말어미로 간주한다.
'시/었/겠' 이외에 국어학에서 논의되고 있는 다른 선어말어미들은 특정 어말어미하고만
결합되며 규칙성을 발견하기 어렵기 때문에 어말어미의 일부로 간주된다. 어말어미로
간주된 것들은 필요에 따라 어미사전에 유형 정보를 수록함으로써 세부적인 분리가
가능하다.
불규칙 용언에서 '우' 불규칙은 '푸다'에만 해당되므로 불규칙이 아니라
예외 규전으로 처리된다. 그 이유는 '우' 불규칙 용언을 분석할 때 '푸다' 외의 용언은
'우' 불규칙일 가능성이 없으므로 분석 효율을 감소시키기 때문이다. 또한 어말어미
'아/어' 가 축약되는 것은 불규칙 현상으로 간주된다. 왜냐하면, '아/어' 축약 용언의
활용형은 'ㅂ' 불규칙 등 '아/어' 와 결합할 때 발생하는 불규칙 유형과 형태소 분리과정이
동일하기 때문이다. 즉 형태소 분석은 어휘사전을 참조하여 형태소를 인식하는 과정이므로
형태소 및 불규칙 유형의 분류 기준은 자동으로 형태소 분석이 가능한지를 가장 중요한
요소로 삼고 어휘사전으로 처리할 수 있는 것은 고려하지 않는다.
예뻐졌다
(VERB
"예쁘") + (EOMI "어") + (XVERB "지") +
(POMI "었") + (EOMI "다")
감기는
(NOUN
"감기") + (JOSA "는")
(VERB
"감기") + (EOMI "는")
(VERB
"감") + (EOMI "기") + (JOSA "는")
가는
(NOUN "가") + (JOSA "는")
(VERB "가") + (EOMI "는")
(VERB "갈") + (EOMI "는")
(VERB "가늘") + (EOMI "ㄴ")
그림 2 한국어 형태소 분석의 예
그림 2는 형태소 분석의 예를 보이고 있는데 단어의 모호성에 따라 분석결과가 2가지 이상으로 출력되기도 한다. 모호성은 품사 모호성, 어휘 모호성, 구조적 모호성, 의미 모호성이 있는데 모호성 해결은 구문분석이나 의미 분석 단계에서 처리되어야 한다. 형태소 분석의 대상이 단어인데 비해 구문 분석의 대상은 문장에 대한 형태소 분석 결과이다. 구문 분석에서는 단어간의 수식 관계와 구(phrase), 절(clause) 을 인식하여 그 결과를 파스 트리(parse tree) 형태로 출력하여 입력 문장이 문법에 맞는지를 검사한다. 한 문장의 구문 분석 결과는 다시 의미 분석 단계를 거쳐 정확한 의미를 파악하게 되는데 구문 분석 기술은 부분적으로 활용하는 단계에 와 있지만 의미 분석 기술은 실제로 활용하기에 미흡한 수준이다.
한글 및 한국어의 정보화 문제는 초성과 중성,
종성을 조합하여 음절을 구성하는 과학적인 원리를 기반으로 하는 한글의 창제 원리와
무관하게 컴퓨터 환경에서 새롭게 정립되어야 하는 시점에 와 있다. 즉, 컴퓨터에서
한국어 정보처리 분야의 발전은 한글 및 한국어에 대한 더욱 구체적이고 분석적인
체계를 요구하고 있다. '사건'과 '효과'를 '사껀', '효꽈'가 아니라 표기대로 발음하는
것과 같이 인위적으로 변화를 시도하는 것은 옳다고 할 수 없지만, '가지다'의 준말
'갖다'의 용법으로 '갖다'는 옳지만 '갖어'를 옳다고 할 것인지, 그렇지 않은지를
명확하게 규정할 필요가 있다.
띄어쓰기와 관련된 것으로는 '학교에서였다', '하고싶다',
'고마워했다', '띄어쓰다'와 같이 일반적으로 많이 붙여쓰는 것은 씌어쓰기와 붙여쓰기를
모두 인정하든지, 그렇지 않으면 어떻게 쓰는 것이 옳은지를 충분히 계도하여야 한다.
또한 신문과 잡지는 '-는것-', '-ㄹ때-' 등 의존명사를 붙여쓰는 것을 일반화하고
있다. 언론 매체가 국민들의 언어 생활에 미치는 영향이 매우 크다는 것을 감안할
때 이 경우에도 붙여쓰는 것을 인정하든지 아니면 맞춤법에 어긋나게 사용하지 못하도록
해야 한다.
한글 코드와 관련하여 일부 학자들이 고어의 표기에 관한 문제를 제기하고
있다. 그런데 고어를 필요로 하는 사람은 극소수이며 대부분의 한글 사용자는 고어를
접할 일이 거의 없다. 따라서 고어의 표기 문제는 대다수 한글 사용자의 편의성을
해치지 않고 단지 고어를 표기할 수 있는 방향으로 해결되어야 한다. 이와 더불어
한국어 정보처리의 걸림돌이 되는 것으로 한자 사용의 문제가 있다. 한자를 옹호하는
사람은 한자를 사용하지 않을 경우에 단어의 뜻이 모호하다는 문제를 들고 있다.
그러나 한글뿐 아니라 어떤 언어를 보더라도 단어 자체만으로는 여러 가지 의미를
가지는 어휘가 매우 많으며 단어의 의미는 문장 내에서 어떻게 사용되느냐에 의하여
결정된다. 한자는 어휘 학습을 하는 교육과정에서 그 필요성이 인정되고 있으나 일상생활에서는
한글만 사용하더라도 문장의 의미가 분명하다. 특히, 한자를 사용하지 않음으로 인하여
의미가 불분명해지는 문장은 의미가 분명한 다른 표현으로 기술할 수 있다. 따라서
국민들의 언어 생활에 불편한 요소로 작용하고 있고 한국어 정보처리에 장애가 되는
한자의 사용은 삼가해야 한다.
한국어 분석 기술과 관련된 추진 방향으로는 우선
한글 문서에서 사용되는 대량의 단어와 문장들을 수집하여 분석하고 이를 바탕으로
하여 단어의 쓰임새와 사용 빈도, 다양한 언어 현상, 단어의 유형, 문장의 유형,
문장 기호의 용법, 문어체와 구어체 어휘의 분류 등을 체계적이고 과학적인 분석이
선행되어야 한다. 그 결과로 구축된 국어 정보 데이터베이스는 한국어 정보처리뿐만
아니라 맞춤법이나 문법 체계의 분석 등 국어학의 발전에도 크게 기여할 것이다.
그러나 국어 정보 데이터베이스에 대한 연구 작업이 선행되지 않으면 한국어 정보처리
기술은 현재와 같이 전산언어학자들의 경험과 직관에 의존할 수밖에 없으며, 음성
인식 기능과 기계번역 등 타 언어 사용자들이 누리는 편리한 컴퓨터 사용 환경을
기대하기가 어렵다.
*『사고와 표현』, 1997, 한성대 출판부