자연언어처리의 역사

 

자연 언어 처리 : 김영택.권혁철.옥철영.서영훈.이상조.윤덕호.강승식.이호석.윤성 희.이하규.심광섭 공저, 교학사, 1994, page 21~38

 

 

 1. 자연언어처리 시스템

     (1) 초기 시스템 : SAD-SAM    BASEBALL    STUDENT    ELIZA

     (2) 70 연대에 개발된 시스템 : LUNAR     SHRDLU    MARGIE, SAM 그리고 PAM

     (3) 80 연대 이후의 시스템과 연구 방향

2. 기계 번역

     (1) 개략적인 역사

     (2) 초기 시스템 :  GAT    CETA    TAUM

     (3) 70 연대와 80 연대에 개발된 시스템 : SYSTRAN  METAO  METAL  GETA   EUROTRA     일본의 연구

 

 

컴퓨터에 의한 자연언어처리는 컴퓨터가 도입된 직후인 1940 연대에 시작되었다. 초기에는 컴퓨터의 부호 (symbol) 처리 능력을 이용하여 단어의 사용 빈도 조사, 특정 단어가 있는 문장의 추출 등에 컴퓨터를 이용할 수 있을 것이라고 제안했다. 초기에는 이중어 사전 (bilingual dictionary) 을 참조하면서, 어순을 조정하면 기계번역이 충분하리라 보았다.

그러나 곧 이와같은 단순한 접근의 한계를 느끼고, 문장의 의미를 이해하려고 시도했다. 하지만 문장의 의미를 이해하기 위해서는 문장 구조, 단어 의미, 화자와 청자 모형, 대화 규칙, 상식과 응용 영역의 지식등이 요구되면, 따라서 인공지능 연구의 뒷받침 없이는 불가능한 것을 알게 되었다.

이에 따라서 경험적 지식 (heuristics) 을 이용하는 지식 중심의 시스템이 구현되었다. 최근에는 논리를 이용하는 등 보다 고도의 능력을 가진 시스템의 구현이 시도되고 있으며, 사례기반 분석 (example-based analysis) 과 같은 컴퓨터의 빠른 처리 속도와 대용량 자료의 기억 능력을 이용하는 기법도 도입되고 있다. 그리고 신경망과 같이 최근에 각광받고 있는 기법을 이용한 자연언어처리도 실험적으로 수행되고 있다.

본 장에서는 현재까지 개발된 자연언어처리 시스템을 살펴보고, 자연언어처리의 연구 방향에 대한 기존 시스템의 분석을 바탕으로 설명하고자 한다.

1. 자연언어처리 시스템

본 절에서는 기계번역을 제외한 자연언어처리 시스템에 대해 살펴보기로 하자. 기계번역에 대해서는 뒤의 2 절에서도 별도로 다루기로 한다.

(1) 초기 시스템

SAD-SAM (Syntactic Appraiser and Diagrammer-Semantic Analyzing Machine) 은 1963 년 Robert Lindsay 에 의해 개발된 시스템으로, 가족 관계에 대한 영어 문장을 분석하는 데이터베이스를 만들고 질의에 응답하는 시스템이다. 문맥자유 문법을 이용하여 문법을 이용하여 문장을 분석하였으며, 간단한 추론도 수행하였다. 그러나 중의성이 있는 문장을 분석할 수 없었고, 추론에도 한계가 있었다. 하지만 자연언어 이해에 대한 가능성을 충분히 보여준 시스템이다.

1960 연대 초에 Bert Green 에 의해 개발된 시스템이다. BASEBALL 은 정보검색 (information retrieval) 시스템으로, 미국 프로야구 경기의 모든 자료가 들어있는 데이터베이스를 자연언어로 검색하는 목적에서 개발되었다. 분석 가능한 자연언어 문장은 매우 제한된 단문 뿐이었다. 통사적 중의성 (ambiguity) 을 경험적 지식 (heuristics) 을 이용하여 해결함으로써 데이터베이스의 내용에 관계된 대부분의 영어 질의에 대답할 수 있게 한 특징이 있었다. 입력 문장의 분석이 불가능할 경우에는 사용자가 문장을 다른 형태로 바꾸도록 요구했다.

1968 년 Daniel Bobrow 에 의해 MIT 에서 박사학위 논문으로 개발된 시스템이다. STUDENT 는 고등학교 수준의 대수학에 관한 문장을 읽고, 푸는 프로그램이다. 이 시스템은 패턴 비교 (pattern matching) 에 의해 문장을 분석하는 방법을 이용했다. 패턴 비교에 의한 분석 기법은 패턴의 빈 자리 (slot) 에 필요한 요소들을 끼워넣는 방법으로서, 언어학적인 측면에서 보통 통사 분석 과정이 없는 시스템으로 판단될 수 있다. STUDENT 는 문장 분석이 실패했을 경우에 숙어를 확장하거나, 비슷한 말, 혹은 1 피트 대신에 16 인치를 추가해보는 등의 경험적 지식을 이용하여 분석을 시도한다. 모든 경험적 규칙이 실패하면, 사용자에게 추가의 정보를 요청한다. STUDENT 는 단순한 패턴 비교와 소수의 경험적 규칙만으로도 문장의 분석이 가능하다는 것을 보여주었다.

ELIZA 는 패턴 비교에 의한 자연언어처리 시스템으로는 가장 유명한 것으로, Joseph Weizenbaum 에 의해 MIT 에서 1966 년에 개발되었다. ELIZA 는 튜링 검증 (Turing Test) 이 기계가 지적 능력을 가지고 있음을 검증하는 방법으로 부적합함을 보여주는 예로 자주 거론된다.

튜링 검증이란, 사람과 기계가 연결된 두 터미널 앞에 앉은 사람이 대화를 한 연후에 어느 쪽이 사람이 연결된 터미널이고, 어느 쪽이 기계가 연결된 터미널인지를 판단할 수 없다면 기계가 지능이 있다고 판단하는 방법이다.

그런데 ELIZA 는 매우 현실감있게 인간과 대화할 수 있음에도 불구하고, 문장을 분석하는 방법은 단순한 패턴 비교를 이용하고 있을 뿐이다. 예를들어서 문장 속에 "어머니" 가 나오면 "너의 어머니에 대해 말해보라" 라고 요구하고, "나는 머리가 아프다" 와 같은 유형의 문장에 대해서는 "왜 너는 머리가 아프니? " 라고 묻는 방법을 취한다. 그리고 ELIZA 프로그램에 없는 패턴에 대해서는 "계속해봐", "재미있군" 혹은 "알겠네" 등의 문장을 적절히 배합하여 출력한다.

물론 ELIZA 와 같은 프로그램이 지적 능력이 있는 것인지 아닌지에 대해서는 논란의 여지가 있다. 따라서 미국에서는 1990 년 이후 인간을 가장 완벽히 속일 수 있는 ELIZA 프로그램을 개발하는 경시 대회가 매년 개최되고 있으며, 우승한 시스템에 대해서는 약 10 만 달러의 상금이 지급되고 있다.

(2) 70 연대에 개발된 시스템

60 연대에 개발된 시스템들은 고도의 통사 분석을 하지 않았다. 그러나 70 연대에 들어오면서 높은 수준의 통사 분석, 잘 정의된 어휘 지식과 대용량의 실세계 지식을 바탕으로 자연언어처리를 시도하게 되었다.

LUNAR 는 아폴로 11 호의 탐험 후 가져온 달의 돌과 흙에 대한 정보를, 지질학자들이 자연언어를 이용하여 검색할 수 있도록 하기위해 개발된 시험용 정보 검색 시스템이다. 이 연구의 목적은 자연언어에 의한 사용자 인터페이스의 가능성을 타진하는 것이었다. LUNAR 는 자연언어 문장을 질의어 (query language) 로 바꾸어 데이터베이스에 있는 정보를 검색했다.

LUNAR 는 3,500 어휘의 사전, ATN 문법에 의한 영어 통사 규칙, 데이터베이스 자료 검색 요청을 해석하기 위한 의미 규칙으로 구성된 언어 처리기를 가지고 있었다. 또한, 지질학자들이 습관적으로 사용하는 영어 문장의 유형, 데이터베이스의 내용을 접근하기 위해 사용하는 용어 등에 대한 정보도 LUNAR 가 가지고 있었다. 그러나, 응용 영역이 제한된 만큼 자연언어가 가진 복잡한 유형의 문장에 대한 분석은 회피하고 있다.

SHRDLU 는 Terry Winograd 가 MIT 에서 박사학위 논문으로 준비했던 시스템이다. 이 시스템은 언어를 이해하기 위해서는 통사, 의미와 추론 (inference) 이 복합적으로 적용되어야 한다는 가정에서 개발된 시스템이다. 이 시스템의 특징은 의미가 프로그램 속에 포함되어 있으며, 언어는 관련 프로그램을 작동시키는 역할을 구현한 것이다. 즉, 통사와 의미를 문법 규칙이나 패턴 비교에 의해 표현하는 대신에, Winograd 는 프로그램 코드에 내장된 지식으로 표현했다.

이와같은 접근은 SHRDLU 의 응용 영역을 고려하면 쉽게 이해될 수 있을 것이다. SHRDLU 는 책상 위에 블록이 있고, 로봇 팔이 이 블록을 자연언어에 의한 명령에 따라서 위치에 옮기는 것을 흉내낸 프로그램이다. SHRDLU 는 대화적 방법에 의해 명령을 수행하고, 책상 위의 상황을 설명할 수 있었다.

SHRDLU 는 블록 세계에 대한 실세계 모형과 이 모형에 적용되는 추론 규칙을 가지고 있었다. 문법은 각 통사적 단위 (unit) 의 특성, 기능과 다른 단위에 미치는 영향 등을 네트워크 (network) 로 표현하는 체계 문법 (systemic grammar) 을 사용했다. SHRDLU 는 언어 이해를 위해 인간의 언어처리 방법과 추론 방법을 결합한 모형을 사용했다는 측면에서 큰 발전을 이룩했다. 그러나 SHRDLU 의 성공은 언어적 처리보다는 추론의 사용에 있다는 것이 Wilks 의 비판이었다. 실제 SHRDLU 의 자연언어처리 능력은 매우 제한적이다.

MARGIE (Meaning Analysis, Response Generation, and Inference on English) 는 Roger Schank 에 의해 스탠포드 대학에서 1975 년에 개발된 시스템이며, SAM (Script Applier Mechanism) 과 PAM (Plan Applier Mechanism) 은 Schank 가 예일 대학에서 1970 연대 말에 개발한 시스템이다.

Schank 는 1973 년에 언어 의미를 표현하기 위해 개념 종속 (Conceptual Dependency Theory)) 이라는 것을 제안했다. 개념 종속 이론은 사용 언어와 관련없이 어떤 두 문장도 의미가 같다면, 개념 종속에 따르면 같이 표현되어야 한다는 것이다. 그의 개념 종속의 표현을 위해 의미소 (semantic primitives) 를 도입했다. 의미소의 예로는 다음과 같은 것이 있다.

Schank 는 의미 표현을 위해 11 개의 운동을 위한 의미소를 도입하였다. 그림 1 은 "철수가 영희에게 주었다" 라는 문장을 표현한 것이다.

그림 1  Schank 의 의미 표현의 예

여기서 "철수" 는 ATRANS 의 주체이며, ATRANS 의 대상은 "책" 이고, 변화된 내용은 "책" 과 "철수" 와의 관계가 "책" 과 "영희" 의 관계로 바뀌는 것이다. 이외에도 상태를 표현하기 위해 다음과 같은 표현을 사용했다.

위의 표현법에 따르면, 건강이 양수인 것은 건강 상태가 좋음을, 음수인 것은 나쁨을 의미하여, 예를들어 -5 인 것 보다는 -7 인 것이 더욱 아픈 것을 의미한다. 또한 -10 인 것은 건강 상태가 최악으로서 죽은 상태임을 의미한다.

MARGIE 는 영어 문장을 개념 종속 표현으로 바꾸는 개념 분석기, 분석된 개념 종속 표현으로부터 추가의 지식을 추론하는 추론기, 그리고 개념 종속 표현으로부터 문장을 생성하는 문장 생성기의 세 부분으로 되어 있었다.

특히, 추론기는 인간이 문장을 이해할 때 문장 자체가 전하는 정보 외에도 추가의 많은 정보를 획득한다는 가정에 기반하고 있다. 즉 "철수가 영희를 때렸다" 라는 문장에서 "철수가 영희에게 화가 났다", "영희가 철수를 때릴지도 모른다", "영희가 다쳤을 수도 있다" 등등 많은 추가의 추론이 가능할 것이다.

SAM 과 PAM 은 문장 단어 분석의 한계점을 극복하여 텍스트 (text) 단어의 분석하고자 하는 시도에서 연구되었다. Schank 는 이야기 (story) 를 해석하기 위해 스크립트 (script) 라는 개념을 도입하였다. 스크립트란, 인간의 행위에 대한 전형적 (stereotypical) 형태를 사건의 순서로 기술한다.

그림 2 는 식당 스크립트를 보여준다. 만약 "철수가 식당에 가서 설렁탕을 먹었다" 라는 문장이 있으면, 이 식당 스크립트에 의해 철수가 음식값을 지불했을 것이며, 음식을 주문했을 것이라는 등 많은 정보를 추론할 수 있을 것이다.

식당 스크립트

    참여자 : 손님, 종업원

    필요품 : 식당, 테이블, 메뉴, 음식, 계산, 계산서, 돈

    사건 :

      1. 손님이 식당에 들어간다.

      2. 손님이 테이블에 앉는다.

      3. 종업원이 메뉴를 가져온다.

      4. 손님이 음식을 주문한다.

      5. 종업원이 음식을 가져온다.

      6. 손님이 식사한다.

      7. 종업원이 계산서를 가져온다.

      8. 손님이 계산한다.

      9. 손님이 떠난다.

    시작 : 사건 : 1

    중요 개념 : 사건 : 6

그림 2  식당 스크립트

Schank 는 스크립트에 추가하여, 계획 (plan) 이라는 것을 도입했다. 계획이란 목적 (goal) 에 도달하기 위해 수행하는 행위 과정이다. 즉, "철수는 영화를 보고 싶었다. 그래서 그는 정류장으로 갔다" 라는 문장에서 철수의 목적은 영화를 보는 것이다. 그리고 이 목적을 달성하기 위한 계획의 일환으로 정류장으로 갔을 것이다. 따라서 "철수가 왜 정류장에 갔는가? " 라는 질문에 대한 대답은 "영화를 보기 위해서" 일 것이다. 자연언어 문장을 이해하기 위해서는 목적과 목적을 도달하기 위한 계획의 분석 없이는 불가능하다.

SAM 과 PAM 은 스크립트와 계획을 자연언어 이해에 활용하고자 하는 목적에서 개발된 시스템이다.

(3) 80 연대 이후의 시스템과 연구 방향

80 연대에 들어오면서 자연언어처리에 큰 변화가 일어났다. Winograd 와 Schank 의 접근이 실용적인 측면에서 한계가 있다는 것이 밝혀졌기 때문이다. 1982 년에 Schank 의 이론에 따라서 Dyer 에 의해 개발된 BORIS 시스템은, 이혼에 관한 텍스트를 읽고 상황을 판단하여 법률적 충고를 해 줄 수 있는 겉보기는 매우 가능성이 높은 시스템처럼 보였다. 그러나 아주 좁은 응용 분야의 처리를 위해 필요한 지식의 양을 고려할 경우에, 실용적인 수준으로 이 시스템을 확대하는 것이 불가능 한 것으로 판단되었다.

특히 80 연대 중반을 지나면서 인공지능 연구에 대한 반성이 일어나고, 이에 따라서 단순히 주어진 문제만 해결할수 있는 기술에서, 확장가능한 (scalable) 기술로 관심이 이동했다. 이에 따라 예일 대학을 중심으로 진행되었던 개별 언어와 독립적인 자연언어 분석 (interlingua) 의 기술 개발은 그 종말을 맞게 되었다.

한편, 확장 가능한 기술 개발의 시도로 일본과 유럽을 중심으로 도쿄 대학의 Nagao 교수에 의해 주도된 사례기반 분석은, 새로운 문장을 분석하기 위해서 이미 분석되어 저장되어 있는 자료를 참고하여, 가장 가까운 형태를 찾고 이에 따라서 문장을 분석하는 방법이다.

SRI (Stanford Research Institute) 에서는 Jerry Hobbs 에 의하여 불명추론 (Abduction) 을 이용한 자연언어 이해가 시도되고 있다. abduction 이란, 주어진 사실 'A 이면 B 이다' 와 'B 이다' 로부터 'A 이다' 를 추출하는 것으로서, 논리적으로는 틀린 추론 방법이다. 그러나 나무가 흔들리는 것을 보고 바람이 분다는 적을 아는 것은 abduction 의 예로서, 인간의 사고 방법으로 보면 매우 상식적이다. SRI 에서는 abduction 을 이용하여 테러 분야의 신문 기사를 분석하여 요약하는 시스템이 현재 개발되어 있었다. 그러나 분석 속도가 지나치게 느려서 조만간에 실용화되기는 어려울 것으로 판단된다.

1990 연대에 들어오면서 기존 자연언어처리 기법의 한계를 느끼고, 체계적으로 정리된 언어학 이론을 자연언어처리에 이용하려는 시도가 이루어지고 있다. LFG 를 이용한 제록스 (Xerox) 사의 연구나 HPSG 를 이용한 휴렛패커드 (HP) 사의 연구가 대표적 사례이다. 이같은 경향은 시간이 흐를수록 더욱 일반화 될 것이다.

카네기 멜론 대학 (CMU) 에서는 지식에 의한 문장 이해를 시도하고 있었다. 지식에 의한 문장 분석은 대용량의 지식과 정보의 처리가 요구되므로, 다중 처리에 의한 방법이나 컴퓨터 처리 속도의 비약적인 개선없이는 실용화가 어렵다. 그러나 현재의 컴퓨터 관련 기술의 발전을 고려하면 가까운 시일 내에 각광을 받을 가능성이 있다. 비슷한 접근이 MIT 에서도 진행되고 있으며, 신경망에 의해 자연언어를 이해하려는 연구도 진행되고 있다. 또 다른 접근으로는 사례기반 학습 (example-based learning) 을 이용한 자연언어처리 시스템이 개발되고 있다.

현재, 자연언어 이해에 대한 연구는 상당한 어려움을 겪고 있으며, 따라서 최근에 획기적인 연구 결과가 발표되지 않고 있다. 그러나 기존 기술만으로도 실용화된 자연언어 정보검색과 인터페이스가 발표되고 있다. 특히, 미국에서 최근에 발표되는 많은 시스템이 자연언어 인터페이스를 사용할수 있다고 선전되고 있다. 그리고 컴퓨터의 대중화에 따라서 엄청난 양의 정보가 축적되고 있으며, 이 정보를 검색하기 위해서는 자연언어 분석이 필수 불가결한 만큼 자연언어처리에 대한 연구가 더욱 확산될 것으로 기대된다.

2. 기계 번역

(1) 개략적인 역사

기계번역도 자연언어처리의 한 분야임에 틀림없다. 그러나 기계번역은 자연언어처리 분야 중에서 가장 많은 연구가 이루어졌으며, 기술적으로도 실용화에 가장 접근해 있으므로 다른 시스템들과 독립시켜 별도의 단원으로 다루기도 한다.

서로 다른 자연언어 사이의 번역에 기계를 이용하려는 시도는 컴퓨터가 탄생하기 전인 1930 년에 러시아의 Smirnov-Troyansky 와 프랑스의 Artsouni 에 의해 이미 고려되었다고 한다. 그러나 컴퓨터에 의한 기계번역은 1946 년에 Warren Weaver 와 Donald Booth 사이의 토론에서 역사가 시작되었다. 이 두 사람은 단어 빈도 측정을 위해 컴퓨터를 사용하고 있었으며, 같은 기술이 기계번역에도 이용될수 있을 것으로 생각했다. 그들이 생각했던 어려움은 번역을 위한 사전의 구성, 다수의 번역 가능한 단어로부터 적합한 언어의 선택, 어순의 조정, 숙어 처리 등이었다. 하지만 그들은 기계번역이 컴퓨터에 의해 충분히 가능하리라는 낙관적인 결론을 내렸다.

1947 년에 Booth 는 사전 탐색 프로그램을 구현하기 시작했으며, 1948 년에는 R.H. Richons 에 의해 어미 변환을 위한 규칙이 구현되었다. Erwin Reifer 는 전처리 (pre-edition) 와 후처리 (post-edition) 의 필요성을 제시했다. 전처리는 중의성과 같이 기계번역에 어려움을 주는 요소를 입력 문장에서 제거하는 것이고, 후처리는 번역 결과를 인간이 가다듬는 것이다.

A.G. Oettinger 는 러시아어-영어의 기계번역 시스템을 단어 대 단어를 대치하는 방법으로 구현했다. 특히 IBM 과 Georgetown 대학에서 러시아어를 영어로 변역할수 있는 시스템을 개발했다고 발표함으로써 기계번역은 큰 반향을 불러일으켰다.

그러나 초기 시스템의 번역 결과는 기대치에 크게 떨어졌으므로, 곧 기계번역에 대한 회의가 일어났다. 특히, 1966 년에 미국 연구재단에 제출된 ALPAC 보고서는 기계번역이 인간의 도움없이 번역하는 시스템을 의미한다면, 그와같은 시스템은 개발된 적도 없으며, 개발될 가능성도 미약하다는 결론을 내림으로써 기계번역은 큰 시련을 맞게 되었다. 이에 따라서 1973 년에는 미국 내에 3 개의 기계번역 프로젝트가 남았으며, 1975 년에는 더 이상의 기계번역에 관련된 프로젝트가 미국내에 없게 되었다.

1984 년에 이르러서는 미국 내에서만 50 만 페이지 이상의 문서가 기계에 의해 번역되고 있었으며, 80 연대 중반 이후에는 다수의 기업체들이 기계번역 시스템 개발에 뛰어들기 시작했다. 또한, 일본과 유럽 중심으로 정부의 집중적 지원하에 기계번역에 대한 연구가 진행됨으로써 기계번역 분야는 다시 활성화되기 시작했다.

(2) 초기 시스템

1952 년에 시작되어 1964 년에 완성된 시스템으로서 미국 정부의 지원으로 개발되었다. 소련어로 된 물리학 관련 문서를 영어로 번역하는 것을 목표로 하였으나, 인간에 비해 번역의 질이 매우 떨어졌다. 그러나 문서를 빠른 시간 내에 대충 살펴보는 목적으로는 충분히 사용이 가능했으며, 또한 다른 대체 수단이 없음으로 해서 1979 년까지 미국 원자 에너지국에서 사용되었다. GAT 는 언어학 이론을 전혀 사용하지 않았으며, 단어 대 단어의 번역에 약간의 숙어 처리를 하는 수준에서 번역을 수행하였다.

1961 년에 러시아어를 프랑스어로 번역하는 목적에서 프랑스의 Grenoble 대학에서 시작된 프로젝트이다. GAT 와 다르게 CETA 는 언어학 이론에서 출발하여 프로젝트가 진행되었다. 문장의 의존 구조 분석을 통해 번역을 시도했으며, 이론적 배경은 문법적 측면에서는 개별 언어와 독립적 표현 (interlingua) 을 추구하였고, 사전의 측면에서는 한 언어의 단어를 다른 언어의 단어로 대치하는 변환 방식을 취했다. CETA 는 1967 년에 완성되어 1971 년까지 사용되었다. CETA 는 IBM 의 어셈블리어로 프로그램이 되어 있었으므로, 1971 년 하드웨어의 교환에 따라 더 이상 사용할수 없게 되었다.

CETA 도 GAT 과 같이 물리학 분야를 번역의 대상으로 했다. CETA 의 연구진은 Interlingua 방식이, 문장이 가진 표면적 현상을 없앰으로써 오히려 번역의 질을 떨어뜨린다는 것을 발견하였다. 즉, 인도-유럽어들은 구조적으로 유상한 경우가 많으며, 이때에는 오히려 비슷한 패턴으로 바로 번역하는 것이 문장의 의미 분석 후 번역하는 것보다 효과적인 경우도 있다는 것을 알게 되었다. 변환 방식은 이와같은 문제를 해결할수 있지만, Interlingua 방식은 이 문제를 해결할수 없었던 것이다.

1965 년에 캐나다 정부의 지원으로 영어를 불어로 번역하는 시스템을 개발하기 위해 TAUM 프로젝트가 시작되었다. TAUM 은 순수한 변환 방식을 이용한 최초의 시스템으로써, 일기예보를 번역 대상으로 했다. 일기예보는 매우 제한된 어휘와 정형화된 문장을 사용하고 있어서 인간이 이 작업을 수행하는 것은 매우 따분한 것이었다. 따라서 평균 6 개월이면 번역사들은 이직했다. 따라서 영어와 불어를 동시에 사용하는 캐나다로서는 이 문제를 기계를 이용하여 해결하는 것이 바람직한 것으로 판단되었다.

TAUM 은 1976 년부터 사용되기 시작했으며, 가장 성공적인 기계번역 시스템의 하나로 인정받고 있다. TAUM 이 성공한 이유는 앞에서 말했듯이 일기예보의 번역은 창조성이 전혀 요구되지 않는 작업으로 인간에게는 부적합하지만, 반대로 문장에 중의성이 거의 없고, 사용되는 문장이 정형화되어 있으므로 기계적 처리에는 매우 적합했기 때문이다.

(3) 70 연대와 80 연대에 개발된 시스템

SYSTRAN 은 GAT 의 개발에 참여했던 Peter Toma 에 의해 개발된 시스템으로, 최초의 상품화된 기계번역 시스템이다. 1970 년 미국 연방 정부의 FTD (Foreign Technology Department) 에서 처음 사용되기 시작하여, 80 년대 후반까지 계속 사용되었다. 1974 년에슨 NASA 에 의해 아폴로-소유즈 공동 연구를 위한 문서 번역을 위해 선택되었으며, 초기 시스템은 러시아어-영어의 번역만 가능했다. 1982 년에 보고된 바에 의하면 FTD 시스템은 100 만개의 사전 항목 (entry) 을 가지고 있다고 한다. 1976 년에는 영어-불어의 번역이 가능한 시스템이 개발되어 유럽연합 (EU) 에 판매되었다. EU 의 구매 목적은 정보의 획득이 아니고, 정보의 배포에 있다. 1978 년에는 불어-영어, 1979 년에는 영어-이태리어의 번역이 가능한 시스템이 유럽 연합에 의해 구매되었다. 1985 년의 보고서에 의하면 유럽 연합에서 매달 1,000 여 페이지의 자료를 SYSTRAN 으로 변역하고 있다고 한다. SYSTRAN 은 번역 수준이 우수하지는 않지만 중요하지 않는 자료의 번역에 충분히 이용이 가능하다고 판단되어, 유럽연합은 1985 년에 불어-독어와 영어-독어 번역이 가능한 시스템을 주문했다. 이와같은 측면에서 SYSTRAN 은 상업적으로 성공한 기계번역 시스템의 하나로 평가받고 있다.

SYSTRAN 은 의미 표지 부여에 일관성이 없는 약점이 있다. 그리고 시스템의 사전 갱신에 제약이 많은데, 그 이유는 사전의 변화가 시스템의 성능에 큰 영향을 주기 때문이다.

TAUM 의 후속 시스템으로서 TAUM-METAO 라고도 불리운다. METAO 는 완전 자동번역 시스템으로서, 컴퓨터망을 통해 전송되어 오는 영어로 쓰여진 일기예보를 불어로 번역하여, 번역 결과를 되돌려 준다. METAO 는 SYSTRAN 과 다르게 시스템의 확장이 불가능하다.

METAO 는 하루에 2 만 4 천 단어, 일년에 8 백 5 십만 단어를 번역하며, 90~95 % 의 번역 성공률을 보인다. 번역이 불가능한 5 ~ 10 %는 사람이 직접 하지만, 번역이 성공한 문장에 대해서는 후처리 없이 바로 사용한다. 번역에 실패하는 5~10 %도 대부분 철자 오류나 사전에 단어가 없는 경우이다. METAO 는 15 분만에 하루치의 번역을 끝낸다. METAO 의 도입으로 얻은 가장 큰 성과는 캐나다 기상청에서 번역사의 평균 재임 기간이 6 개월에서 7~8 년으로 증가되었다는 것이다.

텍사스 대학에서 1982 년에 개발된 시스템으로, 독어-영어 양방향 기계번역을 위해 개발되었다. 독일어 분석은 변형이 가미된 문맥자유 문법에 기반하고 있으며, 영어 분석은 GPSG 를 이용하고 있다. 문장 분석과 변환이 완전히 분리되어 있어서 다중번역 (multilingual) 이 가능하다. 이에 따라서 독일어-중국어와 독일어-스페인어 시스템이 실험적으로 구현되기도 했다.

METAL 에서는 구조 변환과 어휘 변환이 같이 일어나며, 이 두 변환은 상호 영향을 준다. 그리고 문장의 분석이 불가능하면 문장 전체를 통괄하는 가장 긴 구절들로 문장을 나누어 분석하여 번역하므로, 번역이 안되는 경우는 없다. 언어학적 기반하에서 개발되었으며, 문장 편집, 데이터베이스 (사전과 문법 규칙) 관리 시스템, 규칙 검증 시스템 (사전과 문법 오류 검증) 과 사전 구성 시스템 등을 통합하여 개발하였다는 것이 METAL 의 특징이다.

Grenoble 대학의 기계번역 팀은 CETA 를 버린후, GETA (Groupe d'Etudes pour la tranducton Automatique) 를 만들었다. Interlingua 방식의 실패를 거울삼아, GETA 는 변환 방식을 채택하여 GETA 기계번역 시스템 (ARIANE-78) 을 개발하였다. 이 시스템은 문자열을 나무 구조로, 나무 구조를 나무 구조로 (변환), 나무 구조를 문자열로 바꾸는 세가지 프로그램으로 되어있다. ARIANE-78 은 그래프레 의한 문법을 사용했으며, 시스템 각 부분의 기능을 최대한 제약함으로써 시스템의 난이도가 높아지는 것을 방지하였다. 이에 따라서 시스템이 매우 제약되어 있으므로, 새로운 개념의 도입이 어려운 문제점이 있다.

EUROTRA 는 유럽 공동체의 지원으로 9 개 언어를 상호 번역이 가능한 시스템을 개발하려는 목적에서 시작되었다. EUROTRA 는 유럽 공동체의 다수 국가가 참여하는 프로젝트로서, 프로젝트를 총괄하는 기관은 없다. 이에 따라서 기계번역 시스템의 핵심 부분을 최소화하려는 방향에서 연구가 진행되었다. EUROTRA 는 증명된 기술만 이용하고, 새로운 기술은 사용하지 않기로 했다. 특히 시스템의 핵심 부분을 최소화하기 위한 변환부가 단순히 어휘 치환 정도의 기능만 하게 설계되어 있다. 그리고 의존 나무 구조 (dependency tree) 에 자질 (feature) 과 자질값 (value) 의 쌍을 추가하는 방법으로 의미를 표현하고 있다.

EUROTRA 는 1992 년에 1 단계 연구가 끝났으나, 개발된 시스템이 사용되고 있다는 보고는 아직 없다. 2 단계 연구 또한1993 년에 시작되기로 계획되었으나 구체적 연구 방향이 아직 발표된 적은 없다. 그러나 유럽 공동체의 예산 중에 많은 부분이 번역에 할애되고 있는 만큼, 조만작 EUROTRA 2 차 계획이 구체화될 것으로 판단된다.

일본은 기계번역에 대한 연구를 가장 많이 한 국가이다. 1964 년에 교토 대학의 Nagao 교수에 의해 시작된 일본의 기계번역은 후지쯔, 히다찌, 도시바와 NEC 들 기업체 중심으로 진행된 것이 특징이다. 현재까지 일본에서 개발된 기계번역 시스템은 약 20 개가 되며, 5,000 개의 기계번역 시스템이 판매되었다. 그러나 최근 조사에 의하면 극히 일부분만이 현재 사용되고 있는 것으로 열려져 있다. 일본의 기계번역 시스템은 영-일 과 일-영 을 중심으로 개발되었으며, 두 언어는 문법적으로 차이가 매우 큰 만큼 SYSTRAN 이나 EUROTRA 등에서 이용된 기술보다 고도의 기술을 이용하고 있다. 일본의 기계번역 시스템들은 상당한 수준에서 의미 분석을 수행하며, 시스템의 구조도 복잡하다.

90 년대에 들어오면서 지식 기반 기계번역, 사례기반 기계번역, 말뭉치 기반 기계번역과 통계적 방법에 의한 기계번역이 시도되고 있다. 일본에서는 기계번역을 장기적 계획에 따라 정부, 기업체와 대학교가 유기적 관계를 가지고 진행하고 있다. 특히 1980 년에는 기계번역 시스템 연구를 위한 연합체 (JEIDA) 를 만들어서, 이 기관을 중심으로 기계번역과 자연언어처리 연구를 효율적으로 수행하고자 노력하고 있다.