Machine Translation 이란 무엇인가?

 

기계번역 (Machine translation, MT) 는 인간의 간섭이 없이 컴퓨터 프로그램이 하나의 언어 (원시문서, source text) 로 구성된 문서를 분석하여 다른 언어 (대상문서, target text) 로 구성된 문서로 만드는 번역의 한 형태이다. 그러나 최근의 기계번역의 상황은 사전편집 (pre-editing) 과 사후편집 (post-editing) 과 같은 어느정도의 인간의 간섭을 포함한다. 기계번역에서는 인간번역자가 기계를 지원 (support) 한다는 것을 주목하자 (반대가 아니다).

오늘날 대부분의 기계번역 시스템은 소위 "요점 번역 (gisting translation)" 이라고 하여 원시문서의 요점 (gist) 을 제공하는 거친 (rough) 번역을 하며 그 외의 경우에는 사용할수 없다. 그러나 단어와 문장구조가 고도로 제한된 범위에 국한된 분야, 예를들면 기상 리포트 (weather reports) 같은 경우에, 기계번역은 유용한 결과를 낳을수 있다.

기계번역 (machine translation) 과 컴퓨터보조 번역 (computer-assisted translation)

두 개념은 유사하지만, 기계번역 (MT) 는 컴퓨터보조 번역 (computer-assisted translation (CAT) 또는 machine-assisted translation (MAT)) 와 혼동되어서는 안된다. 즉 기계번역에서는 인간 번역자가 기계를 지원한다. 즉 컴퓨터 또는 프로그램이 문서를 번역하면, 인간번역자가 편집 (edit) 한다. 반면에 컴퓨터보조 번역은 컴퓨터 프로그램이 인간번역자를 지원한다. 즉 인간이 스스로 문서를 번역하고 모든 기본적인 결정을 한다.

소개

번역과정은 스스로 번역하든 해석 (interpreting) 하든 다음과같이 간단히 표현할수 있다

  1. 원시문서의 의미를 해독 (decoding) 하고
  2. 대상언어에서 이 의미를 재암호화 (re-encoding) 한다.

이러한 인간의 간단한 번역과정 이면에는 복잡한 인지 동작이 숨어있다. 예를들면 원시문서의 의미를 해독하기 위해 인간번역자는 그 문서의 모든 특징 (feature) 을 해석하고 분석 (interpret and analyse) 해야한다. 이러한 과정은 화자 (speaker) 의 문화 (culture) 뿐만 아니라 원시언어의 문법 (grammar), 의미 (semantics), 구문 (syntax), 숙어 (idioms) 들을 깊이있게 알 필요가 있다. 인간번역자는 대상언어로 그 의미를 재암호화 하기위해 똑같은 깊이의 지식을 필요로 한다.

거기에 기계번역의 도전이 있다 : 인간이 하듯이 컴퓨터가 문서를 "이해" 하도록 하려면  어떻게 프로그램 할것이며, 마치 인간이 써왔던 것처럼 "발음" 되는 원시언어로 새로운 문서를 "창조" 하려면 어떻게 프로그램 할것인가?  이러한 문제는 많은 방법으로 시도될수 있다.

언어학적 접근방식

기계번역의 성공여부는 자연어이해 문제를 먼저 해결해야 한다는 주장이 있다. 그러나 기계번역은 많은 휴리스틱 방법들이 사용되는데 다음과 같은 것이다.

대개, 규칙기반 방법들 (처음의 세 개) 는 문서를 parse 해서, 보통 intermediary 를 생성하고, symbolic representation 로부터 대상언어의 문서를 생성한다. 이러한 방법들은 morphologic, syntactic, semantic information 를 가진 광범위한 lexicons 와 많은 규칙 (rules) 을 필요로 한다.

Statistical-based 와 example-based methods 은 manual lexicon building and rule-writing 을 피하고, 대신에 Canadian Hansard corpus, English-French record of the Canadian parliament 같은 bilingual text corpora 에 기초한 번역을 생성하려고 한다. 그러한 corpora 가 사용될때 유사한 종류의 문서를 번역하는 인상적인 결과를 얻을수 있지만, 그러한 corpora 는 매우 희귀하다.

충분한 데이타가 주어진다면, 대부분의 기계번역 프로그램들은 어떤 언어의 native speaker 가 다른 native speaker 가 쓴 문서의 근접한 의미를 충분히 얻을수 있을 정도로 작동한다 (즉 "요점번역" 을 한다). 그러나 특정 방법을 지원하기에 충분한 데이타를 얻는 것은 어려운 일이다. 예를들면 통계적 방법을 위해 필요한 데이타의 large multilingual corpus 는 grammar-based methods 에 반드시 필요한 것은 아니다. 그러나 grammar method 는 grammar 를 주의깊게 설계할수 있는 숙련된 언어학자가 필요하다.

사용자

기계번역의 한계에도 불구하고 세계의 여러 기관에서 사용되고 있다. 아마도 가장 큰 기관은 EU (European Commission) 일것이며 많은 양의 문서를 자동번역 하기위한 상업용 프로그램인 SYSTRAN 이 고도로 최적화되어 사용되고 있다.

Microsoft 사에서 2003 년에 hybrid 기계번역 시스템을 발표하였는데 그것은 English to Spanish 로 기술자료 데이타베이스를 번역하기 위해 내부적으로 사용되었다. 그 시스템은 Microsoft 의 Natural Language Research group 에서 개발되었다. 그 그룹에서는 English–French, English–German, English–Japanese 를 온라인으로 제공하는 시스템을 테스트 중이다. English–French 와 English–German 은 learned language generation component 를 사용하고, English to Spanish 와 English–Japanese 은 manually developed generation components 를 사용한다. 그 시스템들은 각각이 백만 문장이 넘는 translation memory databases 를 사용하여 개발되고 훈련되었다.

역사

기계번역의 최초의 시도는 세계 제 2차대전 이후에 수행되었다. 그때에는 새로 발명된 컴퓨터가 문서를 번역하는데 별 어려움이 없을 것이라고 예상하였다. 그것은 컴퓨터가 복잡한 수학을 빠르게 수행하고 사람들이 어려워하는 계산을 할수 있었기 때문에 그런것 같다. 한편으로 어린 아이들이 언어를 쉽게 이해하고 학습하므로 컴퓨터도 그럴것이라 생각했다. 실제로 그 믿음은 부정확했다는 것이 곧 드러났다.

1954 년에 기계번역 시스템의 최초의 공식적인 시연이 IBM 의 주관으로 뉴욕에서 개최되었다. 그것은 신문에 크게 보도되었고 대중의 관심을 끌었다. 그러나 그 시스템 자체는 오늘날의 장난감 수준에 머물렀던 것으로 단지 250 개의 단어를 가지고 49 개의 주의깊게 엄선된 러시아 화학분야 문장을 영어로 번역하였다. 그럼에도 불구하고 그것은 기계번역이 먼 이야기가 아니라는 것을 보여주었고, 특히 전 세계적으로 기계번역에 많은 재정투자를 하게되는 계기가 되었다.

최초의 중요한 기계번역 시스템들은 러시아 과학저널의 문서를 parse 하기위해 냉전 (cold war) 기간에 사용되었다. 비록 거친 번역이었지만 기사들의 "요점" 을 이해하기에는 충분하였다. 예들들어 어떤 기사가 보안문제에 대한 내용이었다면 그것은 완전한 번역을 위해 인간 번역가에게 보내졌고, 아니라면 폐기되었다.

20 세기 말엽의 저가의 고성능 컴퓨터의 출현과 인터넷 사이트에서 이용됨에 따라 기계번역은 대중들에게 가깝게 되었다.

그러나 이전의 기계번역 연구의 대부분은 translation memories 같은 컴퓨터보조 번역 (computer-assisted translation) 시스템의 개발에 편향되어 왔으며 실제로 더 성공적이었다.

예

다음은 위의 문장을 SYSTRAN 으로 기계번역한 것이다.

Korean

관련 용어

Free (epen source) software

external links

 ................................................................................................... (Wikipedia : Machine translation)