음성 합성

 

음성언어 정보처리 : 오영환, 홍릉과학출판사, 1998, Page 211~216

 

1. 개요

  (1) 음성 합성이란?

  (2) 음성 합성의 응용 분야

2. 음성 신호 합성 기술

  (1) 인간의 조음 기관

  (2) 음성 합성 기술의 역사

 

 

1. 개요

  (1) 음성 합성이란?

음성 합성이란 기계적인 장치나 전자회로 또는 컴퓨터 모의를 이용하여 자동으로 음성 파형을 생성해내는 것으로 정의할 수 있다. 음성 합성에 대한 연구는 다른 음성에 관련 기술들보다 가장 먼저 연구된 기술이다. 초기의 음성 합성에 대한 연구는 대부분 기계적 또는 전자회로를 이용하여 인간의 발성기관을 모의하는 것이었다. 인간의 발성기관을 모델링하는 것은 아직까지도 음성 합성 연구에 궁극적인 목표로 남아있지만, 컴퓨터의 연산 속도 및 기억용량이 급속히 발전하면서 음성 합성에 대한 연구는 단순히 인간의 발성기관 모델링에 그치지 않고 문서처리 기술을 포함한 문서-음성 변환 기술로 확장되었다. 음성 합성에 의해 메시지를 전달하는 경우에 다음과 같은 이점이 있다.

음성 합성 기술은 실제 응용 방식에 따라 크게 두 가지로 구분될 수 있다. 제한된 어휘 개수와 구문구조의 문장만을 합성하는 제한 어휘 합성 또는 자동음성응답 시스템(ARS; Automatic Response System)과 임의의 문장을 입력받아 음성 합성하는 무제한 어휘 합성 또는 문서-음성 변환(TTS; Text-to-Speech) 시스템이 있다.

자동음성응답 시스템의 기본적인 구성은 음성 부호기 및 음성 부로기를 구동시키기 위한 파라미터열로 이루어져 있다. 합성하고자 하는 어휘들을 미리 분석하여 파라미터로 저장하였다가 이들의 조합으로 음성 부호기를 구동하여 음성을 합성하는 방법을 이용하므로 합성 대상 어휘가 제한되게 된다. 초기에는 저장가능한 기억장치에 제약이 있어서 음성 신호를 파라미터로 변환·압축하여 저장하므로 음성 부호기가 필수적이었으나, 근래에는 기억장치가 대용량화되어 음질면에서 우수한 부호화하지 않은 음성 신호를 그대로 저장하여 재생하고 있다. 주로 단어 또는 소문장 단위의 음편들을 연결하여 음성을 합성하는데 현재 지하철 안내방송, 각종 무인안내 시스템 등에 이용되고 있다. 이러한 방식은 구현이 용이하며 무제한 어휘 합성에 비하여 높은 음질을 얻을 수 있으나 음편들의 연결 부분이 부자연스러우며 합성 대상 어휘가 바뀔 때마다 다시 녹음, 분석하여야 하는 단점이 있다.

문서-음성 변환 시스템은 작은 합성 단위음성과 언어 처리를 이용하여 임의의 문장에 대한 음성을 생성한다. 언어 처리를 이용하여 입력된 문장을 적당한 합성 단위의 조합으로 대응시키고, 문장으로부터 적당한 억양과 지속시간을 추출하여 합성음의 운율을 결정한다. 언어의 기본 단위인 음소, 음절 등의 조합에 의해 음성을 합성해 내므로 합성 대상어휘에 제한이 없으며 주로 TTS(Text-to-Speech) 장치 및 CTS(Context-to-Speech) 장치 등에 적용된다. 그러나 음소, 음절 등의 연결시 상호 조음현상의 처리 및 자연스러운 운율 처리 등이 아직 미흡하여 현재까지는 제한 어휘합성 방법에 의하여 음질이 떨어지는 실정이다. 최근 대부분의 음성 합성에 관한 연구는 문서-음성 변환 시스템의 음질 향상에 중점을 두고 있다.

(2) 음성 합성의 응용 분야

음성 합성 기술의 응용은 고성능의 대형 시스템과 함께 DSP 칩의 개발로 응용분야가 다음과 같이 점차 확대되고 있다.

  ① 음성 출력
  미국 TI사의 Speak&Spell이 그 예로, 외국어 학습기기나 CAI(Computer Aided Instruction) 등에 활용되고 있으며 국내에서도 이러한 응용기기들이 선보이기 시작하고 있다.

  ② 자동차나 항공기의 정보 및 상황진단 시스템
  의미를 알 수 없는 경보음 대신 무엇이 위험한지 그 내용을 정확하게 음성으로 알려주어 신속한 조치를 할 수 있게 해주며 특히 복잡한 계기를 조작하는 조정자에게 이러한 음성 메시지는 효과가 크다.

  ③ 컴퓨터의 출력 단말
  디스플레이와 함께 시각과 청각으로 정보를 분담하여 편리하게 사용할 수 있도록 해준다.

  ④ 복잡한 기기의 사용, 조작순서 지시
  기기조작은 특별히 복잡하지 않더라도 일반인이 쉽게 사용할 수 있도록 하기 위해서는 음성안내가 효과적이다. 특히, 은행의 현금지급기, 자동판매기, 팩시밀리 등에 점차 그 활용이 확대되어 갈 추세이다.

  ⑤ 생산라인 작업순서 지시
  복잡한 배선이나 공정에서 작업자가 배전도나 지시도를 보면서 작업하는 대신 순서를 음성으로 지시하여 작업효율을 높일 수 있다.

  ⑥ 시각, 청각 장애자의 보조기기
  문자 인식기능과 결합하여 맹인을 위한 독서기가 가능해지며, OA, 전자출판 등에 문자로 입력된 문서를 기계가 읽게 하여 틀린 곳을 교정할 수 있게 함으로써 사무능률 향상에 이용될 수 있다. 

2. 음성 신호 합성 기술

본 절에서는 인간의 조음 기관과 음성 합성의 역사 및 현재 사용되고 있는 기술에 대하여 기술한다.

(1) 인간의 조음 기관

음성은 발성자의 대뇌에서 만들어진 언어 메시지가 정보원이 되어 조음 기관에 운동 신경 명령의 형태로 보내져서 최종적으로 음성파형이 생성된다. 폐에서 시작된 공기의 흐름은 성대(vocal cord)를 거쳐 음원(speech source)이 된다. 음원은 성대보다 위의 부위에 있는 음성 기관, 즉 성도(vocal tract)와 여러 가지 조음 기관들의 조음(articulation) 동작에 의해 결정되는 음향 전달 특성의 영향을 받아 음원의 주파수 성분이 선택적으로 공명함으로써 음성이 생성된다. 성도는 목구멍의 성대로부터 입술까지의 구강(oral cavity)과 콧구멍까지의 비강(nasal cavity)을 의미하며, 조음시 성도의 모양은 조음 기관인 연구개(velum), 턱, 혀, 입술 등에 의하여 변한다. 성도의 모양은 음원이 되는 여기 신호(excitation signal)에 대한 성도의 전달 함수를 결정한다.

이러한 전달 함수는 포만트(formant)라 알려진 여러 개의 공명과 반공명으로 이루어진다. 음성은 성도 필터의 공명과 반공명에 의해 생성된다. 여기 신호는 유성음(voiced speech)이 발성되는 동안의 성대의 떨림이나 무성음이 발성되는 동안의 성도에서의 제한에 의해 발생되는 잡음으로 이루어진다. 혹은 두 종류의 여기 신호가 동시에 생성되는 경우도 있다. 음성이 생성되는 동안에는 여기 신호나 조음 기관의 위치가 변하는데, 이러한 변화들은 발성하고자 하는 목표의 연속적인 목표의 연속적인 변화에 따라 이루어진다. 주어진 언어에서 발성하고자 하는 목표는 음소(phoneme) 또는 이음(allophone)이다.

음소는 언어학적인 음성의 단위이다. 즉, 같은 언어를 사용하는 사람들이 같은 조음 기관의 모양으로 발성하는 언어학적으로 같은 음을 뜻한다. 한국어의 경우, 하나의 자음이나 하나의 모음으로 이루어진 발성 단위가 음소이다. 이음은 언어학적으로는 구분되지 않지만 발성하는 사람에 의해 다르게 발성되는 음을 의미한다. 즉, '나는'이라는 단어를 발성할 때, '나'의 'ㄴ'과 '는'의 받침 'ㄴ'은 언어학적으로 같은 'ㄴ'이지만, 초성 'ㄴ'과 종성'ㄴ'은 서로 다른 특성을 나타내므로 이를 이음이라 한다.

(2) 음성 합성 기술의 역사

첫 번째 음성 합성은 18세기에 Wolfgang von Kempelen에 의해 시도되었다. 그의 합성기는 풀무에 의해 작동되는 기계였다. 이 기계는 고무로 만들어진 입과 콧구멍 그리고 성도의 변화를 흉내낼 수 있는 풀무로 만들어졌다. 이렇게 기계적인 방법으로 시작한 음성 합성 기술은 점차 전기적 분석 방법을 이용한 음성 합성으로 발전하였으며, 이후 컴퓨터에 기반한 방법으로 발전하였다.

전기적 분석 방법을 이용한 음성 합성기는 1930년대에 Dudley에 의해 처음 개발되었다. 그의 합성기는 "Voder"라고 불렀는데, 이는 채널 보코더(channel vocoder)에 기반을 두었으며, 피치 펄스와 잡음등의 여기 신호를 10개의 포텐셔미터(potentiometer)를 이용하여 합성음을 생성하였다. 포텐셔미터는 하나 또는 여러 개의 조정용 슬라이드 접점을 가진 저항기로서, 조절 가능한 전압 분배기의 기능을 하는 부품이다. Dudley의 음성 합성기는 이 포텐셔미터를 수동으로 조절하여 임의의 음성을 합성할 수 있도록 하였다. 이후, 전기적 방법을 이용한 음성을 합성할 수 있도록 하였다. 이후, 전기적 방법을 이용한 음성 합성에 관한 연구는 성도를 전기적으로 분석하는 방법과 채널이나 포만트 합성을 전기적으로 구현하는 방향으로 이루어져왔다.

최근에는 컴퓨터에 기반한 음성 합성 방식이 음성 합성 기술의 주류를 이루고 있다. 컴퓨터를 이용한 음성 합성은 크게, 인간의 조음 기관을 모델링한 시스템-모델 방식과 음성 신호를 모델링한 신호-모델 방식으로 나눌 수 있다. 시스템-모델 방식은 조음 합성이 대표적이며, 이는 인간의 조음 기관을 모델링하는 방법이다. 신호-모델 방식은 인간이 발성한 음성 신호를 모델링하는 방법으로서, 시스템-모델 방식보다 더 많이 연구되고 있으며, 성공적인 결과를 얻고 있다. 이러한 신호-모델 방식은 다시 규칙-기반 포만트 합성과 단위음 결합 합성 방식으로 나눌 수 있다. 포만트 합성기는 여기 신호를 성도의 포만트와 유사한 개수의 공명기로 만든 디지털 필터에 통과시켜 합성음을 생성한다. 이 방식에서 성도의 전달 함수와 여기 신호를 분리하는 것은 음성 생성의 음원-필터 이론에 기반한다.

단위음 결합 합성 방식은 합성하고자 하는 문장에 적합한 합성 단위들을 결합하여 합성음을 얻는 방식이다. 이 방식은 합성음에서 요구되는 지속시간과 기본 주파수를 합성단위음에 적용시킬 수 있어야 한다. 게다가 합성 단위의 선정과 단위음의 접합 부분에서의 보관 방법이 필요하다. 단위음 결합 합성에서의 신호 처리 방법으로는 선형예측 방법과 PSOLA 방식이 널리 이용된다. 선형 예측 방법은 음원-필터 모델에 기반을 둔 것이지만, PSOLA 방식은 합성 단위음 파형에 창함수를 씌우고 단순히 재구성함으로써 합성음을 생성하는 방식이다.