기초언어학이론
변형-생성문법의 이론 : Noam Chomsky, 이승환.이혜숙 공역, 범한서적주식회사, 1966 (원서 : Syntactic Structures,
Mouton & co, 1956), Page 24~32
1. 영어의 문법적 문장의 집합을 놓고 어떠한 종류의 방안이 이 집합을 만들어 내느냐 하는 문제를 생각해 보자(대등한 의미에서, 어떠한 종류의 이론이 이 언어표현집합의 구조에 대한 적절한 설명을 하느냐 하는 문제를 생각해야 한다). 우선 그 집합내에 있는 개개의 문장을 유한한 길이의 음운연결체로 생각할 수 있다. 물론 언어가 매우 복잡한 조직체라는 것을 간과해서는 안된다. 따라서 문법적인 음운연결체의 집합을 직접 표시하려는 시도는 여하한 것이라 할지라도 이것은 문법을 상당히 복잡하게 하며 실질적으로 사용가치가 없는 것이 되어 버린다. 여러 가지 이유가운데서도 이런 이유로 인하여 언어기술은 "표시의 계층(levels of representation)"에 따라서 전개되어야 한다. 즉, 문장의 음운조직을 직접 설명하는 대신 언어학자들은 형태소라는 "한 계층 높은" 요소(element)를 설정하여 놓고, 문장의 형태론적 구조와 형태소의 음운론적 구조를 분리하여 설명한다. 이렇게 두 단계로 이루어진 연합된 기술이 문장의 음운구조를 직접적으로 기술하는 것 보다 간결하다는 것을 쉽게 알 수 있다.
문장의 형태론적 구조를 기술하는 여러 가지 방법을 생각해 보자. 여기에서 문법적인 영어의 문장을 구성하는 형태소(또는 단어)의 연결체의 전부 그리고 그것만을ⓐ 생성하는데 필요한 문법은 어떤 것이냐 하는 것이 관심사가 된다.
문법은 확실히 유한이어야 한다는 것이 하나의 필요조건이다.ⓑ 따라서 문법은 단순히 모든 형태소 (또는 단어) 연결체의 목록(lest)이 되어서는 안된다. 이러한 연결체의 수는 무한이기 때문이다. 우리가 잘 아는 언어에 대한 한 통신이론의 모형(communication theoretic model) 이 위의 문제를 해결하여 준다. 우리에게 하나의 기계가 있다고 하자. 그 기계는 유한수의 내적상태 (internal state) 를 지니고 있으며, 이 기계가 하나의 상태에서 다른 상태로 전환할 때마다 하나의 어떤 기호(symbol) (영어의 단어라고 하자) 를 만든다고 하자. 이 상태 가운데의 하나가 "최초상태 (initial state)" 이고, 다른 또 하나는 "최종상태(final state)"이다. 그 기계가 최초상태에서 출발하여 몇 단계의 상태를 지나(매 상태마다 하나의 단어를 만들면서) 최종상태에 이른다고 하자. 이렇게 해서 이루어진 단어의 연결체를 "문장( sentence)" 이라고 부른다. 결과적으로 이러한 기계는 위에 설명한 양식으로 어???어를 규정하게 된다. 즉 위에 말한 양식으로 이루어질 수 있는 문장의 집합을 규정한다는 것이다. 그리고 이러한 종류의 기계가 만들어내는 언어를 "유한상태언어 (finite state language )" 라고 부르며, 그 기계 자체는 "유한상태문법(finite state grammar )"이라고 한다. 유한상태 문법을 "상태도표(state diagram)" 라는(주석 : C. E. Shannon and W. Weaver , The mathematical theory of Communication (Urbana, 1949), pp.15f.) 형식으로 도표화할 수 있다. 예를 들면, "the man comes"와 "the men come"이라는 두 문장만을 만드는 문법은 다음과 같은 상태도표로 표시할 수 있다.:
| (7) |
|
위의 문법 ⑺ 에다 폐환(closed loop)을 달므로써 무한수의 문장을 만들어 내는 문법으로 확장시킬 수 있다. 즉 영어의 일부인 위의 두 문장(the man comes와 the men come)과 다음의 문장들(the old man comes, the old old man comes, 등과 the old men come, the old old men come 등의 문장)을 포함시키는 유한상태문법은 다음과 같은 상태도표에 의하여 표시될 수 있다:
| (8) |
|
상태도표로 문장을 만드는 방법은 다음과 같다. 좌측에 있는 최초지점(initial point)으로부터 항상 화살표 방향을 따라 표시된 길을 추적하면서 우측에 있는 최종지점(final point)에 이르면 문장이 된다. 도표에서, 어느 한 점에 이르렀을 때는 그 점으로부터 어느 길을 택하여도 좋다. 만들고 있는 문장에서 이미 통과한 일이 있는 길일지라고 다시 통과할 수 있다. 결과적으로 이러한 도표에서 각 교점(node)은 상술한 기계의 "상태"에 해당한다. 하나의 상태에서 다른 상태로 전환할 때 몇가지의 선택의 여지를 줄 수 있으며, 기이와 수의 제한없이 폐환(closed loop)을 가질 수 있다. 이러한 방식으로 언어를 만드는 기계들을 수학적으로는 "유한상태의 Markov 과정(finite state Markov process)"이라고 한다. 언어에 관한 이러한 초보적인 통신이론의 모형을 좀 구체화하면 다음과 같다. 상태간의 매 전환에서 선택의 확율(개연성)을 책정하면 이것으로 각 상태에 해당하는 "불확실도(uncertainty)"를 산출할 수가 있고 언어의 "정보함유량(information content)"을 전체 상태가 갖는 확율로 측정된 불확실도의 평균치로 규정할 수 있게 된다. 본 연구가 언어의 통계학적 구조가 아닌 문법적 구조에 대한 것이기에 이러한 개괄론이 우리의 관심사가 되지는 않는다.
"유한상태의 Markov 정도"식의 언어에 대한 개념은 극히 강력하고 보편성있는 것이 된다. 이러한 개념을 택할 수 있다면 화자(speaker)를 본질적으로 상술한 형의 기계로 간주할 수 있다. 문장을 만들 때 화자는 최초상태(initial state)에서 시작하는데, 여기에서 문장의 첫 단어를 만들므로써 두 번째의 상태로 전환하며 둘째 단어를 선택하는 데서 제약을 받게 된다. 이러한 과정을 계속하면 문장이 이루어 진다. 각 상태를 통과할 때마다 화자는 언어표현의 그 지점에서, 다음에 오는 단어선택을 한정하는 문법적 제약(grammatical restriction)을 받는다(주석 : 이 방법론이 Hockett이 A manual of phonology (Baltimore, 1955), 02에서 전개한 언어모형에 대한 본질적인 견해이다.).
위에 말한 언어개념의 보편성과 그 개념의 통신이론과 같은 관련된 분야에서의 유용도를 생각해 볼 때 이러한 견해를 영어라는 언어의 통사론적연구나 수학의 형식화된 조직에 적용한 결과들을 조사해 보는 것이 중요하다. 말할 것도 없이, 영어에 대한 유한상태문법을 구성하려는 여하한 시도라 할지라도 시작부터 해결할 수 없는 난관과 복잡성에 직면하고 만다. 독자는 이 점을 쉽게 알 수 있게 된다. 이것을 구태어 실례를 들어 증명할 필요없이 다음과 같은 영어에 대한 좀더 보편성있는 견해를 가지고 보면 쉽게 수긍이 갈 것이다:
⑼ 영어는 유한상태언어가 아니다(English is not a finite state language).
환언하면 영어의 문법적 문장을 전부 그리고 그것만(all and only)을 만들어 내는 방안을 위에 설명한 형(⑺과 ⑻같은 도표)에 따라 구성한다는 것은 어려울 뿐만 아니라 "불가능"하다. ⑼의 사실을 입증하려면 영어의 통사론적 속성을 더욱 정밀하게 규정할 필요가 있다. 영어의 문장집합이라는 타당한 한계내에서 ⑼가 영어에 관한 정리(theorem)로 인정될 수 있음을 보이는 영어의 특종 통사론적 속성을 앞으로 기술하여 보겠다. §3의 둘째 항에서 제기되었던 문제를 돌이켜 볼 때, 문장의 형태론적 구조를 상태도표와 같은 방법으로 직접 기술할 수 없다는 것과, 요약해서 전술된 바 있는 Markov정도식의 언어에 대한 개념은 적어도 문법의 목적을 위하여서는 받아 드릴 수 없다는 것을 ⑼가 말하고 있다.
언어란 그 언어의 "자모(alphabet)"(예를 들어, 문장을 이루는 기호들의 유한집합)와 문법적 문장들로 규정된다. 영어라는 언어를 직접 생각하기 전에 a 와 b 라는 두 자모만으로 된 몇 가지 언어를 (10ⅰ―10ⅲ)에서 규정되는 대로 우선 연구해 보자:
⑽ (ⅰ) ab, aabb, aaabbb ,…, 일반적으로 a 가 n 번 일어나면 b 돠 n 번 뒤따라 일어나는 요소로 구성된 모든 문장과 그것만을 포함하는 언어;
(ⅱ) aa, bb, abba, aaaa, bbbb, aabbaa, abbbba , …, 일반적으로 X 라는 연결체와 X 의 '역상(mirror image)'(즉, X 를 전후 도치시킨것)이 뒤따르는 요소로 구성된 모든 문장과 그것만을 모함하는 언어;
(ⅲ) aa, bb, abab, baba, aaaa, bbbb, aabaab, abbabb , …, 일반적으로 a 와 b 들로 이루어진 연결체 X 와 그 와 꼭 같은 X 가 뒤따르는 요소로 구성된 모든 문장과 그것만을 포함하는 언어.
이 세 언어가 유한상태언어가 아니라는 것은 쉽게 알 수 있는 일이다. 마찬가지로, ⑽에 나온 언어들과 같이 a 와 b 들이 연속적(consecutive)이 아니고, 다른 연결체에 내포(embedded)되는ⓒ 경우들은 극히 일반적인 조건에(주석 : 여기에 언급된 "일반적 조건"에 대한 설명과 ⑼에 대한 증명은 필자의 "Three models for the description of language," I.R.E. Transactions on Information Theory, vol. IT-2, Proceedings of the Symposium on information theory, Sept., 1956을 참조하라. 특히, 잘 구성된(well-formed)공식들의 집합으로서의 수학이나 논리학의 형식화된 조직들은 괄호의 조건(paired parentheses) 또는 동류의 제약으로 인하여 유한상태언어가 될 수 없다는 것을 알아두기 바란다.) 비추어 보더라고 유한상태언어가 될 수 없다.
그런데 영어에도 (10ⅰ)과 (10ⅲ)의 기본형을 가진 부분(subpart)이 있음이 확실하다. 즉, S1, S2, S3 … 등을 영어의 평숙문 (declarative sentence)이라고 하면, 다음과 같은 영어의 문장들을 생각할 수 있다:
⑾ (ⅰ) If S1, then S2. (만일 S1이면 S2 이다)ⓓ
(ⅱ) Either S3, or S4. ( S3 이던가 S4 이다)ⓔ
(ⅲ) The man who said S5, is arriving today.( S5 라고 말한 사람이 오늘 도착한다)ⓕ
(11ⅰ)에서 "then"대신 "or"를 쓸 수 없고, (11ⅱ)에서 "or"대신 "then"을 쓸 수 없으며, (11ⅲ)에서 "is"대신 "are"를 쓸 수 없다. 각 문장에서 쉼표(comma) 양측의 단어들 사이에 종속관계(dependency)가 있다(즉, "if"와 "then", "either"와 "or", "man"과 "is"가 그것들이다). 그러나 위의 세 문장에서 종속관계가 있는 단어들 사이에 S1, S3, S5가 각각 들어간 것과 같이 평숙문을 삽입(insert)할 수가 있다. 그리고 (11ⅰ-ⅲ)의 문장들이 사실상 이렇게 삽입되는 문장으로 사용될 수가 있다는 것이다. 따라서 (11ⅰ)의 문장에서 S ₁대신 (11ⅱ)를 택하고, 이렇게 택하여진 (11ⅱ)의 S3 대신 (11ⅲ)를 사용하면 다음과 같은 문장을 형성하게 된다:
⑿ if, either(11ⅲ), or S4, then S2 (만일 (11ⅲ)이거나 S4 이면 S2 이다)ⓖ
또한 (11ⅲ)의 S5 도 다시 ⑾의 세 문장가운데 하나가 대신할 수 있다. 위의 사실로 미루어, 영어에서는 a 와 b 사이에 종속관계가 있는 연결체 a + S1 + b 에서 S1 대신에 c 와 d 사이에 종속관계가 있는 c + S2 + d 라는 다른 연결체를 선택할 수 있고, 나아가서는 S2 의 자리에 동류의 구조를 가진 다른 연결체를 삽입할 수 있다. 이러한 과정에 한계가 없다는 것도 알 수 있다. ⑾에 나타난 것이 이러한 가능성을 결코 망라한 것은 물론 아니지만 여기에서도 여러 가지의 가능성을 찾을 수가 있다. 중요한 점은 이러한 방법으로 문장들의 집합이 모두 (10ⅱ)에서 언급된 역상의 속성을 가지고 있으며, 이로 인하여 유한상태언어의 집합에서 (10ⅱ)가 제외된다는 것이다. 결과적으로 여러 종류의 비유한상태의 모형(non-finite state model)이 영어에 있다는 것을 알 수 있다. ⑾과 ⑿에 나타난 문장이 영어의 문장이며, ⑾에 예시된 종속관계를 파괴하는 문장(예를 들면 "either S1, then S2" 등) 은 영어가 아니라고 가정하면 ⑼가 엄밀하게 입증될 수 있다는 대체적인 방향을 이러한 사실들이 말해주고 있다. ⑿와 대등한 문형의 다수가 어감에 맞지 않고 이상한 것들이 있다. 상술한 구조의 본질을 바꾸지 않고, "if" 대신에 "whenever", "on the assumption that"등의 표현을 사용하면 이상한 느낌이 줄어들 때가 있다. 그러나 이것은 모두가 초보적인 영문법에서 거의 빠짐없이 나오는 아주 간단하고 기초적인 문장구조과정에 의하여 형성된 문법적인 문장이다. 이것들은 사람이 보통 이해할 수 있는 영어의 문장이며, 문법적인 문장이 된다는 조건을 아주 쉽게 논술할 수 있다. 이 문장들을 영어의 문법적인 문장의 집합에서 제외해야 한다는 어떠한 이유를 찾아낸다는 것은 거의 불가능하다. 종합적으로 Markov 과정형(Markov process model)등에 기반을 둔 언어구조에 대한 이론으로는 영어하는 사람이 새로운 언어표현을 만들고 이해하는 능력이 있고 반면 다른 연결체는 영어가 아니라고 배제할 수 있는 능력을 가지고 있다는 사실을 설명할 수 없다는 것이 분명한 것 같다.ⓗ
3. 논의의 대상이 되고 있는 영어의 문장형성과정은 n 라는 수로 고정된 요소에 n 회 이상 적용될 수 없다고 제한할 수도 있다. 물론 이렇게 되면, 예를 들어 영어의 하나의 문장은 백만개의 단어를 넘지 못한다는 식으로 언어를 유한상태언어로 만들게 된다. 그러나 이러한 임의적인 제한은 아무런 유용한 목적을 달성하지 못한다. 중요한 것은 유한상태문법으로는 근본적으로 다룰수 없는 문장형성과정들이 있다는 점이다. 문장형성과정에 제한이 없다면 본장의 주제인 "기초이론"이 실제적으로 적용성이 없다는 것을 입증하게 된다. 그러나 반면, 이 과정에 제한이 있다고 하면, 이 과정으로 문장의 목록을 만들 수 있으며 유한상태문법의 형성이 문자 그대로 불가능한 것은 아니다. 그러나 유한상태문법으로서의 문장의 목록이란 본질적으로 유용가치가 없는 것이며 문법자체가 매우 복잡한 것이 되기 때문에 관심거리가 되지 않는다. 일반적으로, 언어가 무한이라고 하는 가정은 언어의 기술을 간결화하기 위하여 세워진 것이다. 문법 내에 반복장치(recursive device)(⑻에 표시된 것과 같은 유한상태문법에서의 폐환을 말함)가 없게 되면, 그 문법은 걷잡을 수 없이 복잡하게 된다. 반면, 문법이 일종의 반복장치를 가지고 있으면, 그 문법은 무한수의 문장을 만들어 낸다.
다시 요약하면, 본장에서 제안된 바 있는 문장을 "좌측부터 우측으로" 만들어 가는 유한상태의 Markov과정에 의하여 문법성을 분석하는 방법은 §2에서 배격한 제안의 경우와 마찬가지로 막다른 길에 도달하고 만다. 이런 형의 문법이 영어의 모든 문장을 만든다고 하면 그 문법은 동시에 많은 수의 비문장(non-sentence)도 만들게 된다. 그 문법이 영어의 문장 그것만을 만든다고 하면 그 문법으로는 만들어지지 않는 많은 것 중에는 진문(true sentence)이나 가문(false sentence)이나 타당한 의문문(question) 등 다수의 문장들이 있을 것이 분명하다.ⓘ
한편 이렇게 배격한 문법개념도 신중히 고려할 가치가 있는 최소한도의 언어학이론(the minimal linguistic theory)을 보여 주고 있다. 유한상태문법이란 유한 장치를 가지고 무한수의 문장을 생성하는 가장 간결한 문법형이다. 이러한 제한된 언어학이론은 적절하지 않다는 것을 알았다. 따라서, 좀더 강력한 형의 문법과 좀더 '추상(abstract)'형의 언어학이론을 찾지 않을 수가 없다. 또한 본장의 첫 머리에서 언급되었던 "표현의 언어학적 계층(linguistic level of representation)"이라는 개념이 수정되고 구체화되어야 한다. 적어도 상술한 것과 같은 단결한 문법의 구조는 하나의 언어학적 계층만으로는 기술될 수가 없다. 환언하면, 하나의 특종계층만으로는 하나의 간단한 방안에 의하여 좌측부터 우측으로ⓙ 생성된 어떤 구성요소의 유한연속체(finite sequence)로써 각 문장을 간단히 표시할 수가 없다는 것이다. 하나의 특종계층만으로 문장을 표시한다고 하면, 유한집합의 계층에 의한 방법론을 포기해야만 한다. 즉. "위부터 아래로(from high to low)"라는 순서에 따른 계층을 설정해 놓고, 최상계층에서 허용된 연결체를 기술한 후에 그 계층의 구성요소는 차하위 계층의 요소에 의하여 기술하고 최후에는 밑에서 두 번째의 계층인 음운론적 구성을 기술하는 것인데. 이렇게 계층의 순서에 따라 문장을 생성하는 "계층의 유한집합"에 의한 방법론을 포기해야만 한다는 것이다.(주석 : 세번째의 가능성으로 생각할 수 있는 것은 다음과 같다. 즉, 간단한 모형방법(linear method)의 표시로써 언어학적 계층의 개념을 유지하는 한편 그 가운데 최소한 하나의 계층은 유한상태의 Markov과정보다 효율이 있는 방안에 의하여 좌측부터 우측으로 생성시키는 방법론을 생각할 수 있다. 그러나 좌측부터 우측으로라는 생성방법에 기반을 둔 언어학적 계층에 대한 개념의 기술상의 복잡성과 설명력(explanatory power)(§8을 참조하라)의 결핍이라는 여러 가지 난관 때문에 이 이상 여기에 노력을 들인다는 것은 무모한 일이다. 차후 본 책자에서 논제가 될 문법들은 좌측부터 우측으로라는 생성방법에 의한 것이 아니며. 유한상태의 Markov 과정보다 좀 진보된 것에 해당한다. 그러나 이것은 영어를 직접 좌측부터 우측으로 생성하는 방안보다 강력도가 약하다고 생각된다. 이것에 대한 좀 더 자세한 설명은 필자의 "Three models for the description of language"를 참조하라.). §3의 첫 머리에서 문법적 음운연결체에 대한 기술을 간결화하면 순서가 있는(ordered) 계층들을 설정해야 한다고 제안하였다. 예를 들면, 한 언어(만일 유한상태어어라면)를 좌측부터 우측으로라는 양식으로써 기초적인 단 하나의 계층으로 기술할 수 있다면, 순서를 가진 상위계층들을 설정함으로써 그 기술을 상당히 간결화할 수 있게 된다. 그러나 영어와 같은 비유한상태언어들을 생성하기 위하여는 근본적으로 다른 방법론과 좀더 보편성있는 언어학적 계층에 대한 개념이 필요하다.