구절구성ⓐ
변형-생성문법의 이론 : Noam Chomsky, 이승환.이혜숙 공역, 범한서적주식회사, 1966 (원서 : Syntactic Structures, Mouton & co, 1956), Page 33~42
1. 관례적으로는, 통사론적 계층에서의 언어기술은 구성성분의 분석(constituent analysis)(어구해부ㆍparsing)에 의하여 이루어진다. 이러한 종류의 기술이 전제하는 문법형은 어떠한 것인가하는 문제에 관심을 가져야 한다. 앞으로 생각해 보려는 새로운 형의 문법은 위에서 배격한 바 있는 유한상태모형보다 본질적으로 더 강력하며, 여기에 따르는 "언어학적 계층"에 대한 개념도 여러 면에서 근본적인 차이가 있다는 것을 알 수 있다.
구성성분의 분석과 관련이 있는 새로운 문법형의 간단한 예로서 다음의 ⒀을 보자:
⒀ (ⅰ) Sentence → NP + VP
(ⅱ) NP → T + N
(ⅲ) VP → Verb + NP
(iv) T → the
(v) N → man, ball, etc .
(vi) Verb → hit, took, ent
⒀에 나오는 각각의 X → Y 의 규칙을 " X 를 Y 로 고쳐써라(rewrite X as Y )"로 해석한다고 하자. 그리고 ⒁를 "the man hit the ball"이라는 문장의 유도과정(derivation)이라고 부르기로 하자. ⒁의 각예의 우측에 표시된 수자는 그 예를 바로 전예에서 이끌어 내는데 사용된 ⒀이라는 "문법"에 나타난 번호를 가르킨다.(주석 : 앞으로 본 책자에서 계속적으로 언급될 영어분법의 순서가 달린 규칙들(numbered rules)을 §12의 부록 Ⅱ에 모아서 정리해 놓았다. 또한 영어구조에 대한 토의에 사용할 기호의 용예들을 §11의 부록Ⅰ에서 설명을 덧부쳐 놓았다. Harwood의 논문 "Axiomatic syntax:the construction and evaluation of a syntactic calculus", Language 31. 409-14 (1955)에서 그는 앞으로 본 책자에서 구절구성으로 전개시킬 방법론과 비슷한 조직(system)으로 단어류의 분석(word class analysis)을 하고 있다. 그러나 Harwood가 사용하는 조직은 ⒀-⒂와 같은 예에서 다만 T + N + Veab + T + N 과 the + man + hit + the + ball 과의 관계를 설명할 뿐이다. 즉, Harwood의 문법은 "최초연결체(initial string)"인 T + N + Verb + T + N 과 (13ⅳ-ⅵ)과 같은 규칙들을 포함하고 있다. 따라서 이 문법은 무한상태언어를 생성하는 유한문법이 되지 못하고, 결과적으로는 §3에서 토의된 기초이론보다 약체조직(weaker system)이 되어 버린다. 한편 Harwood의 형식적인 설명(pp. 409-11)이 단어류분석에만 국한되어 있으면 Ci … m 를 단어연결체의 종류로 삼어서 언어학적인 응용(p.412)을 한 것은 직접성분분석(immediate constituent analysis)의 예에 지나지 않는다. 그리고 이러한 응용이 형식화된 해설이 되지 못하고 있다. 다시 말하면, 적용이 잘 된다고 그가 제안한 방법들이 하나도 수정 없이는 본 책자에서 말하는 형식성에 맞는 것이 없다.)
|
⒁ Sentence |
|
|
NP + VP |
(ⅰ) |
|
T + N + VP |
(ⅱ) |
|
T + N + Verb + NP |
(ⅲ) |
|
the + man + Vern + NP |
(ⅳ) |
|
the + man + Verb + NP |
(ⅴ) |
|
the + man + hit + NP |
(ⅵ) |
|
the + man + hit + T + N |
(ⅱ) |
|
the + man + hit + the + N |
(ⅳ) |
|
the + man + hit + the + ball |
(ⅴ) |
|
⒂ |
|
다시 말하면, ⒁의 둘째 줄은 ⒀의 규칙(rule) (ⅰ)에 따라서 Sentence 를 NP + VP 로 고쳐 쓴 것이고, 셋째줄은 ⒀의 규칙 (ⅱ)에 따라서 NP 를 T + N 로 고쳐 씀으로써 성립된 것이다. ⒂와 같은 도표는 ⒁의 유도과정을 명확히 나타낸다. 그러나 ⒁에 나타난 규칙에 적용된 순서가 ⒂에는 나타나 있지 않기 때문에 도표 ⒂는 ⒁라는 유도과정보다 정보함유량(information)이 적다. ⒁가 주어지면 ⒂만을 유일하게(uniquely) 구성할 수 있다. 그러나 이것의 역은 성립되지 않는다. 그 이유는 규칙적용의 순서를 달리하는 유도과정으로서도 같은 ⒂를 만들 수 있기 때문이다.ⓑ 도표 ⒂는 ⒁에 나타난 정보 가운데서 유도된 문장(derived sentence) "the man hit the ball"의 구절구성(구성성분의 분석)을 결정하는데 불가결한 정보만을 보유하고 있다. 이 문장에서 어떠한 단어연결체이건간에 하나의 원점(point of origin)으로 뒤밟아 올라갈[추적] 수 있고, 이 원점이 Z 라고 표시 되어 있으면, 그 연결체를 Z 형의 구성성분(constituent)이라고 한다. 따라서 "hit the ball"을 ⒂에서 VP 로 추적할 수 있기 때문에, 유도된 문장에서 "hit the ball"을 VP 라고 한다. 반면, "man hit"이라는 연결체는 ⒂에서 추적되어 올라갈 수 있는 원점이 없기 때문에, "man hit"는 전연 구성성분이 될 수 없다.
두가지의 유도과정이 꼭 같은 ⒂형의 도표로 표시되면, 그 두가지의 유도과정은 서로 대등(equivalent)하다고 말한다. 주어진 문장에 대하여 때때로 문법이 몇가지의 대등하지 않은(nonequivalent) 유도과정을 허용할 때가 있다. 이러한 경우를 "구성상의 동음이의형(constructional homonymity)"(주석 : §8.1에 나온 구성상의 동음이의형에 대한 몇가지 예를 참조하라. 좀더 세밀한 토의내용에 대하여는 다음 논문들을 참조하라. N. Chomsky, "The logical structure of linguistic theory"(mimeographed); N. Chomsky, "Three models for the description of language"(p. 28의 각주3 참조); C. F. Hockett, "Tow models of grammatical", Linguistics Today, Word 10. 210-33 (1954); R. S. Wells, "Immediate constituents", Language 23. 81-117 (1947). 이라고 부르며, 이때에 문법이 정확한 것이라면 구성상의 동음이의형의 문장은 난해하고 애매한 구성이 된다. 구성상의 동음이의형이라는 중요한 개념에 대하여는 후에 다시 논하겠다.
한가지 통칙(generalization)이 ⒀에서 분명히 필요하다. 각 규칙을 특종의 문맥(context)에 적용되도록 제한할 수 있어야 한다는 것이다. 예를 들면, 다음에 따라 오는 명사(noun)가 복잡(plural)가 아니고 단수(singular) 일 때 T는 a로 고쳐 쓰여지며, 같은 식으로 앞에 오는 명사가 men 이 아니고 man 일 때 Verb 는 "hits"로 고쳐 쓰여지게 해야 한다. 일반적으로, X 를 Y 로 고쳐쓰는 것을 Z - W 라는 문맥에서 제한하려면 문법에 다음과 같은 규칙을 넣을 수 있다:
(16) Z + X + W → Z + Y + W
예를 들어, 단수동사와 복수동사를 구별해야 할 때는 ⒀에서 Verb → hits 라는 규칙을 사용하지 말고 그 대신 NPsing -ⓒ라는 문맥에서는 Verb 가 hits 로 고쳐 쓰여진다는 것을 알리는 다음의 (17) 과 같은 규칙을 부가해야 한다.:
(17) NPsing + Verb → NPsing + hits.
상술한 바와 같이 (17) 에서 NPsing 를 사용하려면 NPsing 와 NPpl 가 포함되도록 (13ⅱ)를 수정해야 한다(주석 : 좀더 완성된 문법에서는 (13ⅱ)가 다음과 같은 몇 개의 규칙의 집합으로 대치되어야 할 것이다.

(+Prepositional Phrase)
(+Prepositional Phrase)
[Prepositional Phrase - 전치사구]
여기에서 S 는 단수동사와 복수동사("comes", "boys")에 쓰이는 형태소이며, Φ 는 단수명사와 복수동사("boy", "come")에 쓰이는 형태소이다. 본 책자에서는 일인칭과 이인칭에 대한 논의는 일절 제외하겠다. 명사형과 동사형에 대한 접속사(number affix)의 분별은 사실상 그것의 타당성여부가 문제시되고 있다.). 이것은 상당히 단도직입적으로 ⒀을 일반화시키는 것이 된다고 하겠다. 그러나 (17) 에서와 같이 ⒀에서도 한가지 사실은 유지되어야 한다. 즉, 한 규칙에서는 단 하나의 요소만을 고쳐 써야 한다는 것이다. 예를 들면, (16) 에서는 X 는 T + N 와 같은 연결체가 되어서는 안 되며, T 또는 Verb 와 같은 단어기호(single symbol)라야만 된다는 것이다. 이러한 조건이 만족되지 않으면, 위에서 가능하던 것과는 달리 ⒂와 같은 형의 도표로부터 유도된 문장들(derived sentences)의 구절구성(phrase structure)을 정당하게 찾아낼 수 없게 된다.
이제 성분분석(constituent analysis)에 기반을 둔 언어구조에 대한 이론에 관련된 문법의 일반형을 기술해 보기로 하자. 이러한 각각의 문법은 최초연결체(initial string)의 유한집합 ∑와 " X 를 Y 로 고쳐써라"로 해석되는 X → Y 형의 '지시공식(instruction formula)'의 유한집합 F로써 규정된다. 비록 X 자체가 단일기호(single symbol)가 될 필요는 없으나 Y를 유도할 때는 X 가운데서 단일기호만을 고쳐써야 한다.ⓓ 문법 ⒀에서 최조연결체의 집합 ∑로서는 단일기호 Sentence 가 유일한 구성원(member)이었고, F로서는 (ⅰ)-(ⅵ)의 규칙들이 있었다. 한편 ∑의 범위를 넓혀서 예를 들면 Declarative Sentence, Interrogative Sentence 를 기호로서 첨가할 수도 있다. [∑, F]라는 문법이 주어지면, 연결체의 유한연속(a finite sequence of strings)으로써 유도과정을 규정한다. 그리고 각 유도과정은 ∑의 한 최초연결체로 시작되고, 각 연결체는 바로 전의 연결체에 F의 한 지시공식을 적용하여 만들어낸다. 따라서 ⒁는 유도과정이 되고, 또한 ⒁의 처음 다섯 줄로 된 오단의 연결체의 연속도 역시 하나의 유도과정이 된다. 유도과정중에는 완결유도과정(terminated derivation)이 있다. 여기서 완결이라 함은 그 유도과정의 제일 마지막의 연결체를 F의 규칙으로써 더 이상 고쳐 쓸 수 없다는 것이다. 따라서 ⒁는 완결유도과정이 되지만, ⒁의 처음 다섯줄로 된 연속은 완결유도과정이 되지 못한다. 완결유도과정의 마지막 연결체를 최종연결체(terminal string)라고 한다. 즉, the+man+hit+the+ball 은 문법 ⒀으로 유도된 최종연결체이다. [∑, F]형의 어떤 문법은 최종연결체를 갖지 않는 것이 있다. 그러나 우리의 관심사를 최종연결체를 가지는 문법이어야 한다. 다시 말하면 언어를 기술하는 문법이어야 한다는 것이다. 연결체의 한 집합이 일종의 [∑, F]형의 문법으로 만들어 낸 최종연결체의 집합이라면 그 집합을 최종언어(terminal language)라고 부른다. 따라서, 이러한 문법의 각각은 일종의 최종언어(문장이 없는 광백언어('empty' language)일 수도 있다)를 규정하며, 각각의 최종언어는 [∑, F]형의 문법에 의하여 형성된다. 한 최종언어(terminal language)와 문법이 주어지면, 위에서 보인 바와 같이 그 언어의 각 문장(주어진 문법에 의한 각각의 최종연결체)의 구절구성을 각 문장에 해당되는 ⒂형의 같은 도표에 따라 재구(reconstruct)할 수 있다. 또한 이러한 언어의 문법적 관계(grammatical relation)를 해당되는 도표에 의하여 형식적으로 규정할 수 있다.ⓔ
2. §3에서는 "유한상태언어"라고 불리우는 유한상태의 Markov과정에 의하여 생성된 언어를 다루었다. 그리고 지금은 [∑, F]형의 체계에 의하여 생성된 최종언어를 다루고 있는 것이다. 이 두가지 형의 언어간에는 다음과 같은 관계가 있다.
정리 : 모든 유한상태언어는 최종언어이다. 그러나 유한상태언어가 아닌 최종언어가 있다.(주석 : 문법간의 상대적인 강력도에 관계되는 본 정리와 기타 이에 관련된 정리에 대한 증명은 "Three models for the description of language"(p. 28의 각주 3을 참조)를 참조하라.)
본 정리의 요지는 구절구성에 의한 기술이 §3에서 전개된 기초이론에 의한 기술보다 본질적으로 더 강력하다는 것을 말한다. 유한상태언어가 아닌 최종언어의 예로서는 §3에서 본 바 있는 (10ⅰ)과 (10ⅱ)와 같은 언어가 있다. 즉 모든 ab, aabb, aaabbb ,… 그리고 그것만을 포함하는 언어인 (10ⅰ)은 (18) 이라는ⓕ [∑, F]형의 문법에 의하여 생성될 수 있다.
(18) ∑: Z
F: Z→ab
Z→aZb
이 문법은 Z 라는 최종연결체(⒀은 Sentence 라는 최종연결체를 가지고 있었다)와 두 개의 규칙으로 되어 있다. (18) 에서 형성된 각 완결유도과정(terminated derivation)이 (10ⅰ)에 나타난 연결체가 된다는 것과 이러한 모든 연결체는 (18) 의 방식에 따라 유도된다는 것을 쉽게 알 수 있다. 같은 식으로, (10ⅱ)형의 언어들도 [∑, F]라는 문법에 의하여 성립된다.ⓖ 그러나 반면, (10ⅲ)은 문법내에 문맥상제약(contextual restriction)을 (주석 : Chomsky 의 "On certain formal properties of grammars", Information and Control 2. 133-167(1959)를 참조하라.) 포함하는 규칙이 없으면, 이러한 형의 문법에 의하여 성립될 수가 없다.ⓗ
§3에서 (10ⅰ)형과 (10ⅱ)형의 언어가 연어의 일부가 된다는 사실과 따라서 유한상태의 Markov 과정모형이 영어에 적합하지 않다는 것을 지적하였다. 현단계에서는 구절구성모형이 Markov 과정모형의 결함을 보완한다는 것을 알 수 있다. 아직까지 구절구성모형의 적합성(adequacy)을 증명한 바 없지만 유한상태과정의 모형으로는 전적으로 기술이 불가능한 연어의 많은 부분이 구절구성에 의하여 기술이 가능하다는 것을 알았다.
(18) 의 경우, 예를 들어 (10ⅰ)형의 aaabbb 라는 연결체에서 ab 가 Z 가 되고 (ab is a Z), aabb 가 Z 가 되며 (aabb is Z), 또한 aaabbb 자신도 Z 가 된다 (aaabbb itself is a Z) 는 것을 살펴볼 수 있다.(주석 : 여기에서 "is a"는 §4.1에서 ⒂형 도표에 의하여 규정된 관계를 말한다.) 따라서 aaabbb 는 각각이 Z 가 되는 세 개의 "구절(phrase)"을 포함하고 있다. 물론 이것은 보잘 것 없는 언어이다. 여기에서 중요한 사실은 이 언어를 기술함에 있어서 그 언어의 문장 중에 포함되지 않는 Z라는 기호를 사용했다는 것이다. 이것은 구절구성이 '추상적'성격을 갖기 위한 구절구성에 있어서의 불가결한 현상이다.
또한 ⒀과 (18) 과 같은 경우(모든 구절구성의 조직에 일관하여), 여러 가지 다른 표시로 각각의 최종연결체를 나타낼 수 있음을 볼 수 있다. ⒀의 예를 보면, "the man hit the ball"이라는 최종연결체가 Sentence, NP + VP, T + N + VP , 그리고 ⒁의 다른 각각의 예로된 모든 연결체로 표시되는가 하면, 또한 ⒁에서 규정된대로 ⒁와 대등한 다른 유도과정에 나타나는 NP + Verb + NP, T + N + hit + NP 등의 연결체에 의해서도 표시된다. 결과적으로 보면, 구절구성계층(level of phrase structure)에 있어서는 언어의 각 문장은 음운계층, 형태소계층 또는 단어계층 등으로 표시할 때와 같이 단어연결체로 표시되는 것이 아니라 연결체의 한 집합에 의하여 표시된다. 따라서 구절구성이라는 언어학적 계층은 §3의 마지막 항에서 본 바와 같이 근본적으로 다른 중요한 성격을 가지고 있다.ⓘ "the man hit the ball"을 나타내는 여러 표시사이에는 계층체계(hierarchy)를 세울 수 없다. 구절구성의 조직을 상하의 순서를 가진 유한집합의 계층으로 세분할 수는 없다. 그리고 이렇게 세분된 계층을 설정했다고 하더라도 각 계층에서 문장을 단일표시로 나타낼 수가 없다. 예를 들면, NP 와 VP 라는 요소에 대하여 상호적인 입장을 살려서 순위를 정할 수가 없다는 것이다. 연어를 살펴보면, 명사구절이 동사구절에 포함되어 있는가 하면, 동사구절이 명사구절에 포함되어 있다. 따라서 구절구성을 모름지기 단일계층으로 취급해야 하며, 언어의 각 문장을 나타내는 표시의 집합이 구절구성내에 포함되어 있다고 보아야 한다. 그리고, 적절하게 선택된 표시의 집합들과 ⒂의 형을 가진 표시들 간에는 일대일의 대응관계(correspondence)가 성립된다.
3. [∑, F]형의 문법이 한 언어의 형태소의 문법적 연결체를 모두 생성한다고 하자. 이 문법이 완전한 것이 되자면, 이 형태소의 음운구조(phonemic structure)를 기술해야 하고, 그럼으로써 그 문법이 그 언어의 문법적 음운연결체를 생성하는 것이 되어야 한다. 그런데 음운구성에 대한 기술(즉, 그 언어의 형태음운론이라고 한다)도 역시 " X 를 Y 로 고쳐써라"형의 규칙의 집합으로 이루어진다. 영어에서 예를 들어보면 다음과 같거나 이와 유사한 것이 된다.:
(19) (ⅰ) walk→/wok/
(ⅱ) take + past→/tuk/
(ⅲ) hit + past→/hit/
(ⅳ) /…D/+ past →/…D/+1d/
(여기서 D=/t/ 또는 /d/)
(ⅴ) /…Cunv /+past→/…Cunv /+/t/
(여기서 Cunv 는 무성자음)
(ⅵ) past →/d/
(ⅶ) take →/teyk/, 등…
여기에서도 역시 규칙간에 순서가 규정되어야 한다는 것을 간과해서는 안된다. 예를 들면 (ⅱ)는 반드시 (ⅴ)나 (ⅶ)에 앞서야 한다. 그렇게 하지 않으면, take 의 /teykt/와 같은 형으로 유도되고 만다.ⓙ 한편, 형태음운규칙(morphophonemic rule)에서는 각 규칙에서 단일기호만을 고쳐 써야 한다는 조건이 없다.ⓚ
구절구성에서 얻은 유도과정에 (19) 를 적용하여 이것을 전개할 수 있다. 이로써 최초연결체인 Sentence 로부터 음운연결체들을 생성하는 통합된 과정을 얻게 된다. 이러한 사실은 상위계층인 구절구성과 하위계층과의 구분이 임의적인 것으로 생각되게 하기 쉬우나, 사실상 이 구분은 임의적인 것이 아니다. 그렇지 않다는 이유의 한가지는 이미 본 바와 같이 구절구성에 해당하는 X→Y 형 규칙의 형식적 특성이 형태음운규칙의 특성과 다르다는 사실이다. 즉, 전자에 있어서는 단일기호만을 고쳐 써야 한다는 조건이 있고, 후자에는 없다. 둘째로, (19) 의 규칙에 나타나는 요소들은 유한집합의 계층으로 분류될 수가 있다(예를 들면, 음운과 형태소, 또는 음운과 형태음운과 형태소). 그리고 한 계층에서의 요소들의 단일연결체가 그 계층에서 각 문장의 표시로써 각 문장과 관련된다는 의미에서 각 계층은 기본이 된다(구성상의 동음이의형은 제외).ⓛ 반면, 구절구성에 나타나는 요소들을 위해 말한 식으로 상하계층으로 분류할 수는 없다. 그리고 구절구성이라는 상위계층의 규칙들과 형태소연결체를 음운연결체로 전환시키는 하위계층의 규칙들과 구분해야 하는 좀더 근본적인 이유가 있다는 것을 뒤에 논하겠다.
구절구성의 형식적 특성에 대한 연구는 흥미로운 연구가 된다. 문법형을 좀더 구체화하고 정밀화해야 한다는 필요성과 이것이 가능하다는 것을 쉽게 알 수 있다. 즉 F라는 집합에 포함된 규칙들 간에는 순서가 있어서 특종 규칙이 적용된 다음에야 다른 규칙이 적용될 수 있으며, 이렇게 하는데서 오는 이점을 쉽게 알 수 있게 된다. 예를 들면, (17) 형의 규칙들은 NP 를 NP + Preposition + NP 로 고쳐쓸 수 있는 형의 모든 규칙들보다 앞서야 된다. 그렇게 하지 않으면, 이 문법은 "the man near the truck begins work at eight"와 같은 비문장을 만들게 된다. 이러한 구체화과정은 본 연구의 범위를 벗어나는 문제를 유도하게 됨으로 여기서 멈추겠다.