귀납, 개념, 확률

(Induction, concepts and probability)

 

컴퓨터와 마음 : Philip N. Johnson-Laird 지음, 이정모. 조혜자 옮김, 민음사, 1991, Page 279~303 (원서 : The Computer and the Mind: An Introduction to Cognitive Science, Harvard Univ. Press, 1988)

 

귀납에서의 일반화와 특수화

귀납의 틀로서의 의미론적 정보

귀납에서의 의미론적 제약조

개념들의 성질

귀납 프로그램

지식과 확률적 판단

 

페니실린의 발견은 단 하나의 관찰과 함께 시작되었다. 플레밍 경 (Sir Alexander Fleming) 은 박테리아가 2 주 동안 배양기에 두면 파괴된다는 사실에 주목하였다. 사실상 일련의 우연들이 모여 박테리아를 파괴하게 하였다. 파스퇴르가 말했던 것처럼 <우연> 은 <준비된 마음을 선호한다.> 플레밍은 준비된 상태에 있었다. 그는 박테리아가 내구력이 있다는 것을 알았고, 따라서 그는 무엇인가가 그것들을 죽었음이 틀림없다고 추리했다 :

추론은 전제가 제외시키는 사태들보다 더 많은 사태들을 제외함으로써 (앞장 참조) 의미론적 정보를 증가시킨다. 이것이 바로 귀납 (induction) 이다. 인과적 발동자를 도입하는 것은 설명적 추측이라고 할 수 있지만, 공짜로는 아무것도 얻을 수 없으며, 의미론적 정보를 증가시키는 데 대한 대가는 추론 절차의 정당성이 보장되지 않을 수도 있다는 것이다. 귀납은 공식적인 경고와 같은 단서가 따라다니는 것이다.

16 개월 된 여아가 눈 (snow) 을 지칭하기 위해 사용되는 단어 <눈> 을 듣는다고 해보자. 바워먼 (Melissa Bowerman) 이 관찰했던 것처럼 다음 몇 달이 지나면 그 아기는 그 단어를 눈뿐만 아니라 말의 흰 꼬리, 장난감 배의 흰 부분, 흰 플란넬 침대 패드, 바닥에 흘린 우유를 지칭하는 데 사용한다. 그 아기는 <눈> 이란 단어가 흰 물건이나 수평면적의 흰 부분을 지칭한다는 인상을 형성하고 있는 것이며, 점차 그 개념을 세련화시켜 성인의 개념과 일치시키게 될 것이다. 그 기저의 절차는 귀납이다. 사람들과 사건들의 유목과, 표현의 의미들에 대한 인상을 형성하면서, 우리는 모두 우리의 생활 속에서 귀납활동을 하고 있다.

친절한 의사의 지도 아래서 여러분이 천연두의 사례들을 검토한다고 해보자. 여러분은 각 환자가 그 병에 걸린 누군가와 사전 접촉을 했다는 것에 주목한다. 따라서 여러분은 다음과 같이 추리한다 :

이것은 귀납추론이다. 즉 유한한 사례들로부터 그 유목에 속한 모든 구성원에 대한 결론을 내리게 된다.

생리학자인 발로우 (Horace Barlow) 는 인간의 대뇌피질은 그 세포들이 받은 메시지들 가운데서 <미심쩍은 일치들> 을 탐지할 수 있기 때문에 환경에 대한 모델을 형성할 수 있다고 한다. 즉 세포들이 귀납추론을 수행할 수 있다는 것이다. 귀납은 중요하다. 따라서 이 장에서는 귀납의 기초적인 조작과정들과, 심리학 실험실에서 행해진 연구, 그리고 컴퓨터 프로그램에서의 귀납의 수행을 다룬다. 의미론적 정보의 개념은 기본적인 귀납작용을 규명하는 틀을 제공할 것이다. 그것은 또한 사람들이 귀납적으로 사고할 때 사용하는 일반적 제약에 대해서도 시사를 할 것이다. 제약틀의 또 다른 근원은 특수 영역에 대한 지식이다. 이 장의 마지막 주제는 사람들이 지식이 부족할 때, 특히 확률이론의 지식이 부족할 때 무슨 일이 발생하는지에 대한 것이다.

귀납에서의 일반화와 특수화

철학자들은 귀납의 정당화에 대하여 크게 번민해 왔다. 천연두에 대한 여러분의 귀납은 타당한 것처럼 보이지만, 굿먼 (Nelson Goodman) 의 논의를 빌려보자면, 여러분의 귀납 근거는 다음과 같은 결론도 역시 지지한다 :

분명히 이 추론은 어리석다. 그러나 왜 그런가? 여러분은 다음과 같이 말할 수 있다 : 우리는 표범들의 반점이 변화되지 않는 것처럼 질병들의 자국은 변화되지 않는다는 것을 안다. 그러나 어떻게 우리는 그것을 아는가? 만약 여러분이 조심스럽지 않다면 여러분은 다음처럼 대답할 것이다. <우리의 모든 관찰이 이 주장을 지지하기 때문이다.> 그러나 우리의 모든 관찰들은 천연두가 홍역이 될 2000년까지는 천연두는 천연두로 남아 있을 것이라는 주장과도 마찬가지로 일치하고 있는 것이다.

타당화 문제에 대한 한 반응은 귀납을 전적으로 부인해 버리는 것이다. 포퍼 경 (Sir Karl Popper) 은 과학이 귀납에 근거하지 않으며, 경험적인 반증의 공격에 노출되어 있는 설명적인 추측들에 근거하는 것이라고 논의한다. 그러면 어디에서 그 추측들이 나오는 것인가? 포퍼는 그것은 문제가 아니라고 말한다. 그것은 도처에서 나올 수 있다는 것이다. 그러나 추측들이 마찬가지로 의미있는 것은 아니기 때문에, 그리고 그것들 중 많은 것이 귀납에 근거하고 있는 것으로 보이기 때문에 귀납의 정당화 문제는 사라지지 않는다. 그렇다면 귀납의 심리적인 기제는 무엇인가?

많은 가능한 절차들이 있지만 귀납의 본질은 밀 (John Stuart Mill) 의 귀납법칙으로 거슬러 올라가고, 이것은 다시 베이컨 경 (Sir Francis Bacon) 의 공식으로 올라간다. 그것들은 두 개의 주요 개념으로 요약된다. 첫째, 만약에 한 현상에 대한 긍정 사례들이 공통적으로 하나의 특징만을 갖는다면 그 특징은 통합적으로 묶는 데 있어서 결정적인 역할을 담당할 것이다. 둘째, 만약 긍정과 부정 사례들이 오직 한 특성에서만 다르다면, 그 특성은 사례들을 구별적으로 가르는 데 있어 결정적이다.

귀납적 추측은 참과는 거리가 멀 수도 있는데, 그 이유는 그것이 적절한 개념에 근거하지 않기 때문이다. 예를 들어 <천연두는 신의 모독에 대한 벌이다> 와 같은 것이다. 그러나 가장 어려운 문제가 해결되었다면, 즉 관련 개념들이 조작가능한 (available) 개념들 집합 내에 있다면, 귀납이 개정될 수 있는 두 가지 방식이 있다. 그것은 천연두에 접촉하면 그 병을 얻게 된다는 가설의 입장에서 예시될 수 있다. 한편에서는, 그 가설이 너무 일반적일 수도 있다. 사실상 백신 주사는 예방을 할 수 있고, 따라서 여러분의 가설은 더 특수화될 필요가 있다 :

다른 한편, 여러분의 원래의 추측은 너무 특수한 것이었을 수도 있다. 즉 감염된 옷에 접촉하는 것은 병을 걸리게 할 수 있다는 추측이다. 이러한 여러분의 추측은 일반화될 필요가 있다 :

   만약 누군가가 천연두 환자나 또는 감염된 옷과 접촉한다면 그들은 그 병에 걸릴 것이다. 이러한 형태의 일반화는 하나의 선접절 (disjunctive clause) 을 첨가한다. 또 다른 형태는 윈스턴 (P. Winston) 의 프로그램과 마이칼스키 (R. Michalski) 의 프로그램을 포함하여 여러 프로그램에서 사용된 것으로서, 연접문의 부분 즉 연접절 하나를 생략하는 것이다. 따라서 :

라는 추측은,

가 된다. 그러므로 귀납은 일반화와 그 역인 특수화 모두를 필요로 한다. 개념은 모든 긍정 사례들을 포함하기에 충분하게 일반적이어야 하지만, 부정 사례 모두를 배제할 만큼 특수해야 하기도 한다.

두 가지 두드러진 의문점들이 있다. 첫째, 일반화 (와 특수화) 의 기저의 성질은 무엇이며, 둘째, 일반화 (와 특수화) 의 독특한 조작들은 얼마나 많은가? 두 질문에 대한 대답은 의미론적 정보의 개념으로부터 나올 수 있다.

귀납의 틀로서의 의미론적 정보

하나의 가설이 고려 대상에서 제외시키는 사건들의 상태가 많으면 많을수록 그 의미론적 정보는 더 많아진다. 그러므로 일반화는 적어도 어떤 부가적인 사건의 상태를 제외시킴으로써 한 가설의 의미론적 정보를 증가시키는 활동이라고 볼 수 있다. 특수화는 그 반대의 효과를 갖는다 : 즉 그것은 어떤 사건의 부가적인 상태를 허용하는 것이고, 따라서 그것은 의미론적 정보를 감소시키는 가설로부터 나오는 타당한 연역이다.

일반화에는 많은 가능한 형태들이 있다. 예를 들어 마이칼스키에 의해 고안된 한 프로그램에서 사용된 규칙을 고려해 보자. 그 규칙은 연접문 (conjunction) :

를 다음과 같은 선접문 (disjunction) 으로 바꾼다 :

그러나 이러한 조치는 일반화에 대한 두 가지 선행 규칙들을 결합시킴으로써 달성될 수 있다. 첫 번째 규칙은 산출된 연접부분, 즉 연접절 하나를 생략하는 것이다 :

두 번째 규칙은 선접절을 첨가하는 것이다 :

사실상, 술어 논리에서 어떤 형태의 일반화를 구성하기 위해 요구되는 기본적인 조작은 단 세 개만 있을 뿐이다. 첫 번째 조작은 어떤 묘사에 대한 부정을 현재의 가설에 결합시키는 것으로, 이는 부가적인 사건들의 상태를 통제 (제거) 하기 위해서이다. 두 번째 조작은 유한한 관찰로부터 보편적인 주장으로 옮겨지는 것으로서, 소수의 환자의 사례들로부터 천연두에 접촉하는 것이 그 병에 걸리기 충분하다는 결론을 추론하는 것과 같은 것이다. 세 번째 조작은 어떤 컴퓨터 프로그램에서도 아직 탐색되지 않은 것으로서, 예를 들어 :

로부터,

에 이르는 단계이다. 만약 관련 개념들이 조작에 이용 가능한 것들 중에 있다면, 이러한 세 가지 기본조작들은 일상 술어 논리의 어떤 일반화를 위해서도 충분하다.

가설이 아주 상위의 정보내용을 가지고 있지 않는 한, 가능한 일반화의 수는 일반화를 형성하는 데 관련될 수 있는 개념들의 수에 지수 함수적으로 증가한다. 따라서 추정되고 있는 잠정적 가설들을 제거하는 것에 기초를 둔 어떤 한 절차도 적당한 시간 내에 그 가설들 모두 검토하는 것이 불가능할 것이다. 그러면, 어떻게 올바른 일반화를 찾아내야 하는가?

귀납에서의 의미론적 제약조건

가설의 지수함수적 문제에 대한 해결책은 제약조건들을 부과하는 데서 찾아지며, 의미론적 정보에 근거한 그럴 듯한 일반적인 제약이 있다. 사람들은 새로운 개념이나 가설을 이끌어내려고 노력할 때 긍정적인 사례들에 주의를 기울인다. 이런 경우에 제약이란 증거에 직접 근거한 의미론적 정보의 양을 가장 많이 갖는 가설을 형성하는 것이다. 만약 여러분이 엡스타인 (Ebstein) 병을 가진 한 환자를 검사하고, 이 사람이 주기적인 열과 발진, 목의 통증이 있다면, 이 병의 증후에 대해 최대한으로 내릴 수 있는 정보적인 가설은 다음과 같다 :

여러분이 만약 주기적으로 열이 나고 목의 통증이 있지만 발진은 없는 동일 질병의 다른 환자를 검사한다면, 여러분은 즉시 첫 번째 가설에서 너무 많은 것을 배제했다는 것을 깨달을 것이다. 여러분은 그 증거에 기초해서 최대한의 정보를 주는 것으로 처음의 가설을 새롭게 조정할 것이다 :

그러나 여러분이 다음과 같은 가설로 시작했다고 가정해 보자 :

그것은 두 번째 환자의 경우에 의해서 영향을 받지 않을 것이다. 만약 그 병의 실제적인 증후가 단지 주기적인 열이라면 여러분은 긍정적 사례들만 가지고 그것을 결코 끌어내지 못할 것이다. 여러분은 시초 가설이 항상 그것들을 수용할 것이기 때문이다. 그러므로 여러분이 긍정적 사례들에서부터 하나의 개념을 획득하려고 노력하고 있다면, 여러분은 자료에 기초해서 의미상 가장 많은 정보를 주는 가설을 발전시켜야만 한다. 그것은 너무 많은 것을 배제시킬지도 모른다. 그렇지만 여러분은 조만간 그 가설을 수정하게 하는 긍정적인 사례들을 접할 것이다.

아동들은 세계에 대한 분류법을 발전시킬 때, 이 원리에 의존하는 것같다. 카일 (Frank Keil) 은 아동들이 그림 13.1 에서처럼 위계적으로 개념들을 조작한다는 것을 보여주었다. 그림 13.2 에서 나온 것과 같은 중복된 배열들은 드물며, 그것은 아마도 모호성에서 비롯되는 것 같다. 카일은 <나무는 한 시간 길이이다> 라고 말하는 것이 의미있는가 라는 물음에 아동들이 답변하는 패턴을 통해 아동이 어떤 식으로 분류하는지를 유도해내었다. 어떤 아동은 다음과 같은 분류 규칙을 가지고 있었다 :

그러나 더 나이든 아동은 두 유목들을 구분했다 :

 

그림 13.1 : 카일의 연구에서 5 세 아동의 전형적인 판단을 나타내는 나무 도식

 

이렇게 분류법이 세련되어 가는 방식은 아동들이 의미론적 정보에 민감하다는 것을 시사한다. 만약 하나의 범주가 둘로 나누어져야 한다면, 의미론적으로 가장 강한 구분은 어떤 실체도 양쪽에 소속될 수 없는 상호배타적인 두 개의 하위 범주들을 만드는 것이다. 아마도 이러한 의미론적 원리가 아동들로 하여금 중복적인 분류를 피하도록 하는 것 같다.

이제 웨이슨 (Peter Wason) 이 실험적으로 연구했던 영역에 대해 고려해보자. 내가 여러분에게 한 개념의 초기 사례들로 일련의 들자들을 제시한다고 해보자 :

많은 사람들은 그 개념이 다음과 같다고 가정할 것이다 :

이것은 그 개념이 일반적 속성과 관련되다는 것을 가정하는 것 같다. 그와 같은 추측들을 고러해 보면,  그것들을 의미론적 정보성과 관련시켜 순서짓는 것이 가능할 것이다. 예를 들어 다음의 가설을 보자 :

이것은 3, 5, 7 과 같은 것들을 배제하기 때문에 앞의 것보다 더 강력하다. 그러나 불행히도 그것들은 무한하게 많이 있기 때문에 여러분은 가능성 있는 관련 숫자들을 세여 볼 수가 없다. 더 나쁜 것은 여러분이 의미론적 정보성의 순서대로 추측을 생성해 내는 분명한 절차를 갖고 있지 못하다는 점이다. 하나의 수열을 지배하는 개념들은 무한히 가능하며, 따라서 어떤 한 개념이 간과되기는 쉽다는 것이다. 예를 들어 동일한 수를 연속적으로 곱하는 것 같은 개념을 간과될 수 있다.

웨이슨의 실험 피험자들은 그들 스스로 자신의 설설 (개념) 을 점검해 보는 검사용 사례들을 생성했었는데, 웨이슨은 거기에서 놀라운 편향이 있음을 발견했다. 그들은 자신들의 가설에 대한 긍정 사례들만을 생성하는 것을 고집했다. 예를 들어 그들은 다음과 같은 사례들을 만들어 내었다.

즉 그들은 세 개의 잇단 연속적으로 증가하는 짝수라는 추측을 확인하려는 것이다. 물론,

과 같은 부정적 사례를 만들어내었다면 검사용 사례들은 훨씬 더 정보적이었을 것이다. 그러나 위와 같은 사례를 만들었다면 그들은 이런 항목들 역시 다음과 같은 정답인 목표개념의 한 긍정적인 사례라고 학습하였을 것이다 :

왜 사람들은 자기들의 가설을 확인하는 방향으로 편향되어 있는가? 어떤 가설이 지지되려면 직접적인 확증이 있어야만 하고, 그리고 그 과정은 반박을 시도하는 것보다 더 쉽다. 아마도 그 편향은 주로 긍정적 사례들로부터 학습해 온 자연 언어와 같은 영역에서 비롯된 잔존물인 것 같다.

앵글루인 (Dana Angluin) 에 따르면 형식적 학습이론에는 하나의 정리 (일반원리) 가 있다고 한다. 그것은 의미론적 정보와 관련하여 다음과 같이 다시 표현될 수 있다 : 즉 어떤 개념들(또는 언어들) 은 긍정적 증거만으로부터 획득될 수 있다. 즉 제시된 가설이 지금까지의 자료를 기초로 나온 다른 가설들보다 의미적으로 더 약하지 않다는 것이 확인될 수 있는 경우이다. 결국 그 절차는 너무 많은 것을 배제시키지 않는 하나의 가설에 도달할 것이며, 따라서 그것은 결코 포기될 필요는 없을 것이다. 사람들은 이 절차를 어떤 영역에서는 실행에 옮길 수 있겠지만 다른 영역에서는 그렇지 못할 것이다. 한 영역이 웨이슨의 실험에서처럼 무한한 것이라면, 의미 정보성을 측정하기는 어려우며, 최대의 정보를 가진 가설들을 제기할 수 있다는 것을 보장하기가 불가능하다. 앵글루인의 절차에 주의를 환기시켰던 베르윅 (R. Berwick) 은 아동들이 고의로 비문법적 문장들을 직면하게 되는 일은 드물기 때문에 (즉 올바른 문장의 예들만 경험하므로) 언어를 획득할 때 위의 절차를 사용한다고 논의한다. 이제 걸정되어야 할 것은 의미론적 정보성에 따라 문법에 대한 추측들을 순서짓는 것이 가능한가이다. 특히 가능한 추측들의 집합에 대한 본유적인 제약조건들이 없다면 말이다.

개념들의 성질

최근까지도, 밀과 다른 경험주의 철학자들을 따라서 심리학자들은 사람들이 추상화 (abstraction) 과정을 통해 개념들을 획득한다고 가정하였다. 추상화 과정은 하나의 사례가 다른 사례와 구별되는 특유한 세부사항들을 버리며, 공통적인 것만 배후에 남겨두는 것이다. 따라서 대부분의 실험들은 피험자들이 한 개념의 기저의 공통요소를 발견해야 하는 기법을 사용하였다. 1930년대에 러시아의 심리학자인 비고츠키 (Lev Semenovich Vygotsky) 는 모양과, 색깔, 크기, 그리고 두께가 다른 나무로 된 블록을 탁자 위에 올려놓고, 뒷면에 쓰인 <MUR> 와 같은 무의미 명칭이 나타나도록 하기 위해서는 그것을 뒤집어야 하는 분류과제를 고안하였다. 피험자의 과제는 동일 명칭을 갖는 블록들을 모두 같은 범주로 분류하는 것이었다. 어린 아동들은 블록들을 비조직적인 한 더미로 모았다. 아마도 그것들이 멋진 모양을 만들기 때문이었을 것이다. 그 다음 단계의 아동들은 하나의 블록을 선택하고, 그 블록이 시사하는 다른 블록을 선택하는 방식으로, 즉 상호의존적 연쇄형태로 블록들을 선택하였다. 이는 바워먼의 <눈 (snow)> 이란 단어사용에 대한 연구결과를 생각나게 한다. 다음 단계에서 아동들은 적합한 블록들을 함께 분류하지만, 실험자가 <MUR> 라는 명칭이 없음을 보여주기 위해 그 블록들 중 하나를 뒤집으면, 아동들은 그것을 더미에서 제거시키지만 그러나 다른 유사한 잘못된 선택들에 대해서는 아무것도 하지 않았다. 비고츠키는 아동에게는 완전한 개념을 추론하기 위해 요구되는 추상적 사고능력이 없으며 이 능력은 성인들과의 상호작용을 통해서만 생긴다고 주장했다.

1950 년대 브루너 (Jerome Bruner) 와 굿나우 (Jacqueline Goodnow), 오스틴 (George Austin) 은 <비고츠키 절차> 의 개정판을 도입하였다. 그들은 여러 도형이 있는 큰 배열을 사용하였고, 피험자들은 (알아내야 할 목표개념이 무엇인지를 추론하기 위해) 이 배열에서 일련의 도형들을 선택했다 (<스무고개> 풀이와 유사한 문제상황임). 피험자가 도표를 하나씩 선택하면 그것이 목표 개념의 사례인지 아닌지를 알려주었다. 실험 결과, 피험자들마다 도표 선택을 할 때 각기 다른 책략들을 사용하는 것으로 드러났다. 즉 어떤 피험자는 실험자가 선택해 준 최초의 사례에 초점을 맞추고 (목표 개념을 구성하고 있는 특성들을 찾기 위하여) 한 번에 한 특성씩 변화시켜 나갔다.  또 어떤 피험자들은 여러 특성들이 한꺼번에 달라지는 항목들을 고름으로써 모험을 시도했다. 브루너와 그 동료들은 <공통요소> 를 찾는다는 이론을 입증하는 선접 개념들은 발견해 내기 어렵다는 것도 발견했다. 예를 들어 <크거나 초록 (large or green)> 이라는 개념은 공통적인 모양이나 색깔을 갖지 않는 큰 빨간 대상들과 작은 초록 대상들을 모두 포함하기 때문이다.

그러나 일상개념들은 특성들의 연접과 선접으로 이루어진 것이기보다는 오히려 그들간의 관계로 이루어져 있다. 예를 들어 탁자는 다리들과 윗부분 (상판) 의 단순한 연접이 아니라, 다리가 윗부분을 지탱해 주는 것이다. 게다가 관련된 개념들이 실험실에 도입될 때, 그것들은 피험자들의 수행 상에서 상당한 진전을 야기시킬 수 있다. 마크만 (Ellen Markman) 과 그 동료인 자이베르트 (Jeffrey Seibert) 는 유치원 아동들에게 장난감 개구리들을 보여주었다. 그것들 중 두 개는 큰 개구리였고, 네 개는 아기 개구리였다. 그들은 피아제 (J. Piaget) 가 수행했던 유명한 실험에서처럼 <개구리가 더 많니, 아니면 아기 개구리가 더 많니?> 라고 질문을 하였다. 피아제의 연구에서처럼 아동들은 <아기 개구리가 더 많다> 는 틀린 대답을 했다. 물음 자체가 잘못을 유도하긴 했지만 이 대답은 틀린 것이다. 그러나 아동들에게 개구리 가족이 있었다고 말해 주고서 동일한 질문을 하였을 때는 옳은 답변을 하였다.

일상개념들의 또 다른 측면은 그 개념의 사례들이 공통요소를 갖지 않을 수도 있다는 것이다. 스모크 (Kenneth Smoke) 는 1930 년대에 이러한 우려를 나타내었다. <어떤 사람이 개들에 대해 더 많은 것을 학습하면, 그의 '개'에 대한 개념은 점점 더 풍부해진다. 그러나 그것은 (개라는 개념을 구성하는) 소수의 기본요소에 점점 더 접근해 좁혀 들어가는 것은 아니다. '개' 라는 단어에 대해 배우는 사람은 그가 학습했던 것을 통해서 그 자극 패턴들에 있는 '공통요소'를 결코 발견해 내지 못했다.> 그와 같은 염려는 비트겐슈타인 (Wittgenstein) 의 『 철학적 탐구 (Philosophical Investigations) 』에서 유명해졌다 :

비트겐슈타인은 개념들은 공통요소에 의존하는 것이 아니라, 한 가족의 구성원들의 유사성과 같은 유사성의 망조직에 의존한다고 논의하였다. 이러한 생각은 1970 년대에 인기를 끌었었다. 이론가들은 세상은 고정형 (stereotypes, 철학의 퍼트남 (Hilary Putnam)), 전형 (prototype, 인류학의 벌린 (Brant Berlin)과 케이 (Paul Kay)), 인공지능의 샹크 (Roger Schank) 와 심리학의 아벨슨 (Robert Abelson)) 로서 개념화된다고 주장해 왔다. 이들 이론가들의 개념들은 용어는 다르지만 기저 이론은 매우 유사하다. 즉 하나의 개념은 유목의 구성원들의 전형적인 특성들을 명시하는 것이며 개념에는 필요조건과 충분조건이 없고, 분명한 경계도 없다는 것이다. 따라서 여러분이 어떤 사람에게 새로운 개념을 가르치려 할 때 여러분은 전형적인 사례들에서부터 시작을 한다. 예를 들어 새에 대해 말할 때 새는 날개와 꼬리를 가진 작은 생물이고, 그것은 날며, 둥지에 알을 낳고, 지저귄다고 전형적인 새에 대해 말한다. 그리고서 여러분은 예외적인 사례들에 대해 말을 할 것이다. 로슈 (Eleanor Rosch) 와 그 동료들은 실험을 통해 일상개념들의 사례가 모두 동등하게 대표적인 것은 아님을 보여주었다. 로빈은 전형적인 새인 반면 닭은 그렇지 않다. 따라서 사람들의 반응시간도 그에 따라 적절하게 달라져, 참새를 새라고 판단하는 것이 닭을 새라고 판단하는 것보다 더 빠르다.

전형의 논리는 무엇인가? 비트겐슈타인은 필요, 충분 조건 대신에 준거 (criteria) 에 대해 이야기했다. 민스키는 이에 유사한 생각으로 내장값 (default value) 이란 개념을 사용했다. 이것은 반대 증거가 없다면 용인되는 것으로 취해질 수 있는 한 대상의 특징을 말한다. 예를 들어 새다움의 내장값은 두 날개와 깃, 꼬리와 지저귀는 능력을 갖는 것을 포함한다. 따라서 내가 새에 대해 언급한다면, 여러분은 반대 증거가 없는 한 그것이 이런 특징들을 갖는다고 내장값에 의해 추론할 수 있다. 그 특성들은 필요조건은 아니지만, (어떤 새는 날개가 하나이며, 털이 없고, 꼬리도 없으며, 지저귀지 못할 수도 있다) 전형은 모든 내장값들을 합병하는 하나의 모델로 심적 표상될 수 있다.

아마도 전형에 대해서는 지나치게 강조되어 왔던 것 같다. 이러한 편향을 검토한 것은 최근의 연구관찰로서, 분명히 전형적인 많은 현상들은 실제로는 필요 충분 조건을 갖는 개념들에서도 발생한다는 것이다. 예를 들어 3 이라는 수는 33 보다 더 전형적인 홀수로 판단된다. 전형성 정도에서의 변화나, 전형성에 대한 판단 속도에서의 변화는 어떤 개념이 전형에 의존한다는 것을 보여주기에는 충분하지 못하다. 단 하나의 확실한 증거는 그 변화가 필연성 (필요특성들이 들어 있는가 여부) 에 의해서가 아니라 내장값에 의해 전형을 추론하는 것을 지지한다는 것이다.

일상적인 개념들은 고립되고, 독립적인 대상이 아니라, 서로 관련되어 있다. 그것들의 경계는 부분적으로 그것들이 발생하는 분류법에 의해 설정된다. 어떤 것이 개로 판단되는지 아닌지는 그것이 전형적인 개와 전형적인 고양이, 전형적인 늑대 등과 유사한가에 의존한다. 이러한 생각은 소쉬르 (Saussure, 제 1 장 참조) 의 구조주의로 되돌아간다. 다양한 분류법적인 관계에 대해서는 밀러 (G. Miller) 와 내가 연구하였다. 가장 분명한 관계들은 한 개념이 다른 개념 내에 포함되는 위계적인 관계이다. 즉 카나리아는 새이고, 새는 동물이며, 동물은 생물이라는 식의 관계이다. 밀러와 내가 발견했던 것처럼 다른 관계들은 더 복잡한 것이다. 영어의 공간 전치사를, 예를 들어 <at> 와 <with> 같은 전치사들을 비교하는 것이 좋은 예이다. 우리는 다음과 같이 주장했다 :

그러한 영역들은 종종 어떤 사람이 무엇을 할 수 있는가에 의존한다. 따라서 <의자가 탁자에 있다 (The chair is at the table)> 라는 문장은 의자가 탁자와는 다른 방향을 하고 있다는 경우에 대한 묘사라고 적절하지 않다. 반대의 문장, <탁자가 의자에 있다 (The table is at the chair)> 는 의자 옆에 있는 작은 탁자를 생각하여, 그 탁자가 의자에 앉아 있는 사람과 상호작용하는 영역 내에 포함될 수 있다고 생각하지 않는 한 이상한 문장이다. <메리는 앤에 있다 (Mary is at Anne)> 와 같은 일부 문장들은 비록 한 사람이 다른 사람과 상호작용하는 영역 내에 있을 수 있지만 거의 관용적이 아니다. 그 이유는 두 사람 사이에는 대칭적인 관계가 있고, 영어에는 그 경우에 더 적합한 전치사, <with> 가 있기 때문이다. 의미를 다루는 장에서 나는 심적 어휘집의 조직에 대해 더 상세히 다룰 것이다.

귀납 프로그램

개념의 귀납적 학습을 다룬 초기 컴퓨터 프로그램들 중 하나가 헌트 (Earl Hunt) 와 그 동료들에 의해 1960 년대에 개발되었다. 그것은 개념들이 특성들의 연접이나 선접으로 이루어져 있다고 가정하였다. 그것의 책략은 개념의 긍정적 사례에 초점을 맞추고, 어떤 항목이 그 개념의, 성원으로 범주화 될 수 있는지를 결정하는 나무 분류도식을 설정하는 것이다.

 

그림 13.3 : 개념획득 연구에서 사용되는 재료들

 

그림 13.4 : 그림 13.3의 재료들을 지배하는 개념들에 대해 헌트의 프로그램으로 구성한 결정 나무도식.

그림 13.3 에 있는 모양들이 주어진다면, 그 프로그램은 먼저 그 개념의 긍정적인 사례들과 부정적인 사례들 모두에 공통적인 어떤 특성들이 있는지를 검토하고, 이러한 특성들을 적절하지 않은 것으로 간주하고 이들을 배제한다. 이 그림에는 전체적으로 공통적인 특성이 아무것도 없다. 그 다음에는 긍정적 사례에는 모두 어떤 공통적인 특성들이 있지만 부정적인 사례에는 공통 특성이 없는지를 검토한다. 만약 그렇다면, 어떤 항목이건 이 특성에 대한 결정이 그 항목을 범주화한다. 그림에 나오는 모양들에서는 그러한 특성이 없으며, 따라서 그 프로그램은 다음 단계로 넘어간다. 다음 단계에서 프로그램은 긍정적 사례들에서 빈번하게 나타나는 한 특성을 발견한다. 여러 특성들이 똑같이 빈번하게 발생할 때에는 그 프로그램은 어느 하나를 자의적으로 선택한다. 현재의 경우에서는, 예를 들자면 <크다> 는 특성을 선택하며, 그것을 나무 분류도식의 첫 결정으로 설정한다 (그림 13.4 참조). 그 결정은 그림의 모양들을 두 유목으로 나누고, 이 두 유목들은 각기 그 자체로 다시 세분하여 범주화가 더 되어야 할 문제들로 취급된다. 그리고서 전체 프로그램이 차례로 그 문제들 각각을 해결하기 위해 사용된다. 이러한 절차의 반복 사용은 제 9 장에서 논의했던 뉴월과 사이먼의 일반 문제해결 프로그램의 설계와 유사하다. 최종 결과는 그림 13.4 에서 보이는 결정나무 (decision - tree) 도식이다.

스모크는 부정 사례는 개념에 대해 성급한 판단을 하지 못하게 한다는 것을 관찰했다. 그의 피험자들은 부정 사례를 경험할 때는 긍정 사례만을 학습할 때보다 잘못된 판단을 덜 하였다. 윈스턴은 스모크와 동일한 직관적 생각을 적용하여, 개념획득 프로그램을 고안하였다 .그것은 한 개념에 대한 첫 긍정 사례의 표상을 (적당한 기술적 언어로) 형성함으로써 시작한다. 예를 들어 그림 13.5 의 첫항목이 아치의 사례로 주어지면, 그것은 다음의 가설을 구성한다 :

 

그림 13.5 : 윈스턴의 프로그램에서의 아치를 훈련하기 위한 순서

아치는 상인방 (lintel) 을 떠받치는 오른쪽 기둥과 왼쪽 기둥으로 이루어져 있다.

(보통 그렇듯이 이해를 돕기 위해 나는 그 프로그램의 통사를 무시하겠다.) 다음에 학습을 용이하게 만들기 위해 고안된 순서에 따라 도와주는 선생 (teacher) 이 긍정적 사례들과 부정적 사례들을 제시한다. 따라서 그림에 나오는 두 번째 항목은 <조그만 차이로 틀린 것 (near miss)> 이 된다. 즉 목표개념에 충분히 근접해 있어서 정보적이라 할 수 있는  부정사례이다. 그 프로그램은 조그만 차이로 틀린 것의 예를 활용하여 현재의 가설을 조정한다. 만약에 그 가설이 조그만 차이로 틀린 것에서 결여되어 있는 관계를 포함한다면, 이 관계는 그 목표개념에 필요한 부분으로 지적된다. 그러므로 위 예에서 기둥들은 상인방을 떠받치고 있어야만 한다. 반대로 만약에 부정 사례가 그림의 세 번째 항목에서처럼 그 가설에서 빠져 있는 관계를 포함하고 있다면, 이 관계는 그 개념의 요소로 도입되는 것이 금지되어야 하는 것으로 정한다. 즉 위의 예에서 두 기둥은 서로 맞닿아 있어서는 안된다. 어떤 긍정 사례는 현재의 가설과 일치하지 않는 어떤 것을 포함할 수도 있다. 예를 들어 (가설에서는 직사각형 벽돌의 상인방을 함의 했지만) 그리의 네 번째 항목은 상인방으로 직사각형 벽돌을 갖고 있지 않다. 만약 두 긍정 사례 항목들이 공통된 상위 범주 개념을 갖는다면 이 상위 범주 개념은 원래 가설에 있던 용어를 대체한다. 그렇지 않으면 두 긍정 사례들 내용의 선접이어야만 한다 (<직사각형벽돌 상인방이나 쐐기 상인방을 떠받치는> 것들의 선접이어야 한다). 그러나 만약 그 세상에는 벽돌과 쐐기모양들만 있다면 상인방이 벽돌이거나 쐐기모양이어야만 한다는 것을 명시할 필요는 없다.

윈스턴의 프로그램은 도움되는 순서로 사례들을 제시하는 선생에 의존하고 있다. 마이칼스키와 그 동료들에 의해 개발된 더 강력한 절차는 사례들의 총집합에서 사례의 순서를 프로그램 스스로 선택한다는 것이다. 이러한 접근에 기초한 프로그램은 이전에 파악된 수많은 사례들로부터 콩의 질병 특징에 대한 서술을 도출해 내었으며, 인간 전문가를 능가하는 진단을 하였다.

지식과 확률적 판단

촘스키 (N. Chomsky) 와 같은 몇몇 이론가들은 일반적인 귀납절차란 없으며, 단지 특정 영역에 대한 생득적인 지식에 근거한 절차들만이 있을 뿐이라고 제안하였다. 확실히, 귀납에 가해지는 제약조건들은 주로 현재 다루고 잇는 특수한 영역에 대한 지식에서 비롯된다. 여러분이 만드는 대부분의 추론은 제시된 정보를 넘어서 이루어지며, 여러분의 배경지식을 이용하기 때문에 그것을 플레밍의 박테리아 파괴에 대한 추론 같은 것이다. 이 문제는 사람들로 하여금 그들에게 별로 지식이 없는 문제를 판단하도록 요구하면 쉽게 드러난다. 예를 들어 내가 실에 공을 매달고서 그것을 수평으로 회전시킨다고 하자 줄이 딱 끊어진다. 그러면 공의 궤도는 그 후에 어떻게 될 것인가? 뉴턴의 법칙을 모르는 사람들은 다음과 같이 말할 것이다 : , 그것은 나선적으로 움직이다가 점점 똑바로 된다.> 그들은 움직이는 물체가 지니고 있다고 생각되는 운동량에 대해 거의 중세적인 생각에 의존하는 것이다. 중력을 무시한다면 옳은 답은 그 공이 직선적으로 움직인다는 것이다 (제 11 장 참조).

속성들의 변이성에 대한 지식은 귀납에서는 결정적으로 중요하다. 니스벳 (Richard Nibett) 과 그 동료들이 보여주었듯이, 한 희귀한 화학성분의 단 한의 표본이 전기에 전도한다면, 우리는 어떤 표본이든 전기를 전도할 것이라고 결론을 내리기 쉽다. 그러나 어떤 (외국) 종족의 한 사람이 뚱뚱하다면, 우리가 그 종족의 모든 사람이 뚱뚱하다고 일반화할 가능성은 훨씬 적다. 화학적인 요소들의 속성은 뚱뚱함과 같은 속성보다 변이성이 아주 적다는 것을 알기 때문이다.

변이성에 대한 개념을 완전히 이해하기 위해서는 확률 이론에 대한 지식을 가져야 한다. 확률 이론은 변이성에 대한 직관적인 옛 생각과는 매우 다르다. 그래서, 이러한 문제에 대해 언급한 사람 중의 한 사람인 해킹 (Ian Hacking) 은 고대 사람들이 확률이론으로 무장을 하고 주사위놀이를 했더라면 갈리아 전지역을 차지했을 것이라고 지적했다. 트버스키 (Amos Tversky) 와 카네만 (Daniel Kahneman) 은 일련의 권위 있는 연구를 통해서, 사람들이 확률이 어떻게 작용하는가에 대한 무지 때문에 터무니 없는 판단오류를 범한다는 것을 보여주었다. 트버스키와 카네만의 연구 결과의 문제점은 초보자는 물론이지만 세련된 수준의 전문가에게서도 발생한다는 것이다. 여기에 그런 현상의 한 예가 있다 :

문제 1. 어떤 것이 보다 빈번한가 : <R> 로 시작하는 단어인가 아니면 <R> 이 세 번째 글자로 들어 있는 단어인가? 대부분의 사람들은 <R> 로 시작하는 단어라고 대답한다. 그러나 그 답은 틀리다.

문제 2. 한 집단의 피험자들에게 다음의 계산 결과를 물어보자 : 1 × 2 × 3 × 4 × 5 × 6 × 7 × 8. 그들의 추정치는 512 라는 값 가까이에 몰려 있을 것이다. 또 다른 집단에게 8 × 7 × 6 × 5 × 4 × 3 × 2 × 1 의 계산 결과를 물어보자. 그들의 추정치는 2,250 이라는 값 가까이에 몰려 있을 것이다. 두 추정치는 모두 너무 작다. 맞는 답은 40,320 이다.

트버스키와 카네만은 사람들이 정보의 가용성 (availability) 에 의해 편향되어 있다고 논의한다. <R> 로 시작하는 단어를 생각하는 것이 세 번째 글자가 <R> 인 단어를 생각하는 것보다 쉽다. 이는 아마도 심적 어휘집 (mental lexicon) 이 주로 첫 문자에 의해 구조화되어 있기 때문일 것이다. 이 차이가 빈도의 추정치에 영향을 줄 것이다. 비슷하게 피험자는  1 × 2 × 3 × …… 의 순으로 계산을 시작하고 여기까지의 계산의 답은 전체 결과가 그리 크지 않으리라는 것을 시사한다. 반면 8 × 7 × 6 × …… 를 계산하는 사람은 빨리 어떤 큰 수에 도달한다. 두 집단 모두 계산의 기하급수적인 증가를 인지하는 데 실패한다는 것이다.

문제 3. 여러분이 룰레트놀이를 하고 있고, 그 결과를 관찰한다고 해보자. 빨강 빨강 빨강 빨강 빨강 빨강. 다음에는 어떤 색깔이라고 걸어야 하겠는가?  <도박꾼의 오류> 는 검은색에 거는 것이다. 검은색은 확률적인 균형을 맞추기 위해 곧 나타나야만 할 것이기 때문이다. 즉 빨강과 검정의 비율이 동등하게 나타나는 것이 무작위적인 과정을 더 잘 대표해준다고 생각하기 때문이다. 그러나 사실상 진정한 무선적 과정의 결과는 서로 서로 독립적이다. 빨강이 일어날 확률이 0.5 인 것은 룰레트를 돌릴 때마다 변화하지 않는다. 따라서 내기에 이길 수 있는 유일한 방법은 (어떤 숫자들에서 맞는지 그 빈도를 통계적으로 검증함으로써) 다른 숫자들보다 어떤 숫자들 쪽으로 기울어진 회전판의 편중을 탐지하는 것이다. 편중이 있다고 할지라도, 그것을 발견하려면 불행히도 오랜 시간이 걸릴 수 있고, 카지노 주인들은 미리 주의하여 한 판에서 다음 판으로 갈 때 회전판을 바꾸는 식의 운영을 한다.

문제 4. 어떤 마을에 두 개의 병원이 있고, 그중 하나는 큰 병원으로 매일 약 45 명의 아이가 출생하고, 다른 병원은 작고 매일 약 15 명의 아기가 출생한다고 하자. 남아와 여아의 비율이 동일할 것이라고 가정한다면, 60 퍼센트 이상의 아기가 남아로 출생하는 날짜의 수는 두 병원간에 차이가 있을 것인가?

대부분의 사람들은 아니라고 대답한다. 그러나 사실상 작은 병원에서는 약 두 배 정도 더 빈번하게 그러한 결과가 발생하는 것 같다. 두 병원의 하루 출생수는 전체 모집단 숫자로부터 나온 표본들이지만, 작은 표본은 보다 더 우연적인 변동에 영향을 받으며, 따라서 남아 출생률의 참값인 50 퍼센트에서 종종 멀어진다. 소크라테스가 말했던 것처럼, 여러분은 처음부터 그것을 알고 있었다고 할지 모른다. 단지 두 병원이 전인구의 남녀 비율을 똑같이 잘 대표하는 것으로 보여졌던 것이라고 할 것이다.

대표성은 사례의 전형성이나, 사례가 원형의 가까운 정도와 같다고 하겠다. 그것은 다음의 예에서처럼 더욱 놀라운 효과를 가져올 수 있다.

문제 5. 빌은 34 세이다. 그는 지적이지만, 상상력은 없고, 강박적이며, 일반적으로 생동감이 없다. 학교에서 그는 수학에는 강했지만, 사회과목과 인문과목들은 잘 하지 못했다. 여러분은 다음의 각 명제들에 대해 어떻게 평정할 것인가 (7 점 척도 상에서의 평정임) ?

트버스키와 카네만의 피험자들은 이들 중 두 번째 주장이 마지막 주장보다 더 가능성 있다고 평정했다. 그러나 이는 두 개의 상태가 연접되어있는 것 (회계사인 동시에 재즈를 연주하는 것) 이 그것들 중 하나만 있는 것 (재즈를 연주하는 것) 보다 가능성이 더 클 수는 없다는 확률적 원리를 정면으로 위배한다. 물론 빌에 대한 묘사는 재즈 연주자보다는 회계원을 더 잘 나타낸다. 따라서 두 속성들에 대한 연접은 이 두 극단 사이에 놓여 있다고 생각할 수 있고, 거의 90퍼센트의 피험자들이 그러한 판단을 내렸다. 대표성이 확률법칙을 뒤엎은 것이다. 구매자들이 경계해야 할 것이 바로 이것이다. 즉 어떤 예언을 할 때 세부내용 기술을 덧붙이는 것은 그 예언이 사실인 것 같은 박진감은 첨가해 주지만, 그 예언이 실제적으로 참일 확률은 오히려 감소시킨다는 것이다.

트버스키와 카네만은 확률에 대한 사고과정의 설명을 제안했다. 구성은 내가 이전 장에서 제시했던 심적 모델에 의한 추리 설명과 잘 연결된다. 그들은 다음과 같이 기술하고 있다 :

어떤 사건들은 매우 독특한 것으로 지각되기 때문에, 과거사가 그 사건이 일어날 가능성의 평가에 적절한 것처럼 보이지 않는다. 그러한 사건들을 생각할 때에 우리는 종종 시나리오, 즉 현상황에서 그 목표 사건으로 전개되는 이야기들을 구성한다. 따라서 시나리오가 마음에 떠오를 가능성이나 시나리오 산출의 어려움이 사건의 발생가능성에 대한 단서로 작용한다. 만약에 어떤 합리적인 시나리오가 마음에 떠오르지 않는다면, 그 사건은 불가능하거나 일어날 가능성이 아주 희박해 보인다. 만약 많은 시나리오들이 마음에 떠오르거나, 아니면 마음에 떠오른 한 시나리오가 특히 강력한 것이라면, 문제의 그 사건은 발생 가능한 것으로 여겨진다.

읽을거리

플래밍의 페니실린 발견은 맥팔레인 (MacFarlane, 1984)  에 의해 자세히 이야기되었다. 블랙 (Black, 1967) 은 귀납을 철학적으로 논의한다. 귀납에 대한 심리학적인 설명은 니스벳과 로스 (Ross, 1980), 홀리요크 (Holyoak) 와 니스벳 (1987) 이 논의하며, 귀납에 대한 프로그램은 헤이스 로스 (Hayes - Roth) 와 맥더못 (McDermott) (1978), 마이칼스키, 카보넬 (Carbonell), 미첼 (Mitchell) (1983, 1986) 그리고 홀랜드 (Holland), 홀리요크, 니스벳, 타가드 (Thagard) (1986) 에서 제시되고 있다. 스미스 (Smith)와 메딘 (Medin) (1981) 은 개념에 대한 심리학적 연구들을 개관한다. 암스트롱 (Armstrong) 과 글라이트만 부부 (Gleitman & Gleitman) (1983) 는 홀수에 대해서도 <원형적> 인 판단이 일어난다는 결과를 보고했다. 카일은 소머스 (Sommers, 1959) 로부터 아동들의 분류법에 대한 제약조건을 유도해 내었다. 문외한의 물리학에 대한 연구들의 선집은 겐트너 (Gentner) 와 스티븐스 (Stevens) (1983) 가 편집한「 심적 모델 (mental model) 」로서, 회전하는 대상들의 궤도에 대한 예언을 다룬 매클로스키 (McCloskey) 의 연구가 소개된다. 트버스키와 카네만의 주요 논문은 카네만, 슬로빅 (Slovic), 트버스키 (1982) 에 포함되어 있다.