병렬분산처리
(Parallel distributed processing)
컴퓨터와 마음 : Philip N. Johnson-Laird 지음, 이정모. 조혜자 옮김, 민음사, 1991, Page 206~230 (원서 : The Computer and the Mind: An Introduction to Cognitive Science, Harvard Univ. Press, 1988)
심적 구조에 대한 최신의 그리고 혁명적인 착상은, 때로는 <연결주의 (connectionism)>로, 때로는 <병렬분산처리 (parallel distributed processing)> 로 불리는 것이다. 산출체계의 이론과는 달리 이 이론은 분명한 구조를 가진 규칙들을 사용하지 않는다. 그리고 이 이론에서 기억은 특정 내용들을 각각 담는 많은 칸들의 집합과 같은 것으로 설명되지 않는다. 대신에 홀로그램 (hologram) 처럼, 한 경험에 대한 장기기억은 많은 처리 단위들에 걸쳐 분산되고, 이 단위들 각각은 여러 경험들을 표상하는 데 참여한다고 본다. 이것은 앞으로 이야기가 진행되면서 더 분명해질 것이다. 이 체계의 처리 단위들은 (실제로 뇌세포가 아니라 이론적으로) 이상화시킨 (idealized) 뇌세포들과 어느 정도 비슷하다. 처리 단위들은 동일한 단순 계산만을 수행할 수 있다. 이 체계의 힘은 단위들이 연결되는 방식에서부터 비롯된다. 이 체계의 주요 특징들 중 하나는 학습하는 능력인데 이것을 여기서 탐색해 보려 한다.
인간 기억의 목표와 컴퓨터 기억의 목표와의 차이는 수행해서 나타나는 차이처럼 두드러지지는 않는다. 컴퓨터는 결코 망각하지 않는다. 컴퓨터가 고장났거나, 여러분이 스위치를 끄거나, 아니면 여러분이 망각하도록 프로그램하는 등의 경우를 제외하고는 컴퓨터 기억의 내용들은 궁극적으로는 지시들에 의해서만 접근된다. 그 지시들은 숫자로 된 주소를 가지고 있고, 그 주소에서 나온 자료들을 중앙 처리기로 복사해 준다. 인간의 기억은 때때로 착오와 결점이 있기는 하지만, 우리가 너무 친숙해서 거의 깨닫지 못하는 뛰어난 능력을 지니고 있다 : 즉 하나의 일이 다른 일을 생각하게 하는 것이다. 이런 능력의 미묘함을 보기 위해 하나의 게임을 해보자.
나는 어떤 사물을 생각하고 있고, 그리고 여러분에게 그것에 대한 몇가지 단서들을 제공하려고 한다. 여러분의 과제는 될 수 있는 한 빨리 그 사물이 무엇인지를 추측하는 것이다 :
그것은 항해도구이다.
그것은 나침반이 아니다.
그것은 태양의 각도나 수평선 위의 다른 천체의 각도를 측정하는 데 사용된다.
그것은 여러분의 지리적인 위치를 결정할 수 있게 한다.
그것은 망원경과, 삼각대, 거울을 포함한다.
이제 여러분의 마음 상태는 세 가지 중 하나일 것이다. 여러분은 그 사물이 무엇인지를 파악했거나, 또는 그것이 무엇인지에 대한 생각이 자신에게는 전혀 없다는 것을 알거나, 아니면 그 이름이 <입끝> 에서 뱅뱅 돌거나 할 것이다. 마지막 경우라면 여러분은 그 단어가 몇 개의 음절로 이루어져 있는지 (두 음절), 또는 그 첫 자음이 무엇인지 (<S>) 를 말할 수 있을지 모른다. 그리고 의미가 비슷한 한두 단어들 (<theodolite, 경위의>) 이나, 소리가 비슷한 단어들 (<sexton, 교회의 사찰>), 또는 의미와 소리 모두가 비슷한 단어들 (<secant, 분할선>) 을 떠올릴런지도 모른다. 나는 sextant (육분의) 를 생각하고 있었다. 여러분은 한두 단서가 제시된 후에는 그 묘사가 불완전할지라도 맞는 사물을 생각했을 수가 있다. 여러분은 내가 잘못된 단서를 집어 넣었어도 그것을 극복할 수 있었던 것이다. 어쨌든 여러분은 기억에서 제약조건들에 맞는 한 항목을 인출한다. 여러분의 의식적인 자각 없이 작용하는 이러한 인출체계는 우편함 같은 칸들로 이루어진 기억의 내용을 하나씩 검토하는 것 같지는 않다. 만약에 그런 식으로 인출이 행해진다면, 한 번도 들어본 적이 없는 사물이라는 결정을 내릴 때에는 정말로 많은 시간이 걸릴 것이다.
그림 10.1 은 린제이 (Peter Lindsay) 와 노만 (Don Norman) 에 의해 고안된 것으로, 한 단어가 잉크 반점에 의해 부분적으로 지워진 것을 보여준다. 그 단어는 무엇인가? 여러분은 즉시 그것이 <RED> 라고 깨달을 것이다. 이 경우에 여러분의 기억은 재구성적인 방식으로 작용할 것이다. 첫 번째 글자는 <K> 나 <R> 일 수 있고, 두 번째 글자는 E 나 F 일 수 있으며, 세 번째 글자는 <B> 나 <D> 일 수 있다. 따라서 여덟 개의 각기 다른 글자 배열이 가능하다. 그러나 그러한 8 가지 배열 중 단 하나만 영어 단어이다. 여러분은 냉정하게 각각의 가능성을 모두 고려하지는 않았을 것이다. 다시 말해, 인출체계는 자동적으로 별개의 제약조건들에 대처하여, 그것들과 부합되는 하나의 항목을 인출하는 것이다.
그림 10.1 : 잉크 반점에 의해 부분적으로 지워진 이 단어는 무슨 단어인가?
(After P. Lindsay and D. Norman, Human Information Processing. First edition,
New York : Academic Press, 1972, p. 142)
인쇄된 단어들을 재인하는 인간 인출체계의 효율성을 우리는 어떻게 설명할 수 있는가? 하나의 가설은 단서들이 기억의 모든 내용과 동시적으로 부합될 수 있다는 것으로, 이는 계산기용 구멍 뚫린 카드의 꾸러미에 뜨개질 바늘들을 동시에 찌르는 것에 비교할 수 있다. 더 나은 이론이 매클리랜드 (Jay McClelland) 와 러멜하트 (Dave Rumelhart) 에 의해 제안되었다. 그들은 가능한 각 단어가 각각 분리된 별개의 처리 단위로 표상된다고 가정하였다. 그리고 그와 마찬가지로 한 단어 내의 각 위치에 있는 각 글자도 별개의 단위로 표상된다는 것이다. 단위들은 소규모의 처리기로서, 서로 연결되며 병렬적으로 계산을 한다. 단위들은 각각 특정 활동수준을 가지며, 그 활동수준은 매순간 달라질 수 있다. 활동수준은 한 단위가 표상하는 항목에 대해 현재 얼마나 많은 지지가 있는가와 관련된다. 어떤 단위들 쌓은 상호 지지 가능성을 나타낸다. 예를 들어 그 단어의 첫 글자가 <R> 일 가능성과, 전체적으로 그 단어는 <RED> 가 될 가능성이다. 그러한 단위 쌍들은 서로 서로 흥분시키도록 묶여 있어, 하나의 단위가 활성화되면 그것은 다른 단위의 활동수준을 증가시킨다. 어떤 단위들 쌍은 비일관성의 가능성을 나타낸다. 예를 들어 그 단어의 첫 글자는 <R> 일 가능성과, 그 단어의 첫 글자는 <B> 일 가능성이다. 그러한 단위 쌍들은 서로를 억제하도록 묶여 있다 : 즉 한 단위가 활성화되면 그것은 다른 단위의 활동수준을 감소시킨다.
전체적인 디자인의 일부분이 그림 10.2 에서 보여진다. 이해하기 쉽게 하기 위해, 동일수준의 단위들간에 있는 억제적인 연결들을 포함하여 대부분의 연결들은 묘사되지 않았다. 단어수준과 글자수준들 간의 연결은 흥분적이거나 억제적이다. 이러한 흥분이나 억제는 그것들이 나타내는 항목들이 상호 일관성이 있는지 비일관적인지에 의존한다. 세 번째 단위 수준은 수평선이나 수직선과 같은 글자들의 부분을 나타내며, 글자들을 나타내는 단위들을 흥분시키거나 억제한다.

그림 10.2 : 매클리랜드와 러멜하트가 고안한 단어 재인 장치의 일부, 화살표는 활성적 연결에 해당하고, 매듭점은 억제적 연결에 해당한다.
이 이론은 우리가 잉크 반점에 의해 부분적으로 지워진 단어들을 어떻게 지각하는지를 설명한다. 그림 10.1 의 경우에서 <RED> 라는 단어를 나타내는 단위는 첫 위치의 <R>, 두 번째 위치의 <E>, 세 번째 위치의 <D> 를 나타내는 단위들에 의해 흥분될 것이다. 비록 예를 들어 첫 위치의 글자가 <K> 일 수 있는 가능성 때문에 다른 단어들도 약하게 흥분될 수 있지만, 어떤 단어도 <RED> 만큼 강하게 활성화되지 않을 것이다. <RED> 를 나타내는 단위의 흥분은 개별 글자들을 나타내는 단위들을 다시 활성화시킬 것이고 ; 개별 글자 단위들은 그 단어를 더 흥분시키고, 이러한 반복적인 흥분은 단어의 단위가 재인가능 (그 단어를 파악하는) 역치 (threshold)에 도달할 만큼 충분히 활성화될 때까지 계속될 것이다.
여러 실험들은 단어 사이에 끼어 있는 글자를 재인 (파악) 하는 것이 무의미 철자 사이에 있는 글자 재인보다 더 쉽다는 것을 보여주었다. 예를 들어 <K> 라는 글자가,
ANKLE
에서 나오는 것이,
XMKTF
속에서 나오는 것보다 재인하기가 더 쉽다는 것이다. 병렬처리이론은 이러한 현상을 설명해 준다. 이 현상은 <ANKLE> 이라는 단어를 나타내는 단위가 그것을 구성하고 있는 글자들 (<K> 를 포함해) 의 표상단위들을 다시 활성화시키기 때문에 발생한다. 그러나 무의미 철자에서는 그와 같은 되먹임 (피드백) 처리가 일어나지 않는데, 그 이유는 그것이 단어가 아니어서 어떤 처리 단위로도 전체가 표상되지 않기 때문이다.
병렬처리에서는 숫자로 된 주소 (address) 를 갖는 칸들 대신에, 재인되어야 할 단어의 실제 구성요소들에 의해 지시되는 활성적 단위들로 구성된다. 이러한 배열체계는 인간 기억에 한걸음 가까이 가는 것같이 보인다. 그러나 그 상호관련체계는 처음에 어떻게 설정되는가? 그리고 각 단어와 글자, 글자의 부분이 기억 내에서 각각 별개의 국소적인 칸들을 갖는 것은 필요한가? 다음 절에서는 어떻게 단어와 글자, 글자의 부분들에 대한 표상이 많은 기억단위들에 걸쳐 분산될 수 있으며, 기억단위들 각각은 많은 항목들을 표상하게 되는가를 볼 것이다. 앤더슨 (James Anderson) 과 힌턴 (Geoff Hinton), 코호넨 (Tuevo Kohonen) 등 많은 이론가들에게서 비롯된 이러한 생각은, 기억 내의 연결들이 어떻게 학습될 수 있는지에 대한 하나의 설명을 제시할 길을 마련해 줄 것이다.
두 개의 처리단위들 집합이 연결되어 있어서 하나의 집합이 특정 활동 패턴으로 자극받으면 다른 집합은 어떤 적절한 활동 패턴으로 반응할 것이라고 가정해 보자. 예를 들어, 인쇄된 단어 <red> 를 표상하는 패턴이 하나의 단위들 집합에 제공되면, 그 단어의 소리에 대응하는 패턴이 다른 단위들 집합에 의해 산출될 것이다. 각각의 단위가 활동 (+1), 중립 (0) 또는 억제 (-1)의 세 활동 수준 중 한 수준에 있을 수 있다고 가정해야 한다. 이러한 구성은 단어들을 표상하기에는 너무 초보적인 것처럼 보일 것이다. 그러나 우리는 이진 숫자들 (0 이나 1) 의 배열로도 거의 모든 것을 표상할 수 있기 때문에, 이러한 삼진법 (ternary notation) 으로도 표상을 잘할 수 있을 것이다. 그러나 그러한 부호체계들만으로는 표상되는 항목 내에서 무엇이 가장 중요한지를 분명히 알 수가 없다.
패턴들간의 연합은 세 단계로 설정될 수 있다. 첫 번째 단계는 두 단위들 집합 사이에 연결 강도를 설정하는 것이다 (독자는 이 개념이 단위들의 활동수준 개념과는 다르다는 것을 염두에 두어야 한다). 우리는 배선도로 연결 강도를 나타낼 수 있다. 아니면 각 배열을 사용하여 각 열은 한 집합 내의 한 단위를 나타내고 각 행은 다른 집합 내의 한 단위를 나타내며, 열과 행이 상호 교차하는 칸은 두 단위들간의 연결강도를 나타내어 연결강도를 표상할 수 있다. 실제로는 많은 단위들이 있을 것이지만 그 체계들의 모든 원리들은 각 집합 내에 두 단위를 갖는 작은 크기의 보기로 기술될 수 있다 :
|
시각 단위들 |
|
|
|
|
|
청각 단위들 |
|
|
|
|
두 단위들간의 연결 강도는 양 방향에서 같다. 매클리랜드와 러멜하트처럼 우리는 그 강도가 흥분, 중립, 억제일 수 있다고 가정할 것이다 ; 따라서 그 강도는 +1 과 -1 사이의 어떤 값을 가질 수 있다. 하나의 단위는 자신의 활성화값에 연결 강도를 곱한 활성화값을 다른 단위로 전달한다 : 예를 들어 어떤 활성적인 단위 (+1) 가 다른 단위와 -0.5 의 억제적인 연결강도를 가질 때, 다른 단위로 전달하는 값은 -0.5 이다.
두 번째 단계는, 한 단위의 활성화 수준은 다른 단위들로부터 받는 모든 활성화값들의 합이라는 원리를 구현화하는 것이다. 우리는 이 원리를 연결 강도들의 집합에 사용할 수 있다. 예를 들면 시각 패턴 +1 -1 은 자동적으로 청각 패턴 -1 -1 을 산출하고, 또 역으로 청각 패턴이 시각 패턴은 산출할 수도 있다. 그러한 연합을 형성하는 연결강도들은 다음과 같다 :
|
시각 단위들 |
|
|
|
|
+1 -1 |
|
|
|
|
-.5 |
.5 |
-1 -1 |
청각 단위들 |
|
-.5 |
.5 |
||
윗열에 있는 청각단위를 고려해 보자. 그 활동수준은 그것이 각 시각 단위에서 받는 값 (활성화값 × 연결 강도) 들의 합이다 :
(+1 × -.5) + (-1 × .5)
위의 합은 -1 이다. 아래 열의 청각단위의 활성화값도 같은 방식으로 결정된다. 전체 배열은 대칭적이다 : 만약에 청각 패턴이 입력자극이라면, 시각 패턴은 출력이다. 일반적으로 두 단위들간의 연결 강도는 두 단위가 모두 동일 부호의 활성화 수준을 가질 때 양수가 된다 ; 그렇지 않은 경우 그 값은 음수가 된다. 강도값의 수치는 연결의 전체 갯수에 의존한다.
우리는 동일 원리들을 사용하여 다른 패턴의 쌍에 대해서도 연합을 만드는 배열을 구성할 수 있다. 다음의 배열은 시각 패턴 +1 +1 과 청각 패턴 -1 +1 의 연합을 만드는 것이다 :
|
시각 단위들 |
|
|
|
|
+1 +1 |
|
|
|
|
-.5 |
-.5 |
-1 +1 |
청각 단위들 |
|
.5 |
.5 |
||
그리고는 세 번째의 주목할 만한 단계로 온다. 얻어진 두 개의 연결강도 배열들을 함께 더하는 것이다 :
|
시각 단위들 |
|
|
|
|
|
청각 단위들 |
|
|
|
|
이러한 하나의 배열은 두 연합 중 어떤 것이나 만들 수가 있다 : 첫 번째 시각 패턴을 제공하면, 두 번째 청각 패턴을 얻어내고 ; 두 번째 시각 패턴은 제공하면, 두 번째 청각 패턴을 얻어낸다. 두 연합은 단위집합들을 잇는 단일한 연결강도 집합으로 부호화된다. 그 체계는 수학자들이 <선형 (linear)> 이라고 부르는 것이다. 별도로 조작들이, 즉 이 경우에서는 연결강도가 가산적으로 조합될 수 있는 효과를 지니기 때문이다.
하나의 연결 집합으로 표상될 수 있는 연합의 갯수에는 분명히 제한이 있다. 그것은 집합들 중 어느 한 집합에 있는 단위들의 수와 동일하다. 따라서 각 집합에 두 개의 단위가 있다면, 단지 두 개의 연합만이 형성될 수 있다. 그러나 실제 뇌의 신경망은 수백만 개의 연합을 표상할 수 있다. 유사한 입력 패턴들은 유사한 결과를 불러일으키기 때문에, 간섭을 피하는 것이 바람직하다면, 입력 패턴들은 서로 무관해야만 한다 (이러한 견해는 정확한 수학 형식을 갖는다 : 모든 입력 패턴들 쌍은 <직교적 (orthogonal)> 이어야 하는 것이다. 즉 그 쌍의 교차값 (cross products) 들은 합해서 영이 되어야 한다. 예를 들어 두 개의 입력 자극들 +1 -1 과 +1 +1 에서 교차값의 결과는 (+1 × +1) + (-1 × +1) = 0 이고, 따라서 그 등식은 유지된다).
이런 종류의 대단위 체계에서는 여러 흥미로운 특성들이 나타난다. 이 체계에서는 단일 단위의 활동은 비교적 중요하지 않다. 만약에 하나의 단위가 기능을 못하거나 파괴된다고 해도, 그 체계는 심하게 손상되지는 않을 것이다. 비슷하게 만약 어떤 입력자극의 조그만 일부가 결여되어 있거나 지워져 있다 해도 그 체계는 여전히 정확한 결과를 산출할 수 있다. 만약 각 입력자극이 그 자체와 연합하는 것에 기초하여 하나의 배열이 이루어진다면, 손실된 부분들이 있는 조각난 입력자극도 복구할 수 있을 것이다. 이러한 체계에서는 숫자 주소들은 입력자극의 상징들 자체가 기억의 내용을 지시하는 체계로 대치된다. 그와 같은 식의 기억은 회상과 재구성, 완전히 지어낸 이야기 사이에 경계가 애매해진다.
이러한 기억 범주들 사이의 경계의 애매성은 인간의 회상 현상과 유사하다. 1930 년대에 바틀렛 경 (Sir Frederic Bartlett) 은 사람들이 이야기들을 재구성하여 기억한다는 것을 관찰했다. 사람들은 자신의 관심에 따라 어떤 점들은 강조하고 어떤 점들은 생략한다. 사람들은 깨닫지 못하면서 빠진 부분을 재구성하기 위해 그럴 듯한 추론을 만든다. 똑같은 현상이 실생활의 사건들에게도 일어난다. 나이서 (Ulric Neisser) 는 그것을 그의 독창적인 연구에서 보여주었다. 그는 워터게이트 스캔들을 주도한 존 딘 (John Dean) 의 사건 증언을 백악관에서 만든 테이프들의 사본과 비교하였다. 비교 결과, 딘은 과거에 했던 대화들의 요지는 정확히 회상했지만, 어떤 대화가 어떤 일화들과 관련되는지를 정확히 연결시킬 수 없었다. 그의 기억에서는 관련된 많은 논의들이 하나의 단일 조합체로 합쳐져 나타났다. 이는 마치 전반적으로는 정확하지만 세부사항들은 희미하고 때로는 잘못되어 있는 동일 인물에 대한 이중 인화 사진들 같았다.
요지는 기억하는 능력은 우리가 이전에 보았던 것을 재인하는 놀라운 능력에서 반영된다. 스탠딩 (Lionel Standing) 은 이러한 능력을 실험적으로 측정했다. 그는 적은 집단의 사람들에게 만 장의 사진을 5 초에 하나씩 제시해 주었다. 그리고 나서, 그는 사진쌍들을 제시하고 앞서 본 것을 고르게 하는 검사를 하였다. 사진쌍 중 하나는 원래의 사진에서 나온 것이고, 다른 하나는 제세되지 않았던 유사한 사진들 중에서 나온 것이었다. 이틀이 지난 후에도 사람들은 두 사진들 중 어느 것이 전에 보았던 것인지를 80 퍼센트 정도 정확하게 골라낼 수 있었다.
어떻게 경험의 결과로 적절한 연결 강도들이 학습될 수 있을까? 이러한 물음은 거의 연합학습의 개념만큼이나 오래된 것이다. 이 물음의 현대판은 신경세포들과 유사한 단위의 망체계적 특성에 대한 첫 연구로 거슬러 올라간다. 이 분야의 선구자인 헵 (Donald Hebb) 은 단순한 학습의 원리를 제안하였다 : 즉 두 개의 연결된 단위들이 동시에 활성화될 때는 언제나 그것들간의 연결강도가 증가한다는 것이다. 또 다른 선구자인 로젠블라트 (Frank Rosenblatt) 는 <퍼셉트론 (perceptron)> 이라고 부르는 장치를 사용하여 패턴들이 파악될 수 있다고 제안했다. 그것은 인공망막으로 이루어진 것으로, 인공망막은 입력단위들의 집합과 연결되고, 입력단위들은 출력단위들과 연결되어 있다. 그 단위들은 하나의 역치를 가지며, 한 단위가 받아들이는 값들의 합이 그 역치를 초과할 때에만 활성화된다.
역치 개념의 도입은 입력자극들이 더 이상 가산적 효과를 갖지 않는 어떤 단위를 만들어낸다 : 즉 한 단위의 활성화가 동일한 양을 반복 첨가함으로써 증가하더라고, 그 집적이 그 단위의 역치를 초과하여 활성화하지 않는다면 아무런 효과가 없다. 그러한 <비선형적> 단위들은 활성화가 재순환 (recycle) 된다면 복잡한 계산은 수행할 수 있다. 그러나 선형적인 단위들의 체계 내에서의 재순환적인 활성화는 사소한 결과들만을 산출한다. 왜냐하면 (행렬대수가 보여주듯이) 동일한 계산이 어떤 다른 선형 망을 통해서 단 한 번의 통과만으로 항상 수행될 수 있기 때문이다.
그림 10.3 은 하나의 단순 퍼셉트론을 제시하고 있다. 그것은 무시할 만한 역치 수준을 가진 두 개의 입력단위에 0.5 의 역치를 갖는 출력단위가 연결되어 있다. 두 입력단위와 출력단위와의 연결강도는 모두 +1 이다. 따라서 만약에 하나의 입력단위가 활성화된다면, 그것은 출력단위에 +1 의 값을 전달할 것이다. 이 값은 출력단위의 역치를 넘으므로 그 단위는 발화할 것이다. 두 개의 입력이 모두 활성화되지 않을 때에만 발화는 실패한다. 이와 같이 그 망체계는 포괄적 선접 (inclusive disjunction) 을 인지한다. 즉 입력단위들 중 어느 것 (이것 또는 저것 아니면 둘다 모두) 이라도 활성화하면 인지한다.

그림 10.3 : 두 입력자극들 중 어떤 것이 (혹은 둘 다) 활성적인 때 그것을 인지하는 퍼셉트론.
로젠블라트는 퍼셉트론이 학습할 수 있도록 하기 위해, 자기 수행에 대해 피드백을 주도록 하는 중요한 착상을 채택하였다 - 즉 오류를 범했을 때 알려주도록 하는 것이었다. 다음의 원리는 퍼셉트론이 역치들과 연결강도의 정확한 자리에 점차적으로 수렴해 갈 수 있도록 하는 것이다 : 만약에 어떤 패턴이 거기 있는데도 퍼셉트론이 그것은 탐지하는 데 실패한다면, 활성화된 단위들에서 나온 모든 연결강도들은 올려지고, 출력단위의 역치는 낮추어진다. 반대로 패턴이 존재하지 않는데도 존재하는 것으로 잘못된 반응을 한다면 활성화된 단위들과 출력단위와의 모든 연결강도는 감소되고, 그 역치는 올려진다. 민스키 (Marvin Minsky) 와 페퍼트 (Seymour Papert) 는 퍼셉트론이 재인할 수 있는 어떤 패턴에 대해서도 이러한 절차가 작용한다는 것을 입증하였다. 그러나 뜻하지 않은 장애가 있다. 퍼셉트론이 재인할 수 있는 패턴들이 있는 것이다. 예를 들어 하나의 입력이나 다른 입력이 활성적일 때는 반응하지만 둘 다 활성적일 때는 반응하지 않는 경우인 배타적 선접 (exclusive disjunction) 이 그것이다. 배타적 선접에 반응하도록 하게 하는 역치값과 연결강도들에 대한 값이 그림 10.3 의 망체계나 어떤 다른 퍼셉트론에서도 없는 것이다.
전통적인 연합 이론들의 문제처럼, 퍼셉트론의 문제도 그것들이 입력단위 (자극) 와 출력 단위 (반응) 의 직접적인 연결에 전적으로 의존한다는 것이다. 그것들은 내적 표상을 사용하지 않는다. 바로 그런 이유 때문에 그것들은 배타적 선접이나 다른 복잡한 개념들을 다룰 수 없고, 인간 기억 능력을 설명할 수 없다.
망체계 구조를 고려해 볼 때, 표상의 필요성은 입력과 출력 단위들 사이에 숨겨져 있는 단위들을 도입함으로써 생길 수 있다. 이러한 <숨은> 단위들은 입력의 서로 다른 부분들간의 관계를 표상할 수 있다. 그림 10.3 의 장치에서는 두 입력들이 모두 활성화되어 있을 때 발화가 되는 것을 방지할 수 있어야만 배타적 선접 (두 입력 단위들 중 하나가 활성적일 때는 반응하지만 둘 다 활성적일 때는 반응하지 않는 것) 을 인식할 수 있다. 따라서 두 입력자극들이 모두 발화할 때를 파악하여 그런 경우 출력단위를 억제하는 숨은 단위를 삽입해 볼 수 있다. 그림 10.4 는 그러한 장치를 보여준다. 만약에 입력자극들 중 하나만 활성적이라면 역치가 초과되었기 때문에 출력단위가 발화하지만, 두 입력자극들이 모두 활성적이라면, 숨은 단위가 발화하여, 입력단위들에 의해 생긴 그 흥분을 무효화하도록 충분한 억제를 출력단위에 전달하는 것이다. 따라서 그 장치는 배타적 선접을 인식한다.

그림 10.4 : 두 입력자극들 중 어떤 하나는 활성적이지만 둘 다 활성적이지는
않을 때 그것을 인지하는 <숨은> 단위를 가진 망체계.
(After D.E. Rumelhart, G.E. Hinton and R.J. Williams, Learning internal
representations by error propagation. In D.E. Rumelhart, J.L. McClelland and
the PDP Research Group, Parallel Distributed Processing : Explorations in the
Microstructure of Cognition. Vol. 1 : Foundations. Cambridge, Mass. : Bradford
Books, MIT Press, 1986)
망체계 이론의 선구자들은 숨은 단위를 사용하였지만, 학습을 산출하기 위해 어떻게 연결강도들을 수정해야 하는지는 아무도 알지 못했다. 연결주의가 성취한 것들 중 하나는 이 문제에 대한 해결책을 몇 가지 발견했다는 것이다.
학습을 가능하게 하기 위해 망체계에 숨은 단위들을 설정하는 데는 몇 가지 방식들이 있다. 현재 가장 효율적이라고 볼 수 있는 방법은 <오류 후진전파> 로서, 러멜하트, 힌턴, 윌리암스 (Ron Williams) 에 의해 고안된 것이다. 그 개념은 입력단위는 맨 밑에, 출력 단위는 맨 위층에, 그리고 숨은 단위들은 몇 개건 간에 중간층들에 배열되어 있는 망체계로 이해하는 것이 가장 쉽다. 각각의 단위는 상위층의 단위들과만 연결된다. 따라서 활성화는 망체계를 통해 상향적으로 확산되어 올라간다 (그림 10.4 참조). 하나의 단위는 퍼셉트론에서처럼 실무율적인 (완전히 아니면 영 : all or none) 역치를 갖지는 않지만, 입력의 총 크기를 감소시키는 역치 편중을 갖는다. 그러나 앞에서 언급했듯이 선형단위들은 하찮은 계산만을 수행할 수 있기 때문에, 그 단위는 선형장치가 아니다. 따라서 한 단위의 출력은 그 입력의 합이 증가함에 따라 연속적으로 증가하지만 그 관계는 선형적이 아니다. 따라서 입력 활성화가 일정한 정도 증가하면 입력의 전반적인 크기에 근거해서 여러 다른 크기의 출력에 영향을 미친다.
학습은 세 가지 조작에 근거한다. 첫째는 초기 테스트 단계로, 이 단계에서는 입력 활성화가 망체계의 맨 밑층에 도입되고 이것이 위로 전파되어 올라가 하나의 출력을 산출한다. 둘째, 이러한 출력이 어떤 외부 출처 (또는 선생 (주석 : 목표기준을 제시하는 입력을 <선생> 입력이라 한다.) ) 에 의해 요구된 목표 출력과 비교된다. 만약에 그것들간에 아무런 차이가 없으면 학습은 일어나지 않는다. 만약 어떤 차이가 있다면 오류 신호가 계산된다. 셋째, 하나의 출력단위에 대한 각 연결강도는 그 오류를 줄이는 방향으로 (흥분 또는 억제로), 그리고 그것의 효력에 비례해서 조절된다. 이 절차는 퍼셉트론에서 사용된 원리를 일반화시킨 것이다. 비슷한 조절과정이 한층 아래에서도 일어난다. 일반적으로 숨은 단위의 전체 오류에 대한 기여는 그것의 활성화 수준과, 바로 윗 수준의 각 단위와의 연결강도 (그리고 그 윗수준 단위들과 오류에의 기여도) 에 의존한다. 따라서 오류를 감소하기 위해서, 각 수준에서의 연결강도들을 조절하면서 단위들의 위계를 위에서 아래로 후진적으로 내려오는 작업이 가능하다. 후진전파를 위한 프로그램은 아주 단순하다 (LISP으로 200줄 이하이다). 표 10.1 은 프로그래머들에게 도움을 주기 위한 절차를 요약한 것이다.
예를 들어 배타적 선접을 학습하기 위해서는 숨은 단위들을 가진 망체계가 설정되고 , 임의로 규정된 적은 연결강도들을 가지고 시작된다. 학습의 세 조작은 많은 주기들을 통해 상이한 입력 - 출력 패턴들에 적용되어지며, 전형적으로 그 망체계는 수백의 주기를 거친 후에 문제를 해결하는 연결강도들에 수렴한다. 숨은 단위들의 수가 많아질수록 해결이 발견되는 속도는 더 빠를 것이다. 러멜하트와 그 동료들은 컴퓨터 프로그램들로 학습할 수 있다는 것을 보여주었다. 예를 들어 <T> 와 <C> 라는 글자를 제시된 방향에 관계없이 구별할 수 있었다. 대부분의 문제들에서 <문제 공간> 에 대한 내적 표상은 숨은 단위들에 걸쳐 분산적으로 발전한다.
표 10.1. 오류의 후진전파 : 프로그래머를 위한 요약.
연결강도에 시초의 무선값 (+1 에서 -1 사이의 값) 을 배정한 후 주 함수는 다음 세 개의 주 함수를 불러내며 각 입력 - 출력 쌍을 반복하여 순환 (loop) 한다. 세 개의 주 함수는 활성화를 망으로 상향 전파하는 것, 오류의 계산, 그리고 강도변화의 역 전파이다. 여기에는 다섯 개의 주 계산이 있다.
1. 활성화의 확산에 대해서는 :
한 단위에의 입력 = (활성화들의 합 × 하위층 단위에서의 연결강도) - 식역 (threshold) 편향
한 단위의 식역 편향은 그에 연결되고 항상 활성적인 다른 단위에 의해 형성된다.
2. 출력단위의 오류신호에 대해서는 :
출력 오류 = (목표 - 활성화) 활성화 (1 - 활성화)
여기에서 <목표> 는 출력단위에 연결된 활성화를 가리키는 것이고 <활성화> 는 실제 활성화를 지칭한다.
3. 숨은 단위의 오류 신호에 대해서는 :
숨은 단위 = (각 출력단위에 연결된 연결강도의 합 × 출력단위 오류) 활성화 (1- 활성화)
여기에서 <활성화>는 숨은 단위의 활성화를 지칭한다.
4. 숨은 단위에서부터 출력단위까지의 연결강도의 변화에 대해서는 :
변화 = (학습속도 × 출력오류 × 숨은 단위의 활성화) + (관성의 비율 × 이전의 변화)
여기에서 학습속도는 총체적 변인 (보통 0.3 과 0.7 사이 어느 곳에나 설정된다) 이고, 관성의 비율은 또 다른 총체적 변인 (보통 0.9 정도에서 설정된다) 으로서 변화들을 조정한다.
5. 입력 (또는 하위 수준) 단위에서 숨은 단위까지의 연결 강도에서의 변화에 대해서는 :
변화 = (학습속도 × 숨은 오류 × 하위 단위의 활성화) + (관성의 비율 × 이전의 변화)
식역 편향으로 작용하는 한 단위에서 나온 연결강도는 그 단위의 활성화 = 1 인 경우를 제외하면, 4 나 5 를 계산하기 위해 만들어진다.
그 절차의 한 가능한 결함은 그것이 국소 최소치 (local minimum) 에 고정될 수도 있다는 것이다. 국소 최소치란 강도상에서의 작은 변화들일지라도 실제 최저 오류를 산출하는 값들과는 그 값이 거리가 멀지만, 더 나쁜 결과를 가져오는 (주석 : 최적 결과를 산출하지 못하는) 값이다. 절차는 가장 낮은 지점을 발견하려고 이차원의 표면 주위로 볼 베어링을 움직이는 것과 유사하다. 볼 베어링은 그림 10.5 의 단면도에서 묘사된 것처럼 실제 최소치에는 아주 못 미치는 국소적인 골짜기에 고정되어 버릴 수도 있다. 오류 후진전파법을 사용하지는 않지만 이러한 문제를 해결하는 분산체계가 있다. 그러나 적어도 이제껏 발전되어 왔던 프로그램들에서는 국소 최소치에 고정되는 위험이 아주 심각한 것이라고 입증되지는 않았다.

그림 10.5 : 볼 베어링이 국소적 최저치에 고정되는 표면의 단면도.
오류 후진전파의 강력함에 대한 뛰어난 증거로 세즈노브스키 (Terry Sejnowski) 와 로젠버그 (Charlie Rosenberg) 에 의해 고안된 것을 들 수 있다. 그들의 망체계는 영어 단어들의 정확한 발음을 학습한다. 물론 문제는 영어에는 불규칙 발음이 존재한다는 것이다. 이러한 문제를 해결하는 전형적인 방식은 <gave>, <omen>, <penny> 와 같은 규칙적인 발음들을 다루는 규칙들의 집합을 사용하면서, <have>, <women>, <deny>와 같은 불규칙적인 발음의 단어들 목록을 보충하는 것이다. 망체계는 처음에는 아주 많은 정상적 말소리의 음성 녹음 집합 덩이 (corpus) 로만 훈련받고, 점진적으로 철자 요소들을 말소리의 특징에 맞추어 가면서 병렬분산적인 표상을 만든다. 이러한 특징들은 단어의 소리를 조합하여 구성해 내는 상업용 프로그램에 공급된다 (그러나 프로그램에 대한 기술은 제 17 장 참조).
오류 후진전파는 근본적으로 결정론적이기 때문에, 다른 결과들과의 경쟁에서 보다 우월한 결과들을 산출하게 되는 원리들을 구현해야만 한다. 따라서 그러한 프로그램은 제7장에서 지적했던 신 라마르크 프로그램의 일종이라고 볼 수 있다. 앞에서 말했듯이 그러한 학습 프로그램은 많은 지식이나 지시를 필요로 한다. 하나의 망체계는 아무런 지식이 없이도 시작할 수 있기 때문에 망체계가 학습하는 과정의 비밀은 지시의 성질, 즉 피드백으로 받는 정보의 양에 있는 것이다. 이러한 통찰은 오류 후진전파의 제한점 중 일부를 드러내 준다.
여러분이 스케이트 타는 것을 배울 때에 여러분의 수행은 오류 후진전파로 조절되는가? 아마도 아닐 것이 거의 틀림없다. 넘어지는 것을 통해 여러분이 수행에서 잘못 진행되고 있는 것이 무엇인지에 대한 정보를 충분히 얻을 수는 없다. 그 절차는 <옳다>, <그르다> 는 식의 조야한 판단보다는 좀더 민감한 수행 지표를 필요로 한다.
어떤 과제가 양적인 오류를 정확하게 양적으로 측정한다고 할지라도 여전히 문제는 남을 것이다. 이 절차 (후진전파 절차) 는 입력에서 출력으로 이진 숫자들을 유한히 대응 (mapping) 하는 경우에 실행 가능하며 또 어떤 유한 표본이 충분히 대표적이어서 무리없이 일반화를 할 수 있을 때의 무한 대응하는 경우에 실행 가능하다. 그러나 불행히도 실생활에서 귀납적 일반화는 어떤 유사성이 중요하고 어떤 유사성이 가짜인가에 대한 지식에 의해 인도되어야 한다 (제 13 장 참조). 예를 들어 우리가 하나의 망체계에 이진 숫자들의 쌍들을 제시하여 산수의 원리들을 가르치려 한다고 가정해 보자. 예를 들어 이진 숫자의 하나는 다음과 같이 임의로 선정된 식을 부호화한 것이고,
(15 × 2) + 6
다른 하나는 그 값이라고 하자. 이 체계는 산수 규칙들을 학습할 수 있는 것과 다르다. 그것은 위험부담이 있는 것이다. 왜냐하면 이 산수 영역은 무한한 수의 입력 - 출력 쌍들을 잠재적으로 가지며, 어떠한 보기이건 간에 공통점이 거의 없는 근본적으로 다른 사례들을 포함하고 있을 수 있기 때문이다. 또한 망체계는 입력된 식의 구조에 대한 지식을 갖고 있지 않으며, 서로 다른 산수 조작에서의 우선성이나 중요성에 대한 지식을 갖고 있지 않기 때문이기도 하다. 망체계가 산수를 통달할 수 있는 단 한가지 방법은 유한한 수의 입력 - 출력 쌍만이 가능한 한 영역 내에서 각 산수 조작을 별도로 배우는 것이다.
병렬적으로 연결되고 활동수준만을 전달하는 간단한 처리기들도 복잡한 계산을 수행할 수 있다. 이러한 계산들에서 새로 출현하는 (emergent) 성질들 중 일부는 놀라운 것이며 심리학적으로 그럴 듯한 것이다. 그 체계들은 분명히 구조를 지니고 심적 상징의 조작을 지배하는 규칙들에 좌우된다고 생각되는 과제들을 수행할 수 있다. 그 체계들은 또한 분명한 규칙으로는 설명하기 힘든 현상을 산출할 수도 있다.
예를 들어 하나의 분산적인 표상이 뇌손상 같은 것을 당했을 때 무슨 일이 일어나는지를 고려해 보자. 힌턴은 단어와 그 의미 특징들 간의 분산적인 연합을 설정하였다. 그리고서 그는 그 연합을 만드는 데 사용된 숨은 단위들 중 얼마를 없애 버렸다. 그러자 어떤 특정 단어에 대한 의미를 완전히 상실하는 것이 아니라 여러 단어들의 해석에 오류가 나타났다. 그 오류들 중 많은 것들은, 제시되지 않았던 단어에 적절한 의미 요소들로 이루어져 있었다. 이러한 현상은 어떤 뇌손상의 경우에서 일어나는 <심층 난독증 (deep dyslexia)> 을 생각나게 한다. 콜트하트 (Max Coltheart), 패터슨 (Karalyn Patterson), 마샬 (John Marshall) 은 그러한 환자들에게 한 단어를 읽도록 요구하면 때때로 의미가 관련된 다른 단어로 반응한다는 것을 관찰했다. 예를 들어 <천둥> 이란 단어를 읽도록 하면 그들은 <번개> 라고 말한다는 것이다. 구조적인 규칙에 기초를 둔 한 체계의 손상으로 인해 어떻게 그러한 결과가 초래될 수 있는지는 분명하지 않다. (주석 : 뇌의 정보처리 체계가 병렬적 체계가 아니라면, 그 반대 입장에서의 체계의 손상으로는 그 현상이 제대로 설명되기 어렵다.)
몇몇 연결주의자들은 마음에는 분산적인 표상들만이 존재하는 것 같고, 산출체계의 규칙과 같은 구조적 규칙들은 심적 활동에 아무런 인과적 역할을 담당하지 못하며, 그 규칙들은 고작해야 기저의 실재에 대한 대략적인 기술일 뿐이라고 지적하고 있다. 만약 그들의 주장이 맞다면, 인지과학은 재미없는 학문이 될 것 같다 : 마음이 어떤 과제를 어떻게 수행하는가에 대한 단 하나의 답변은 적절한 연결강도들을 획득한 망체계를 지적하는 것일 것이기 때문이다. 노이만 (Neumann) 이 한때 추측했던 대로, 뇌 자체보다 더 단순한 뇌의 모형은 없을 것이다. 그러나 튜링의 생각에 따르면 어떤 계산 가능한 과정도 구조적인 규칙들에 의해 조절되는 장치인 튜링기계로 계산될 수 있기 때문에 (제 3 장 참조), 산출체계가 대략적인 기술만을 하도록 운명지어져 있지는 않다. 원리적으로 생각하여, 산출체계는 어떤 계산과정도 항상 정확히 설명할 수 있다.
명료함 (explicitness) 의 문제는 가장 중요한 문제이다. 제2장에서 이러한 개념은 절대적인 것이 아니라 최소의 노력을 들여 어떤 과정에 정보가 이용 가능한지 아닌지에 의존하는 것임을 보았다. 내가 럭비시합을 할 때 규칙들에 대한 나의 지식은 분명하지 않지만 많은 경험들에서 합성되어 나온 것이다. 그러나 심판은 규칙들에 대한 분명한 지식을 소유해야만 한다. 이와 같이 한편으로는 어떤 규칙들, 원리들, 그리고 사실들은 의식의 분명한 구조들을 가질 수 있고, 이러한 의식의 내용들은 행동을 지배할 수 있다. 만약에 내가 심판에게 어떤 규칙위반에 대해 벌칙을 묻는다면, 그는 그 규칙을 인출하기 위해 의도적 회상행위를 취할 수 있다. 그의 인출 기제로의 입력자극은 상위 수준의 상징적인 정보이며, 그것은 분명한 상징들을 추가로 산출해 낼 것이다. 다른 한편, 인출시에 의식 밖에서 일어나는 과정들은 병렬분산적인 패턴의 활동일 수 있다. 그것들은 동시적인 많은 사건들에 의존하기 때문에 이 패턴들은 의식에서 분명해질 수가 없다.
따라서 경쟁적인 이론들에 대한 한 해결책은 각기 다른 표상수준들을 설정하는 것이다. 즉 상위 수준에는 분명한 상징들, 하위 수준에는 분산적인 상징 패턴들을 설정하는 것이다. 상위 수준의 구조적인 과정들은 하위수준의 분산적인 과정들로 번역된다. 이것은 LISP 과 같은 상위 수준의 언어로 쓰여진 컴퓨터 프로그램이 궁극적으로는 하위 수준의 기계 부호로 번역되는 것과 같다. 투레츠키 (David Touretzky) 와 힌턴은 어떻게 산출체계가 병렬적인 망체계로 변환이 될 수 있는지를 보여주었다. 하위 수준의 과정들은 상위 수준의 규칙들을 구현한다. 물론 어떤 하위 수준의 과정들은 의식적인 상징 활동이 없이도 발생하며 새로 출현하는 (emergent) 중요한 성질들을 야기시킬 수도 있다. 그러나 가장 중요한 문제는 남아 있다. 마음은 어떤 수준에서 구조적인 규칙들에 의해 조직되는가이다.
연결주의가 당면한 가장 심각한 기술적인 문제는 각기 다른 체계들의 힘 (능력) 을 결정하는 것이다. 우리는 망체계에서 학습이 진행될 수 있는 속도나, 국소 최소치로 떨어져 들어가는 성질이나, 그것들이 학습할 수 있는 과제의 유목들에 대해 비교적 거의 알지 못한다. 그러나 한 가지 점은 확실하다. 어떤 분산적인 학습 절차도 제 7 장에서 언급했던 학습의 제한점들을 지나칠 수는 없다는 것이다. 모든 상상 가능한 과제들이 학습될 수는 없는 것이다. 마찬가지로 병렬주의는 다루기 힘든 문제를 적절한 시간 내에 해결할 수 있는 것으로 마술적으로 전환하지는 못한다. 지수적인 많은 요구조건들을 극복할 수 있는 탐색절차란 없는 것이다.
연결주의 망체계의 구조나 산출체계들에 대한 특정 이론들은 경험적인 검증이 될 수 있다. 문제는 그러한 구조에 기초해서 만들어진 이론들과 대비해서 어떻게 그 구조 자체를 평가하느냐 하는 것이다. 때때로 연결주의자들은 자기들의 망체계는 뇌의 <하드웨어> 에 가깝다고 주장한다. 뇌의 세포들은 느리게 반응하고 빨리 피로하고, 종종 죽는다. 그러나 마음의 활동은 외견상 이에 영향받지 않고 곤란한 상황 아래서도 매끄럽게 계속된다. 이러한 특징은 병렬 망체계에서 그대로 반영되고 있다. 불행히도 뇌세포가 수행하는 계산의 종류가 무엇이든 간에 - 그리고 그 성질은 거의 알려져 있지 않다 ─ 그것들은 망체계 단위들에 의해 만족스러울 만큼 이상화되지는 않는다. 뇌는 최근의 연결주의 제안들 중 어느 것과도 유사한 방식으로 구성되어 있지 않다. 그것은 후진 오류 전달과 같은 어떤 기제를 갖고 있는 것으로 여겨지지는 않는다. 후진 오류 절차와는 달리 뇌는 정확한 반응들을 통해서도 학습할 수 있다 (이전 장에서 묘사된 <멱> 법칙을 참조). 신경과학은 산출체계에 기초를 둔 심적 구조에 대해서보다 연결주의 구조에 대해 더 많은 증거를 제공하는 것은 아니다.
필리쉰 (Z. Pylyshyn) 은 심적 구조는 <인지적 불가입성 (cognitive impenetrability)> 이라는 특성을 가져야만 한다고 제안하였다. 즉 심적 구조는 항상 같은 방식으로 작용해야만 하며 그래서 그것이 산출하는 현상은 믿음이나 목표, 또는 다른 상위 수준의 인지적 측면들에 의해 영향받지 않아야만 한다는 것이다. 그렇다면 한 현상이 마음의 구조에서부터 발생하였을 경우, 생각을 한다는 것이 사고자의 키에 아무런 영향을 주지 않는 것처럼 그 현상에 아무런 영향을 주지 않을 정도로 외적 영향에 대해 강해야 할 것이다. 입체시를 수행하는 단원과 같이, 불가입적으로 보이는 인지체계의 예들이 있기도 하지만, 많은 심적 요소들은 (예 : 작업기억) 평가하기 힘들다. 더욱이 믿음이나 목표, 그리고 다른 상위 수준의 인지적 측면들은 그것 자체가 심적 구조에 의존해야만 하는데, 정의상 그것들은 인지적으로 침입이 가능하다.
연결주의는 폭발적으로 발전하는 상태에 있고, 이론가들은 내부에 루프가 있어 복잡한 계산을 수행할 수 있는 망체계를 탐색하기 시작하였다. 그러나 인지과학에서 연결주의가 차지하는 중요성은 그것이 심리적 현상에 대해 현재 제시하는 설명 때문이 아니라, 우리로 하여금 상징들이 분리된 실체 (단위) 들로 표상될 필요가 없다는 것을 이해하도록 돕기 때문이다. 의식적인 과정들은 상징들의 조작에 의존할 수가 있지만, 무의식적인 과정들이 그와 동일한 종류의 상징들에 대해 다만 겉으로 드러나지 않는 조작을 하는 것은 아닐 것이다. 그렇기보다는 무의식적 과정이란 많은 별개의 경험들이 합쳐져 만들어진 분산적인 표상에 대한 병렬적인 처리과정일 것이다.
읽을거리
연결주의에 대한 개론서는 없다 (1988년 현재). 그러나 연결주의에 대해서는 힌턴과 앤더슨 (1981), 매클리랜드와 러멜하트 (1986), 러멜하트와 매클리랜드 (1986) 가 편집한 책들이 있고, 1985 년 9 권 1 호로 출간된《 인지과학 (Cognitive Science) 》잡지의 특별호가 있다. 선구적인 연구들과 최근의 프로그램들은 본장에서 기술되었다 ; 그 사이 시기 동안 그 주제를 다루어준 중요한 논문이 윌쇼 (Willshaw), 뷴만 (Buneman), 롱겟 히긴스 (Longuet - Higgins) (1969) 에 의해 출판되었다. 연결주의에 대안적으로 국소적 표상을 사용한 접근은 펠트만 (Feldman) 과 발라드 (Ballard)(1982)에 의해 제안되었다. 오류 후진전파는 볼츠만 (Boltzmann) 기계로 알려진 확률적 망체계 (Hinton, Sejnowski, & Ackley, 1986) 와, 지먼과 지먼 (Geman & Geman, 1984) 과, 스몰렌스키 (Smolensky, 1986) 의 <조화 (Harmony)> 이론 등에서 볼 수 있는 다른 유사한 체계들이 오류 후진전파 이론보다 먼저 일어났었다. 핑커 (Pinker) 와 프린스 (Prince) (1987) 는 언어는 구조적인 규칙들에 의존한다는 주장을 방어하면서, 아동이 영어 동사의 과거시제 접미어를 학습하는 양식에 대한 연결주의 모형은 부적절하다는 것을 (숨은 단위가 없는 것이라 할지라도) 보이고 있다. 신경세포들의 성질에 대해선 칸델 (Kandel) 과 슈바르츠 (Schwartz) (1981), 크릭 (Crick) 과 아사누마 (Asanuma) (1986)에 의해 묘사되고 있다. 대형 병렬컴퓨터의 고안은 가브리엘 (Gabriel, 1986) 이 개관한다. <설단> 현상에 대한 실험적 연구는 브라운 (Brown) 과 맥네일 (McNeill) (1966) 에 의해 보고되었다. 무의미 철자 내에 있는 글자보다는 단어 내의 글자들이 더 쉽게 파악된다는 결과는 휠러 (Wheeler, 1970) 를 위시해 많은 연구자들에게서 나왔다.