(Scenes, shapes and images)
컴퓨터와 마음 : Philip N. Johnson-Laird 지음, 이정모. 조혜자 옮김, 민음사, 1991, Page 124~150 (원서 : The Computer and the Mind: An Introduction to Cognitive Science, Harvard Univ. Press, 1988)
우리의 목표는 인간 시각을 이해하고, 만약 가능하다면 로봇 내에 비슷한 체계를 구현하는 것이다. 계산되어야 할 필요가 있는 것은 무엇이 어디에 있는지를 명료히 해주는 삼차원 세상의 상징 표상이다. 여러분은 방으로 걸어 들어가, 그 방에 하나의 책상과 다른 가구들이 있다는 것을 깨닫고, 책상으로 가는 길을 알아낼 수 있다. 여러분이 전에 한번도 그 방에 있어 보지 않았을지라도 이러한 행위를 수행할 수 있다. 여러분의 시각체계는 세 가지 문제들을 해결한다 : 시각체계는 대상의 삼차원적인 모양을 지각하며, 그 모양에 근거하여 대상들 (상징적 표상 내에 있는 무엇) 을 파악하고, 공간적으로 그 대상들의 상대적인 위치 (상징적 표상내에서의 어디) 를 지각한다.
대상들의 모양에 대한 지각과 그들간의 공간적 관계에 대한 지각은 두 개의 독립적인 과제가 아니라, 두 개의 다른 척도상에 있는 동일 과제이다 : 장면이란 많은 구성 대상들로 이루어진 복합물이고, 대부분의 대상들 역시 구성 부분들로 이루어진 복합물이기 때문이다. 한 대상이 다른 대상과 관련하여 움직일 수 있는 것처럼, 한 대상의 어떤 부분은 다른 부분과 관련하여 움직일 수 있다. 그것은 여러분이 손을 폈다 오므렸다 할 때와 같다. 차이가 발생하는 곳에서 사물들은 (그리고 그 부분들은) 이름과 기능들을 갖는 경향이 있다. 그러나 장면들은 이름과 기능을 갖는 경우가 거의 없다 (방들은 제외된다). 나는 모양 지각에서부터 시작하여 살펴볼 것이며, 부분들의 명명에 대해서는 뒤로 미룬다.
어떤 로봇이 자기의 시야에 놓인 모든 표면들의 상대적인 깊이와 방향에 대해 상징적인 표상, 즉 이전 장에서 본 2¹/₂차원 스케치 (어떤 최신 로봇들은 이런 거리측정에 레이저를 사용하여 속이지만) 를 계산했다고 가정해 보자. 이 표상은 대상의 모양이나 그 공간적 관계를 분명하게 하지 않으며, 표면의 방향이 로봇과 관련하여 변화하므로 로봇이 움직일 때 표상도 변화한다. 보다 유용하고 안정적인 표상은 대상들의 본래적인 삼차원적 모양과 그들간의 공간관계를 분명하게 할 것이다.

그림 6.1 : 1604년네 출판된 네덜란드 화가 드 브리스의 원근법에 대한 책에서
나온 그림.
(From J. V. de Vries, Perspective. New York : Dover, 1968)
그림 6.1 의 장면에 (이 장면은 17 세기 나무토막의 세계로서 인공지능의 연구자들이 좋아하는 영역과 유사하다) 당면하였을 때, 로봇은 특정 관점과는 독립적인, 그러면서도 로봇이 어떤 장애물에 부딪치지 않도록 조절하는 프로그램을 가능케 하는 그런 하나의 표상을 구성하는 것이 필요하다. 따라서 표상은 장면에 대한 삼차원적인 한 모델이어야 한다. 그것은 건축가의 모델처럼, 그 장면 내의 모든 것 (채워져 있는 부분과 빈 공간) 의 모양을 분명히 해야 한다. 그러한 구조는 컴퓨터의 하드웨어 내의 삼차원적 설계를 요구하지는 않는다. 그것에 대한 물리적인 구현은 삼차원적으로 기능하시만 하면 되는 것으로서, 요소들은 세 좌표 상에서 그들의 위치를 명시함으로써 접근될 수 있고 조작될 수 있다. 그러한 구조들은 프로그램에서는 흔해 빠진 것이다.
모델의 구성은 2¹/₂차원 스케치의 기하학적 변형에 근거한다. 비슷한 과제가 레이더 탐지나 입체사진을 가지고 지형에 대한 컴퓨터 모형을 구성할 때 만들어진다. 그러한 자료를 컴퓨터 내에서 삼차원적인 모델로 전환하며, 각기 다른 관점들로부터 그 장면을 투사할 수 있는 프로그램들이 있다. 이 프로그램들은 비교적 간단하지만, 인간의 시각체계가 어떻게 그와 유사한 전환들을 수행하는지는 알려져 있지 않다.
많은 인공지능 연구자들은, 특히 작고한 클라우스 (Max Clowes) 와 허프먼 (David Huffman), 왈츠 (David Waltz) 는 유사한 문제를 푸는 데 착수하였다. 그들은 선화 (line drawings) 는 대상들의 가장자리를 분명하게 만들며, 사람들은 그러한 그림이 삼차원적 장면을 묘사하는 것으로 해석한다고 지적했다. 그들은 이와 유사한 해석들을 이끌어낼 수 있는 프로그램을 고안하려고 시도하였다.
클라우스와 허프먼이 각각 독립적으로 깨달았던 것은 세상 지식이 선화 내의 원초적인 삼차원적 해석이 만들어질 수 있다는 것이다. 두 사람의 생각은 비슷하므로, 나는 클라우스의 프로그램만 기술하려 한다. 그 프로그램은 단순한 나무토막들의 세계에 대한 선화만을 입력으로 취한다. 각각의 나무토막은 평면적인 표면들을 가지며 단지 세 표면들만이 한 모퉁이에서 만난다. 그 프로그램은 그림에 대한 해석을 제공하여, 원초적 상징들 (선과 선분의 접합점) 이 삼차원적 해석을 나타내기에 적합한 하나의 이름을 각각 받도록 한다. 그 프로그램의 핵심에는 그림에서 발생할 수 있는 원초적 상징의 각 종류별로 그에 대한 가능한 의미들을 정의해 주는 사전이 있다. 다음과 같은 단일 직선은 단지 네 개의 의미만을 가질 수 있다 : 이것은 장면 내의 한 대상을 묶는 외부 가장가리일 수가 있다. 만약 그렇다면, 이 선의 한편은 그 대상의 한 표면에 해당하고, 다른 편은 배경이나 그 대상에 차단된 어떤 표면에 해당한다. 이때 이 선의 어느 편에 대상의 표면이 놓여 있는가에 따라 분명히 두 가지의 해석이 있는 것이다. 그러나 이 선은 한 대상의 두 표면이 만나는 장소인 가장자리를 묘사할 수도 있다. 이런 경우에 그 가장자리는 나무토막의 위쪽과 같은 볼록면일 수도 있고, 아니면 상자 안쪽과 같은 오목면일 수도 있다.
클라우스 - 허프먼의 나무토막 세계에 대한 그림들에서, 선들의 접합은 네 가지 종류로만 발생할 수 있다 : 즉 L - 모양, T - 모양, Y - 모양, 화살모양이다. 그것들은 그림 6.1 의 상자들을 가로질러 누워 있는 들보들에서 보여질 수 있다 : f 라고 명명된 점에는 L - 모양이 있고, 들보의 바닥을 묘사하는 선과 상자의 위를 묘사하는 선들간의 각 교차점에 T - 모양이 있으며, d 라고 명명된 점에 Y - 모양이, c 라고 명명된 점에 화살모양이 있다.
하나의 단일 선에 대해 가능한 해석이 네 개가 있기 때문에, L - 접합에서 가능한 해석은 16 개일 것이라고 여러분은 생각할지도 모른다 (한 선에 대한 네 가능성 곱하기 다른 선의 네 가능성). 그러나 사실상 많은 조합들 (combinations) 은 나무토막 세계의 특성에 비추어 보아서 무의미한 것으로 판단되어 제거된다. 예를 들어 L - 접합의 두 선들 중 적어도 하나는 또 다른 표면이나 배경을 막는 대상의 가장자리를 지칭한다. 다른 종류의 접합들에 대해서도 비슷하게 제한적인 해석들이 있는 것이다.
한 그림을 해석하기 위해서는 더 상위 수준의 제약형태를 이용한다 : 즉 그림 내의 모든 원초 상징들 (선과 집합) 에 대한 일관성 있는 해석을 필요로 하는 것이다. 초기에는 단지 물리적으로 가능한 해석만이 한 그림 내의 각 원초적 요소들 (primitives)에 할당되었다 할지라도 그 그림을 전체로서 해석하는 잠재적인 해석의 수는 여전히 방대할 것이다. 그러나 그 해석들 중 대부분은 그림 6.2 에서와 같이 불가능한 대상들을 지칭할 것이다. 만약 어떤 접합에 대해 해석할 때 한 선을 어떤 대상의 차단된 가장자리로 다룬다면, 그 접합의 다른 끝에 있는 해석에서도 그 선은 차단하는 가장자리여야만 한다. 그림 6.2 의 대상은 이런 제약을 위반한다 : 만약 여러분이 그 대상을 정면에서만 보거나, 뒤에서만 본다면 여러분이 보는 대상은 이해될 만한 대상이다. 그러나 그렇게 본 두 부분들은 그것들을 잇는 선들에 대해 실재할 수 없는 모순되는 해석을 내리게 한다.

그림 6.2 : 클라우스의 그림해석 프로그램에서 물리적으로 불가능한 그림으로
판명된 모양의 선화.
(From M. Clowes, On seeing things. Artificial Intelligence, 2, 1971, p.
105)
그림들을 해석하기 위한 절차는 먼저, 각 기본 요소들에 대해 모든 적법한 해석을 부여하고, 그리고서 이웃하는 쌍에 대한 해석들의 상호 일관성을 점검하는 것이다. 일관성 있는 해석 이외의 모든 해석들을 제거하고 나면 또 다른 이웃하는 원초 요소에 대한 해석을 고려하고, 세 요소 모두에 대한 일관성 있는 해석을 형성한다. 이러한 절차는 그림의 모든 원초 요소가 그 과정을 거칠 때까지 계속된다. 그 프로그램이 마침내 정지할 때 (그것은 제 5 장에서 논의된 < 완화 > 법을 사용한다) 그 결과는 그림을 의미있게 만드는 그런 해석들일 것이다. 만일 실제로 그것이 하나의 불가능한 대상을 지칭하는 해석이라면, 그 대상에 대한 결론적 해석은 있을 수 없게 되는 것이다.
왈츠는 상황을 더 복잡하게 만드는 것처럼 보이는 단계가, 즉 그림자와 보다 복잡한 나무토막들과, 나무토막의 보다 복잡한 형태를 도입한 것 (그림 6.3 참조) 이 사실상은 단순화를 가져온다는 것을 보여주었다. 그의 프로그램은 어떤 선분은 나무토막이 다른 나무토막의 옆이나 위에 놓여져 있는 곳의 갈라진 틈을 표시할 수도 있고, 아니면 한 면이 어둡고 다른 면은 밝은 그림자의 가장자리를 표시할 수도 있다는 것을 허용한다. 그림자는 다른 관점에서 보는 것과 유사한 정보를 주며, 하나의 대상이 어떤 대상 표면 위에 놓여 있는지 아니면 단지 그것에 가까이 있는지를 알려줄 수 있다. 그림 6.4 는 왈츠의 프로그램에 따라 어떤 그림을 명명할 때 나타나는 이런 가능성들 중 몇몇을 보여준다. 더 많은 원초 상징들이 있고 그것들에 대한 훨씬 더 많은 의미가 있기는 하지만, 이제 이 프로그램은 단순한 나무토막의 세계에서보다는 더 빠르게 (그리고 덜 모호하게) 하나의 그림을 전체로서 해석할 수 있다.

그림 6.3 : 커뮤니케이션 프로그램이 해석하게 되는 나무토막에 대한 선화.
(From D. Waltz, Understanding line drawings of scenes with shadows. In P.
Winston, ed., The Psychology of Computer Vision. New York : McGraw - Hill, 1975)

그림 6.4 : 왈츠의 프로그램에 따른 선화의 명칭.
(From D. Waltz, Understanding line drawings of scenes with shadows. In P.
Winston, ed., The Psychology of Computer Vision. New York : McGraw - Hill, 1975)
맥워스 (Alan Mackworth) 등 다른 연구자들은 더 진보된 프로그램을 고안하였다. 그 프로그램은 개별적인 원초적 요소들에 대한 해석 사전이 아닌 일반 원리들을 사용하여 그림들을 명명할 수 있는 것이다. 그러나 이 프로그램에서도 여전히 나무토막 세계 속에서 작업하는 데에 문제점들이 남아 있다. 이 프로그램은 있을 수 없는 대상들을 묘사하는 어떤 그림들 (그림 6.5 참조)에 대해서도 그럴 듯한 해석을 제공한다. 그러나 마 (Marr)는 그 접근법은 계산되어야 하는 것이 무엇인지에 대한 물음을 적절히 다루지 못한다는 점을 들어 그 접근법을 비판하였다. 어떤 프로그램이 인간 시각과 유사하다면, 그 프로그램의 결과는 그림에서 묘사된 장면에 대한 삼차원적인 해석이어야만 한다. 그와 같은 표상은 대상들의 모양을 분명히 해줄 수 있어야 하지만, 선을 명명하는 프로그램들은 단지 연결된 표면들의 방향만을 포착할 뿐이다.

그림 6.5 : 선화를 해석하는 프로그램에 의해 물리적으로 불가능한 것이라고는
파악되지 않는 모양의 선화.
(From J. Mayhew and J. Frisby, Computer vision. In T. O'Shea and M. Eisenstadt,
eds., Artificial Intelligence. London : Harper and Row, 1984)
그렇지만, 그 연구는 가치 있는 것이었다. 그것은 형태와 기능의 차이를 분명히 해주었다. 동물의 모양을 변별하는 방식을 연구했던 서덜랜드 (S. Sutherland) 는 세 개의 별개의 영역들을 구분했다 : 즉 선과 부분, 접합들로 이루어지는 것과 같은 그림의 영역과, 표면과 가장자리, 모양들로 이루어지는 장면 영역, 그리고 의자, 책상, 사람과 같은 기능적인 대상들의 영역으로 구분했다. 그 연구는 또한 정교한 실험을 수행하지 않고 탐구될 수 있는 지각의 일상적 측면들이 있다는 것을 많은 심리학자들에게 입증하였다 : 즉 그림에 대한 단순한 직관만 가지고도 어떻게 대답해야 할지 아무도 방법을 알지 못하는 물음들을 제기하기에 충분하다는 것이다.
심적 모델 (mental model) 을 구성하는 것은 2¹/₂차원 스케치의 변형 이상을 필요로 할 수 있다. 때때로 완전한 모형에 대한 스케치 내에는 불충분한 자료들이 있다. 예를 들어 그림 6.1 의 책상 윗면에서는 두 가장가리만이 눈에 보이지만, 여러분이 서양가구에 친숙하다면 그 대상을 하나의 책상으로 파악하고 그 위표면은 네모난 것으로 표상할 것이다. 여러분은 세상 경험에서 얻은 책상 모양에 대한 지식에 의존하지만, 그것이 책상이라는 것을 파악하는 기제는 헬름홀츠에 따르면 무의식적이다. 여러분의 지각체계는 지각된 대상에 대한 기술 (description) 을 구성하며, 그것을 대상들의 삼차원적 모양에 대해 마음속에 지니고 있을 일종의 목록과 대조한다. 지각체계는 특정 관점에서 그것들을 재인 (파악) 할 수 있으며, 그리고서 그것들의 나머지 모양들에 대해 자동적으로 외삽 (extrapolations) 하여 파악한다.
처리과정에 대한 계산모형의 선구자는 로버츠 (L. G. Roberts) 로서, 그는 나무토막 세계 내에서의 대상들의 사진을 기억에 저장된 전형 (prototypes) 과 대조해 그것이 무엇인지를 파악함으로써 해석하는 프로그램을 고안하였다. 세잔과 같은 미술가나 입체화가들은 모든 모양이 기본적 입체형태들로 분해될 수 있다는 플라톤주의에서 영향을 받았다. 로버츠의 프로그램은 그와 유사한 원리에 입각해서 작용한다. 그것은 세 개의 입체 전형들에 기초한다 : 정육면체와, 직각의 쐐기, 육각형 프리즘이 그것이다 (그림 6.6 참조). 그것은 먼저 조야한 선 탐색자 (line - finder, 일차 스케치 기제개념에 비해 초보적인 그러나 선구적 개념임)를 사용하여, 사진을 선화로 바꾼다. 그리고서 선들의 특정 접합들을 적절한 전형을 찾는 단서로 사용하여 상향적으로 작용한다. 이렇게 본다면, Y - 접합은 정육면체의 전형에 대한 단서이다. 왜냐하면 Y - 접합은 정육면체의 정면 위쪽 모서리에서 발생하기 때문이다.

그림 6.6 : 로버츠의 프로그램에서 사용된 세 개의 전형들.
(From K. Oatley, Perceptions and Representations. London : Methuen, 1978,
p. 178)
그 프로그램의 마지막 단계는 전형을 사용하여 하향적 처리로 그림 내의 대상의 나머지를 해석하는 것이다. 전형의 내용과 그림의 나머지 부분 간의 대응처리를 수행하는 이러한 조작들은 내적인 전형 (삼차원에서 좌표로 규정되는 것) 을 이차원적 영상으로 투사할 수 있다. 그리고 그 조작들은 장면 내의 실제 대상과 맞도록 하기 위해, 전형의 차원을 늘리거나 줄이며, 전형을 회전시키거나, 아니면 그것을 한 위치에서 다른 위치로 옮길 수 있다. 또한 그 프로그램은 보다 복잡한 대상들을 분석하기 위해 전형들을 함께 묶을 수도 있다.
전형을 사용한 연구는 마와 니쉬하라 (K. Nishihara) 에 의해 한 걸음 더 나아가게 되었다. 한 대상의 파악은 각기 다른 많은 관점에서 일어날 수 있기 때문에, 그들은 대상의 모양이 관찰자 중심의 좌표체계 (2¹/₂차원 스케치와 같은 것) 에서가 아니라 대상 자체의 모양에 의해 결정되는 좌표상에서 규정되어야만 한다고 논의하였다. 접힌 우산에 대하여 시각체계는 그것이 긴 실린더임을 드러내는 표상을 형성한다. 이 모델은 관찰자의 관점과는 독립적이고, 사실상 사람들은 각기 다른 관점에서의 우산의 모습을 상상할 수 있다. 심상을 회전하는 이런 능력에 관해서는 잠시 후 다시 다룰 것이다.
대상 모양을 포착하는 한 강력한 체계는 한 축을 따라 이차원적인 횡단면을 움직이게 하는 개념에 기초한 것이다. 예를 들어 하나의 원이 직선을 따라 직각으로 움직인다면, 실린더의 입체적인 모양이 생겨난다. 만약 그것이 움직임에 따라 끊임없이 줄어든다면, 그것은 원추를 만든다. 일반적으로 우리는 어떤 모양의 횡단면을 사용할 수 있고, 그것은 움직임에 따라 계속해서 크기가 변화할 수 있으며, 그 축은 직선일 필요는 없고 어떤 식의 곡선일 수도 있다. 그 결과로 나타난 모양의 종류는 다소 이름이 잘못 붙여져서 < 일반화된 원추들 > 로서 알려져 있다. 이와 같이 해서 바나나의 모양은 일반화된 원추에 의해 비교적 정확하게 묘사될 수 있고, 인간의 모양은 여러 일반회된 원추들로 이루어진 것으로 비교적 정확히 묘사될 수 있다. 마와 니쉬하라는 일반화된 원추들로 표상되는 대상들 모양들에 대한 목록을 마음이 갖고 있다고 제안하였다. 그림 6.7 은 그들이 생각해 낸 목록의 종류로서, 아동화의 < 봉선화 (stick figure) > 와 동일한 표상개념 위에서 작용한다. 그것은 구성축들의 길이와 배열을 분명히 만들어주며, 따라서 복합적인 대상들을 파악하는 데 유용하다. 비록 그림 6.7 은 모양을 단순 실린더들로서 표상하지만 이에 대한 심적 목록은 일반화된 원추를 사용한다고 가정된다. 그것들은 이전 장에서 진술한 제약조건들을 충족시키는 실루엣에서 복구되어 나오는 모양들의 유목이다. 그러나 종이접기에서부터 구겨진 신문에 이르기까지 이러한 제약을 위반하며, 일반화된 원추가 아닌 그런 모양들이 있다.
그림 6.7 : 마와 니쉬하라에 의해 제안된 모양들 목록의 일부.
(From D. Marr and H. K. Nishihara, Representation and recognition of the
spatial organization of three - dimensional shapes. Proceedings of the Royal
Society, B. 1978, 200)
마와 니쉬하라의 목록은 위계적인 조직 내에서 복합 대상들을 표상한다. 위계의 상위 수준은 대상의 전반적인 구조를 다루고, 하위 수준은 세부사항들을 명료화시킨다. 그림 6.8 은 인간 모양에 대한 위계적인 표상을 보여준다 (실린더가 편의상 다시 예로 사용된다). 신체의 축은 신체 자체에 중심을 둔 좌표체계를 제공하며, 이 축 체계는 머리와 팔, 다리의 축들의 관계를 명시하는 데 사용될 수 있다. 한편 이 지체의 부분축들은 다음의 하위 수준에 대한 좌표를 제공하고 이 하위 수준 축은 더 낮은 수준의 좌표를 제공한다. 모양들에 대한 목록은 다양한 방식들로 탐색될 수 있다. 로버트의 프로그램처럼, 대상의 주요 부분에 대한 특수한 단서가 상향적으로 전형에 접근하도록 할 수도 있다. 그러면 그 전형은 그 모양의 나머지에 대한 부합을 시도하기 위해 하향적으로 사용될 수 있다. 다른 축들과 관련해 주축이 갖는 방향에 대한 정보도 대응 (matching) 처리 과정에서도 사용될 수 있다.
호그 (David Hogg) 는 이러한 착상 중 일부를 확장시켜 움직임 형성을 다루려 하였다. 그는 걷고 있는 사람에 대한 필름을 해석하는 프로그램을 개발하였다. 그 프로그램은 그림 6.8의 것과 같이, 사람에 대한 내적인 전형을 가지고 있으며, 그것은 로버츠의 프로그램에서와 같은 원리들을 사용하여 움직이는 영상 위에 투사할 수 있다. 그 전형은 걸을 때에 일어나는 자세들의 특정한 순서만을 그림의 사람이 반복할 수 있도록, 관절 부위의 여러 각도를 조절하는 변인들에 대한 제약조건들을 갖는다. 그 프로그램은 회색 수준 배열 내의 흑백의 원 자료에 대하여 작동하며, 부합처리는 연속적인 필름 토막들간의 차이를 탐지하므로 촉발된다. 요컨대, 그 프로그램은 변화가 있는 영역 주변에 네모를 그리며, 그것의 주축이 전형의 주축과 대응한다고 가정한다. 일단 이러한 관계를 설정했다면, 그것은 팔이나 다리의 세부사항들이 그림에 맞도록 하기 위해 카메라의 관점을 허용하면서 하향형태의 조작으로 바꾸게 된다.

그림 6.8 : 마와 니쉬하라가 제안한 인간모습의 위계적 구조.
(From D. Marr and H. K. Nishihara, Representation and recognition of the
spatial organization of three - dimensional shapes. Proceedings of the Royal
Society, B. 1978, 200)
대상의 재인 (recognition) 에 대한 이런 접근법의 주장은 대상의 모양 파악에 대상들 모양에 대한 상위 수준의 지식이 사용된다는 것이다. 그 이론들은 우리의 경험이 그러한 세상 지식을 가질 수 있도록 해주며, 시각체계를 이해하려는 절차에서 그것은 이용할 수 있도록 한다고 가정한다. 그 가정은 타당한가? 독자들은 내가 앞에서 언급했던 적절한 실험기법을 기억할 것이다 : 만약 하위 수준의 자료가 부실할지라도 처리과정이 일어난다면, 그것은 상위 수준의 지식에 의해 주도되는 것일 수 있다. 그림 6.9 는 그러한 현상에 대한 고전적인 예이다. 첫눈에 이 그림은 검고 하얀 무선적인 얼룩들로 보일 것이다. 사실상 이 그림은 얼룩진 나무 그림자 아래 땅을 냄새 맡는 개에 대한 그림이다. 이 지식은 여러분으로 하여금 개를 파악하도록 하는 데 충분할 것이다.

그림 6.9 : 지각에서 하향처리의 역할을 보여주는 그림.
(From J. Thurstone and R. G. Carraher, Optical illusions and the Visual
Arts. New York : Litton, 1966. Copyright © Van Nostrand Reinhold Co.)
여러분이 가진 책상에 대해 지니고 있는 개념에는 책상을 책상이라고 지각적으로 파악하기 위한 정보가 담겨 있어야만 한다. 그러나 밀러 (G.Miller) 와 내가 개념들에 대한 분석을 했을 때, 책상들은 인간과 달리 표준적인 모양을 갖고 있지 않다는 것을 곧 깨달았다 : 책상의 모양은 대단히 많았다. 더욱이 우리는 어떤 책상이 이전에 본 적이 없는 모양을 하고 있다 할지라도 그 대상이 책상임을 인식할 수 있다. 인공품은 그것의 삼차원적인 모양의 본질적 특성 때문이 아니라, 그 형태와 차원, 그리고 다른 현저한 특성들이, 그것이 무엇이건 간에, 특정 기능에 적절한 것으로 지각되기 때문에 어떤 범주의 구성원으로 파악될 수 있다고 결론 내릴 수 있다. 여러분은 인공품 내에 내재하는 가능성들을 알 수 있다. 책상은 여러분이 도구들을 놓을 수 있는 표면은 가지기 때문에 책상이다. 이런 종류의 상위 수준의 인식은 컴퓨터 프로그램의 능력을 넘어서는 것이다. 그것은 상위 수준의 지식, 예를 들어 책상들이 제공하는 특정 기능들에 대한 지식에 의존한다. 그것은 또한 형태에서부터 기능으로의 추론에 의존한다. 여러분은 대상의 모양을 지각하고, 그것이 어떤 목적에 쓰일지를 추론한다. 불행히도 어떤 경우에는, 아마도 알려지지 않은 결혼 선물 같은 것은 여러분이 대상의 모양을 지각하지만 그 모양을 가지고는 기능을 생각할 수가 없다.
시각적 재인 (대상파악) 에 대한 놀라운 증거는 신경심리 분야에서 나왔다. 신경심리학자들은 사고나 뇌일혈, 독극물이나, 수술에 의해 야기된 뇌손상이 심리적으로 미치는 영향을 연구한다. 그들의 목적은 뇌의 정상 조작을 밝히고, 가능하다면 손상의 영향으로 생긴 장애를 개선하는 것이다. 영국의 유명한 신경심리학자인 워링턴 (Elizabeth Warrington) 과 그 동료들은 형태 지각 기제와 기능 지각 기제를 구별하는 좋은 증거를 발견했다. 반대로 뇌의 다른 부분 (우측 측두엽)의 손상은 그와 정반대 효과를 가져온다. 어떤 환자들은 첫 번째 능력이 손상되었지만 두 번째 능력은 온전하고, 다른 환자들은 두 번째 능력이 손상되고 첫 번째 능력은 온전할 때, 신경심리학자들은 이 두 능력간에 < 이중적인 분리 (double dissociation) > 가 있다고 말할 수 있다. 그것들은 뇌손상에 의해 독립적으로 장애가 일어날 수 있기 때문에 각기 다른 단원 (module) 들에 의해 다루어진다는 것을 시사한다. 형태와 기능의 경우에서, 이중적 분리는 형태와 기능의 기저 지각 기제들 사이에 차이가 있음을 확증한다.
대상의 용도를 상징하는 능력은 시각적 심상 (visual imagery) 과 관련될 수가 있다. 대부분의 사람들은 마음의 눈으로 친숙한 사람이나 방, 장면에 대해 심상을 형성할 수 있다. 그리고 셰퍼드 (Roger Shepard) 와 그 동료들이 보여주었던 것처럼 그림 6.10 의 왼쪽 그림과 같은 것을 제시받으면, 사람들은 그것이 오른쪽 그림과 같은 대상인지 아닌지를 결정할 수 있다. 이 비교는 첫 번째 대상의 심상을 심적 회전 (mental rotation) 함으로써 일어난다 : 회전 각도가 클수록 반응하는 시간은 (비례적으로) 길어진다. 사람들이 이 모양의 심상을 회전하는 데는 60 도 돌릴 때마다 약 1 초가 걸리며, 이러한 관계는 회전이 그림의 평면에서 일어나지 않고 깊이로 (공간적으로) 일어날 때에도 유지된다. 저스트 (Marcel Just) 와 카펜터 (Patricia Carpenter) 는 이 과제를 수행할 때의 사람들의 눈 움직임을 기록했다. 그림 6.10 은 한 전형적인 응시 패턴을 보여주는 것으로, 피험자들이 주축을 발견하고 (1 과 2 에 고정), 그것을 심적 회전하여 한 대상의 끝에서 그들의 판단을 검토하고 (3 - 5 에서 고정), 다른 끝에서 검토하는 (6 - 7 에서 고정) 식이다.
흄 (D. Hume) 의 말처럼, 심상은 지각과 유사하지만 마음속에서 일어나는 강도와 생생함에서 차이가 있다. 사실상 1910년의 고전적인 실험에서는 심상과 지각의 두 경험들간의 유사성을 보여주었다 : 퍼키 (C. W. Perky) 는 사람들에게 바나나와 같은 일상 대상을 상상하도록 요구하고, 그 심상을 벽에 붙여 놓은 판유리 위에 마음속으로 < 투사 > 하여 떠올리도록 하였다. 그들에게 알리지 않고, 실험자는 바나나의 사진을 벽의 다른 편에서 그 판유리에 투사시켜, 점차 그 강도를 증가시켰다. 그것이 같은 방 안에 있는 다른 사람에게는 분명히 시각적으로 보이는 것이었는데도 불구하고, 피험자들은 속아서 자기들이 강한 심성을 경험하고 있다고 믿었다.

그림 6.10 : 왼편 그림은 오른편 그림과 동일한 대상을 묘사하는가? 이것은 셰퍼드의
심적 회전 과제에서 나온 한 예이다. 숫자는 저스트와 카펜터의 실험에서 한 피험자의
눈움직임이 고정되는 패턴을 나타낸 것이다.
(From M. A. Just and P. A. Carpenter, Eye fixations and cognitive processes.
Cognitive Psychology, 8, 1976)
시각과 심상의 기저에 한 공통 기제가 있다는 신경심리학적인 증거가 있다. 뇌손상은 < 시각적 무관심 (visual neglect) >이란 흥미로운 현상을 야기시킬 수가 있다는 점이다. 그것은 환자가 한쪽 시야를 의식하지 못하는 것이다. 그들 눈에는 잘못된 것은 아무것도 없고, 그들은 자신의 문제를 깨닫지 못한다. 예를 들어 그들은 접시의 한편에 놓인 음식만을 먹고 다른 편에 놓인 모든 것은 마치 존재하지 않는 듯이 무시한다. 비시아치 (Eduardo Bisiach) 는 그런 환자들에게 친숙한 광장과 같은 장면들을 기억에서 묘사하려고 했을 때, 지각에서와 마찬가지로 심상의 한쪽 편을 무시하고 있음을 관찰했다. 그리고 나서 그들이 광장의 다른 끝에 서 있다고 상상하도록 하게 했을 때, 그들은 먼젓번에는 무시하지 않았던 다른 한편을 이번에는 무시했다.
심상에 대한 주 논쟁거리는 그 본질에 대한 것이다. 이 영역의 주도적인 이론가인 코슬린 (Stephen Kosslyn) 은 심상은 사물의 조망 (view) 과 대응하며, 여러 심적 처리과정들이 심상에 적용될 수 있다고 논의하였다. 예를 들어 그의 실험들 중 하나에서 그는 사람들에게 가상적인 섬에 대한 지도를 그리고 여러 경계표를 그 위에 그려놓도록 요구하였다. 그들이 지도를 외웠을 때에, 지도를 없앤 다음, 지도를 마음속으로 상상하며, 특정 지점에 초점을 맞추도록 했다. 실험자는 그들에게 다양한 경계표들의 이름을 주고, 심상에서 지도 위에 있었던 각 경계표를 찾을 때까지 심상을 훑어보고, 탐색이 되면 단추를 누르도록 하였다. 그들이 반응하는 데 걸린 시간은 출발 지점에서 경계표가 떨어진 거리에 비례하였다. 이 결과와 다른 연구결과들은 사람들이 내적인 심상을 훑어볼 (scan) 수 있음을 시사한다.
코슬린의 가설은 심상이 이차원적인 내적 배열로 마음속에 표상된다는 것이다. 그는 이 가설에 입각하여 컴퓨터 프로그램을 만들었다. 그 프로그램은 한 배열을 이루는 세포적 단위들의 활성화 형태로서 심상을 생성한다. 그 형태는 한 대상의 가시적 표면들에 대한 모양과 상응된다. 심상은 다시 새로워지지 않는 한 생성되자마자 사라지기 시작한다. 심상은 유한한 크기를 갖는 배열의 한계를 넘어서게 형성될 수도 있다. 반대로 심상은 너무 작아서, 각 세포의 보유기능 정보의 양에 의해 결정되는 유한한 < 단위세포 크기 (grain) > 로 이루어지는 그런 배열 내에 떠올릴 수 없을 정도로 작을 수도 있다. 이 심상 배열은 시각 과정에서 직접적으로, 아니면 기억으로부터 정보를 받을 수 있다. 코슬린은 우리가 대상을 있는 그대로의 모습 (2¹/₂차원 스케치와 유사한 것) 으로 기억하거나, 아니면 추상적인 구조적 기술 (재인에 사용되는 삼차원 모형과 유사한 것) 로 기억한다고 가정한다. 이 두 종류의 기억은 모두 하나의 심상을 생성하는데 사용될 수가 있다. 배열에서 활성화된 세포들의 양상은 한 곳에서 다른 곳으로 옮겨질 수 있고, 회전되거나 크기가 재조정될 수 있다: 그리고 이런 변형의 결과는 특정 모양을 발견하는 조작이나, 배열을 훑어보는 조작, 아니면 세부사항들을 자세히 보기 위해 그것을 확대하는 조작들에 의해 검토될 수 있다. 이 프로그램에서 도출되는 한 예측은 작은 영상들은 큰 영상들보다 회전하는데 시간이 덜 걸려야 한다는 것이었다. 그 예측은 실험적으로 입증되었다.
심상을 모형화하는 프로그램은 영상을 구성하고 조작하는 절차들을 포함해야만 한다. 그러나 만약에 영상이 대상에 대한 특수한 조망 (view) 이라면 (2¹/₂차원 스케치와 유사한 것), 아마도 그것들은 대상의 삼차원적 모형으로부터 생성될 것이었다. 심성 회전에서는 이 모형이 조작되고, 그리고서 투사과정에 의해 그것에서부터 영상이 나오게 된다. 또 다른 가능성이 힌턴 (Geoggery Hinton) 에 의해 시사되어 왔다. 그는 내적 배열이란 것은 그것이 무엇이든 간에 필요하지 않다고 논의한다. (주석 : 대상과 유사한 시각적 상이 마음속이나 컴퓨터 속에 있다고 가정할 필요가 없다는 의미이다.) 한 대상을 상상하는 것은 그 대상의 구조적 기술 (삼차원 모형과 유사한 것) 을 기억에서 찾아내고, 그리고서 그것에다 특정 관점에서 본 대상의 모습에 대한 잠정적인 정보를 첨가하는 것으로 이루어진다. 영상을 조작하는 절차는 이러한 것을 좌표값들로 직접 변환할 수 있고, 이렇게 만들어낸 새로운 좌표값은 의미있는 관계들을 발견키 위한 절차들에서 사용될 수 있다.
캐나다의 인지과학자인 필리쉰 (Zenon Pylyshyn) 은 한걸음 더 나아간다. 그는 영상은 심적 생활 (mental life) 에서 어떤 원인적인 역할을 담당하지 않는다고 논의해 왔다. 심상 현상은 사람들이 물리적 사건들을 묘사하기 위해 그들의 일반 인지능력들을 사용하기 때문에 생긴다. 내적 배열을 회전하거나 변형하는 과정이란 없고, 단지 상징열들, 즉 필리쉰에 따르면 심적 표상의 표준적인 매개체들의 조직만이 있을 뿐이다. 사소한 측면에서는 필리쉰이 옳을 수밖에 없다 : 어떤 컴퓨터 프로그램도 기계를 통제하는 부호의 이진 숫자 열들로 환원되며, 어떤 심성 과정도 신경 충동들이나 아니면 어떤 다른 원초적인 부호로 환원된다는 것이다. 그러나 이런 원초 상징들을 기능적으로 조직화한 것은 어떤 대상의 삼차원적 구조나 특정 관점에서 본 그것의 모습과 같은 상위 수준의 관계들을 분명히 해줄 수도 있다. 사실상 심상은 프로그래밍 언어 내의 배열 (array) 과 유사하다고 할 수 있다. 그것은 특정 관계들이 쉽게 형성되도록 할 것이다. 이는 마치 코슬린의 프로그램에서 그런 종류의 관계들을 포착하기 위해 다양한 절차들이 고안된 경우와 같다.
빛은 어떤 형태로 대상들에서부터 한 표면으로 반사되는가? 이 문제는 광학에서는 잘 정립되어 있다 : 그것은 등식이 해결될 수 있는 것처럼 해결 가능한 것이다. 시각은 광학과는 반대이다. 그것은 망막에 투사된 광 패턴을 야기시킨 대상들이 무엇인지를 알아내야 한다. 이 문제는 잘 정립되어 있지 않다 : 알려지지 않은 것들이 너무 많고, 광 패턴이 만들어질 수 있는 방식들이 너무 많기 때문에 그 문제는 해결이 거의 불가능하다. 불가능해 보이는 과제를 해결하려 할 때, 마음은 비밀의 무기를 가져야만 하는데, 앞에서 지적했듯이 그 비밀 무기는 지식인 것이다. 지식은 하향적이거나 상향적인 두 방식으로 사용될 수 있다.
한 종류의 지식은 진화에서 비롯된 것으로, 그 지식은 신경체계의 과정 내에 내장되어 있다. 이 지식은 실상은 지식이라고 말할 수가 없다. 그것은 결코 명시화되지 않으며, 하위 수준의 단원 (module) 에서의 계산 속에 캡슐화되어 있다. 그런 단원들은 그 자신의 조작 양상을 내성을 통해 드러낼 수 있게 해주는 것도 아니고, 의식적인 통제에 의해 크게 영향을 받는 것도 아니다.
다른 종류의 지식은 한 개인의 일생 동안 만들어지는 것이다. 여러분은 책상들에 대한 경험을 하며, 따라서 책상들의 모양들과 기능들에 대해 배우며, 내성으로도 접근 가능한 이런 분명한 지식을 대상의 정체를 파악하는 데 사용할 수 있다. 사실상 여러분은 그와 같은 지식의 사용이나 그 지식의 성질을 항상 의식하지는 않는다. 여러분이 길 가운데에서 생각에 잠겨 서 있을 때 여러분에게 재빨리 다가오는 것이 있다고 하자. 그것은 무엇인가? 오토바이이다. 다행히도 여러분은 이 결론에 도달하려고 긴 분석에 사로잡히지 않아도 된다. 여러분은 여러분이 어떻게 그것을 파악해 냈는지를 기술할 수 있기도 전에 길에서 비켜나와 있다. 지각에 있어서의 이러한 즉각성 때문에 깁슨과 그 동료들은 내가 이 장에서 언급했던 이야기, 즉 시각이 어떻게 삼차원적 심적 모형을 구성하는지, 대상을 파악하는 무의식적 추론을 형성하기 위해 개인적인 지식이 어떻게 사용되는지에 대한 이야기를 의심하게 되었다. 그러나 이 이야기는 이 입장을 계산 모형으로 전환시키는 연구가 이미 시작되어 지지를 얻고 있다는 커다란 이점을 안고 있다. 로봇에게, 조야하지만 이러한 종류의 능력을 장치하는 것까지도 가능한 것이다.
두 종류의 지식에 대한 구분은 순수 지각과 인지와의 경계를 나타낼 수도 있다. 마 (Marr) 는 이 경계가 2¹/₂차원 스케치와 삼차원 모형 간에 있다고 본다. 한편 신경심리학적 증거는 그 경계가 삼차원 모형 형성과, 대상이나 사물들의 기능에 대한 파악 사이에 놓일 수 있음을 시사한다. 분명한 경계란 없는 것인지도 모른다. 그러나 두 가지는 확실하다. 첫째, 우리가 세계를 지각할 때, 표면들의 상대적인 깊이에 대한 정보는 (2¹/₂차원 스케치) 생득적인 제약조건을 사용하지 않고는 포착될 수 없다. 둘째, 대상들의 파악은 개인의 지식을 사용하지 않고는 일어날 수 없다. 이러한 지식의 축적은 학습경험과 배워 온 것을 회상하는 능력에 의존한다. 앞에서 논의했던 이론들은 이런 능력들에 대해서는 아무것도 말해주지 않았다. 그것들이 제 3 부의 주제이다.
읽을거리
그레고리 (Gregory, 1970, 1981) 는 무의식적 추론의 역할을 오래 옹호해 왔으며, 지각을 과학적 가설의 형성과 검증에 비유한다. 오틀리 (Oatley, 1978) 는 시각에서의 하향처리와 선화를 해석하는 컴퓨터 프로그램의 역할에 대해 흥미로운 설명을 한다. 많은 이러한 프로그램들의 세부사항들은 윈스턴 (Winston, 1975) 에서 발견될 수 있다. 핑커 (Pinker, 1984) 의 개론적인 논문은 심상과 모양 지각을 다루고 있다. 비더만 (Biederman, 1987) 은 일반화된 원추와 대상의 불변 단서들에 근거를 두고 있는 대상 재인 이론을 지지하는 실험 증거를 제시한다. 심상에 대한 주 연구들은 셰퍼드와 쿠퍼 (Cooper) (1982), 코슬린 (1980, 1983) 에서 주어진다. 필리쉰 (1984) 은 인지과학에 대한 자신의 일반적인 견해와, 기능적인 표상으로서의 영상에 대한 회의적 입장을 제시한다. 블록 (Block, 1981) 은 철학적 관점에서 쓴 심상에 대한 논문들을 편집하였다. 파라 (Farah, 1984) 는 심상에 대한 신경심리학을 간략하게 개관하고 있다.