(Seeing the world in depth)
컴퓨터와 마음 : Philip N. Johnson-Laird 지음, 이정모. 조혜자 옮김, 민음사, 1991, Page 96~123 (원서 : The Computer and the Mind: An Introduction to Cognitive Science, Harvard Univ. Press, 1988)
입체 대응 (stereo-matching) 의 두 제약조건 : 독특성과 연속성
엄지손가락 하나를 코에서 몇 인치 떨어지게 들고, 다른 엄지손가락은 그 손가락과 거의 같은 선상에서 팔길이만큼 떨어지게 들어 보자. 이제 한 눈을 감고 엄지손가락들을 본 다음, 다른 눈을 감고 그것들을 보자. 여러분은 그 손가락들이 서로 떨어진 거리가 각 눈에서 다르게 보인다는 것을 주목할 것이다. 물론 그 효과는 두 눈이 약간 다른 위치에서 세계를 보기 때문에 비롯되는 것이다. 이전 장에서 언급했던 시각의 초기단계에서는, 하나의 영상, 즉 각기 다른 강도를 가진 주영역들에 대한 조직화된 표상, 즉 일차 스케치를 만든다. 여러분이 본 엄지손가락들에 대한 장면은 여러분의 두 눈에 상이 어떻게 달리 맺히는가를 보여준다. 시각체계는 이러한 양안시 차이를 사용하여 사물들이 얼마나 여러분에게서 떨어져 있는가를 알게 한다. 입체시 (stereopsis), 즉 깊이 있는 (3 차원적) 세계를 보도록 하기 위한 불일치된 상들의 융합은 인간 시각의 주요소 중 하나이다. 이 장에서 나는 입체시와, 깊이 지각을 일으키는 그 외의 다른 단서들을 모두 검토하려고 한다.
그림 5.1 은 양안시 차이를 보여준다. 두 눈이 응시한 점이 무엇이건 간에 그 영상은 각 망막의 중심부, 즉 수용기들의 밀도가 가장 밀접한 곳에 맺힌다. 두 눈에 보이는 다른 어떤 점 역시 양 눈의 망막에 투사될 것이며, 그림이 보여주듯이, 그것이 두 눈 각각의 중심에서 떨어진 거리와 방향은 응시점과 관련된 공간적 위치에 의해서만 결정된다. 예를 들어 가까운 점은 두 눈의 망막의 중심에서 약간 떨어진 곳에 투사되지만, 두 눈의 관점이 다르기 때문에 거리나 방향은 눈마다 다르다. 양안시 차이의 크기와 방향이 알려지면, 삼각법 (trigonometry) 으로 그 점에 대한 상대적인 깊이를 포착할 수 있다.

그림 5.1 : 망막에 투사된 점들간의 차이.
여러분은 입체시가 설명하기 쉬운 것이라고 생각할지 모르나 그렇지 않다. 왜 그런지에 대해 아주 좋은 이유가 있다. 양안시 차이가 측정될 수 있으려면, 한 장면 내의 각 점에 대응되는 투사점들 (망막들에서의) 은 두 시각 상이 서로 대응되어야만 한다. 이 단계가 수수께끼이다. 두 영상들간에 양안시 차이가 있기 때문에 망막의 동일한 장소를 탐색해 보는 것은 소용이 없다. 한 방식은 그 장면 내의 대상들을 파악하고, 그리고 두 영상들의 여러 부분들을 맞추어 보는 것이다. 이러한 방법은 대상들의 구조를 사용하여 영상들 내의 점들을 맞추어 보는 하위 수준 과제를 진행시킨다. 일반적으로 이는 <하향 (top - down)> 처리로 알려진 것의 한 예이다. 그러나 입체시에 의해 대사의 상대적인 깊이와 그 표면의 방향이 확정되기 이전에 대상의 정체가 파악될 수 있다는 것은 상상하기 어렵다. 또 다른 절차는 회색 수준 배열들 쌍의 강도값을 맞추어 보는 것이다. 이 방법은 가장 낮은 형태의 자료를 사용하며, 일반적으로 <상향 (bottom - up)> 처리로 알려진 것의 한 예가 된다. 그러나 불행히도 대응되는 두 점들의 강도는 두눈에서 서로 아주 다를 수도 있기 때문에 강도값으로 입체지각을 다룰 수 있는 방법은 없다. 만약 여러분이 한 눈에 선글라스 안경알 하나를 걸친다면, 그 안경알이 한눈에 들어오는 빛의 강도를 감소시키더라도 여러분은 여전히 깊이가 있는 세상을 볼 것이다.
상향처리이냐, 하향처리이냐, 아니면 두 개가 조합된 처리이냐는 물음은, 자료의 구조를 부여하기 위해 어떤 원리에 따라 프로그램이 사용될 때마다 제기되는 물음이다. 프로그램은 두 개 중 어느 한 양식으로 조작하거나, 하나씩 교대하거나, 아니면 그 둘을 병렬적으로 함께 수향하도록 고안될 수 있다. 하향적으로 작동할 때, 프로그램은 자료 내에서 발견될 세부사항들을 예측하는 원리들을 사용한다. 예를 들어 프로그램은 망막의 차이를 예측하기 위해 대상들의 구조를 사용한다. 상향적으로 작동할 때, 프로그램은 상위 수준의 구조를 예언하기 위해 그 원리들을 사용한다. 예를 들어 망막의 차이를 사용하여 대상들의 구조를 예측한다. 어떻게 진행해야 할지에 대해 불확실한 점이 있는 경우에는, 두 양식은 모두 예언적이지만 각기 다른 것들을 예측한다.
어떤 양식이 가장 좋은가? 일반적인 답변은 없다. 계산적인 고려만으로 어떤 양식이 인지체계에서 채택되어 왔는지를 결정할 수는 없다. 우리가 필요로 하는 것은 증거이고, 우리는 두 가지 실험적인 방법은 사용할 수 있다. 둘째, 만약에 입력 정보가 심하게 부실한데도 그 체계가 대처할 수 있는지 여부를 보는 것이다. 그럴 수 있다면, 그 과정은 전적으로 자료 주도적인 것이 아니고, 상위 수준의 지식을 이용하여 하향적으로 작업할 수 있다. 우리는 차례로 두 방법의 예들을 모두 볼 것이다. 첫 번째 방법은 입체시의 연구에서 결정적임이 입증되었다.
입체경 (stereoscope) 은 빅토리아 시대의 고안품으로서, 한 장면에 대한 (약간 다른 관점에서 찍은) 두 사진들을 두 눈에 각기 분리하여 제시하는 것이다. 시각 체계는 이 두 영상을 융합함으로써, 보는 사람으로 하여금 생생한 깊이가 있는 하나의 단일한 장면을 보게 한다. 여러분은 작은 사각 거울 두 개를 매달고서, 그림 5.2 에 나오는 배열로 그 다음 페이지들에 나오는 그림들을 비춤으로써 단순한 입체경을 구성할 수 있다. 왼쪽 눈은 왼편 사진을 , 오른쪽 눈은 오른편 사진을 보고, 두 영상들이 융합될 수 있도록 확인해 보자. 만약 여러분이 그림 5.3 (a) 와 (b) 를 본다면, 그것들은 갑자기 깊이가 드러날 것이다. 여러분은 책을 거꾸로 돌려볼 수 있고, 그러면 그 깊이의 효과가 반대로 나타나야 할 것이다. 어떤 사람들에게는 깊이가 1 분이나 2 분 걸려 나타난다. 그러나 다른 사람들, 예를들어 약한 사시나 <약시 (lazy eye)>, 그 외의 약한 시각적 결함을 겪고 있는 약 10 퍼센트의 사람들에게는 그것이 전혀 나타나지 않을 수도 있다.
그림 5.2 : 이 책의 입체도를 보기 위해 사용할 입체경. 외쪽 눈 (도형의 아래)은 왼편 그림을 보고 오른쪽 눈은 오른편 그림을 본다.
입체시에 대한 중요한 발견은 훌렌츠 (Bela Julesz) 에 의해 이루어졌다. 그는 무선점들로 구성된 사진들이 입체경에서 보여질 때 깊이의 효과를 만들 수 있음을 발견하였다. 여러분이 그림 5.4 (a) 와 (b) 를 본다면, 여러분은 중앙에서 네모의 깊이가 주변과 다름을 볼 것이다.
물론 훌렌츠의 발견이 시사하는 바는 분명한 대상들의 구조가 없이 단순한 양안시 차이만으로도 입체시가 상향적으로 작용할 수 있다는 것이다. 여러분은 그림 5.4 에서 입체시가 일어나지 않는다면 네모를 볼 수 없다. 그 무선점들은 네모에 대한 어떤 단서도 제공하지 않기 때문이다. 거꾸로 말하면, 분명한 사위 수준의 지식이 입체시에 도움이 되지 않는다. 프리스미 (John Frisby) 와 클랫워시 (John Clatworthy) 는 사람들에게 그들이 무엇을 보아야 할지를 먼저 말해 주거나, 또는 삼차원의 모형을 제시해 준다 해도 무선점 입체도형에서의 깊이 지각이 빨라지지 못함을 발견하였다. 입체시는 다른 시각과정들과는 아주 독립적일 수 있다. 그것은 독립적인 (분리된) 시각체계 단원 (module) 주석 (최근 정보처리의 단원체계 (module system) 를 제안하는 입장에서는 정보처리체계가 각각의 독자적인 기능을 갖는 여러 단원들로 이루어져 있다고 본다. 이때 단원은 자체 내의 특수한 원리들에 따라 그 성분이 운영되는 구조이다.) 일는지도 모른다.

그림 5.3 : 입체적으로 보여지게 되는 기하학적 도형들 쌍.
그림 5.4 : 무선점 입체도형 쌍.
마 (Marr) 가 강조했듯이, 입체시의 대응과정을 이끌어 나가게끔 뇌에 생득적으로 내장될 수 있는 세상에 관한 사실에는 두 가지가 있다. 첫째 사실은 우리가 앞에서 보았던 제약으로서, 하나의 사물이 동일한 시간에 두 장소에 있을 수 없다는 것이다. 어떤 영상 내의 한 점은 정상적으로 다른 영상 내의 한 점과만 대응될 수 있다는 것이 바로 이 독특성 (uniqueness) 제약조건에서 비롯되어 나온다. 두 번째 사실은 대상들의 표면은 보통 불투명하고 비교적 밋밋해서, 관찰자에게 보이게 되는 그에 대한 깊이는 한 극단에서 다른 극단으로 급변하기보다는 연속적으로 변화한다는 것이다. 바로 이 연속성 (continuity) 제약조건에서부터, 한 영상 내의 근접한 점들은 눈으로부터 거의 같은 깊이의 장면점들을 표상하는 것이라는 결과가 가능해진다.
두 제약조건들을 설명하기 위해, 한 관찰자가 하나의 사물을 바라보고 있다고 상상해 보고, 그것의 표면에 접근한 세 점들을 고려해 보자. 그림 5.5 에서 보여지는 바와 같이 각 눈의 시야에는 세 점들과 대응하는 세 선들이 있다. 시선들은 9 개의 가능한 융합점들을 갖는다. 대응의 문제는 그것들 중 어느 것이 사물 표면의 실제 점들을 표상하는 참 대응이냐는 것이다. 독특성 제약에 의하면 각각의 시선에 대해 있을 수 있는 점은 하나뿐이라는 것을 시사한다. 따라서 여기에서는 단지 세 개의 순수한 대응만이 있을 수 있고, 각 시선에서는 하나의 대응만이 있을 수 있다. 그림 5.6 (a) 에서 묘사된 가설적인 대응은 가능하지만, 그림 5.6 (b)에서 묘사된 가설적인 대응은 이 제약에 의해 기각된다. 사물들의 표면이 부드럽게 변화한다는 사실을 반영하는 제약인 연속성 제약은 그림 5.6 (a) 의 해석을 기각한다. 두 제약조건 모두에 일치하는 해석은 그림 5.7 에서 보여진다. 세 개의 근접점들이 관찰자에게서 거의 같은 거리로 떨어져 한 사물의 표면 위에 놓여 있다.

그림 5.5 : 각 눈에서 나온 세 개씩의 시선은 9 개의 가능한 융합점을 생성한다.
그림 5.6 : (a) 앞 그림의 시선들에서 세 개의 점들은 융합이 가능하다.
(b) 독특성 제약조건을 위반한 융합.

그림 5.7 : 그림 5.5 의 시선들의 융합 중 독특성 제약과 연속성 제약을 모두 만족하는 단 하나의 경우.
그림 5.5에서 묘사된 가능한 융합점들은 인간 마음 내의 심적 처리기 배열에 의해, 즉 각각의 가능한 융합에 대해 하나의 처리기로 표상될 수 있다. 만약에 각 처리기가 활성적이거나 비활성적이거나 둘 중 하나이며 활성화 정도가 융합확률을 나타낸다면, 앞서 기술한 바 있는 제약조건들은 처리기들을 적절히 연결시킴으로써 구현될 수 있다. 독특성 제약은 같은 시선의 처리기들 사이에 억제 연쇄를 요구함으로써, 어떤 한 처리기가 가능한 융합을 나타낼 때마다 다른 처리기들을 억제하는 것이다. 이러한 도식은 그림 5.8에서 보여진다. 연속성 제약도 유사한 방식으로 배열되어, 하나의 처리기가 가능한 융합을 나타낼 때마다 그것은 관찰자에게 깊이를 보여주는 다른 처리기들을 모두 활성화시킨다. 이 그림들은 한 장면의 점들의 단일 수평 집합만을 보여준다. 보다 완전한 체계는 모든 수평 수준에 대한 (아니면 무선점 배열 내의 모든 수평 열에 대한) 처리기들을 필요로 할 것이다. (그림 5.9)
그림 5.8 : 두 눈으로부터 나온 시선들에서 가능한 모든 융합점을 나타내는 위의 배열에서, 독특성 제약은 각 시선상의 억제적 연결에 의해 구현시킬 수 있다. 그림에서 각 연결은 억제적이고, 따라서 한 융합점이 활성적이면 그것은 그에 연결된 모든 융합점들을 억제한다.

그림 5.9 : 두 눈으로부터 나온 시선들에서 가능한 모든 융합점을 나타내는 위의 배열에서, 연속성 제약은 두 눈에서 동일한 거리에 있는 융합점들 간의 활성적 연결에 의해 구현시킬 수 있다. 그림에서 각 연결은 활성적이고, 따라서 한 융합점이 활성적이면 그것은 연결된 모든 융합점들을 활성화시킨다.
마 (Marr)와 포지오(Poggio)는 독특성과 연속성 제약에 근거하여 입체시에 대한 컴퓨터 프로그램을 고안하였다. 그것은 무선점들을 표상하는 요소들을 직접 다룬다. 따라서 문제는 한 배열에 있는 한 점과 다른 배열에 있는 그 짝이 비록 각각의 배열 내에서 약간 다른 수평위치에 있을지라도 그것들이 대응되는 방식을 발견해 내는 것이다. (깊이 지각을 만드는 양안시 차이도 그런 차이를 만든다). 이런 식으로 왼쪽 배열에 있는 한 열에서 나온 한 조각은 다음의 계열 형태로 이루어질 수 있다:
![]()
반면 오른쪽 배열에서 나온 동일한 조각은 다음의 계열형태로 이루어질 것이다.

그 프로그램은 많은 계산을 요구하지만, 이론상 여러 계산들은 동시에 병렬적으로 수행될 수 있다. 기본 착상은 수많은 처리기 배열을 사용하는 것으로서, 각각의 처리기는 특정 지역값, 즉 자신의 값과 이웃한 것들의 값에 대해 동일한 계산을 수행한다. 그리고서 처리기에서 나온 결과는 새로운 활동 주기에서 사용되고, 전체 체계는 각 처리기에 안정된 값들이 자리잡을 때까지 계산을 계속한다. 이러한 계산형태는 <완화 (relaxation)>로 알려진 것으로, 체계는 점차 안정된 값의 구성으로 완화되어 간다. 재무 계산을 할 수 있는 소형 컴퓨터용 스프레드쉬트 (spreadsheet) 프로그램은 이와 같은 방식으로 사용될 수 있다.
입체도형에 대한 완화 프로그램은 그림 5.4 와 같은 입체도형 쌍에서 나온 열들을 초기 입력으로 취하고, 처리기 배열은 가능한 융합들의 집합을 찾아낸다. 이 배열은 삼차원적이고, 그것에서 나온 이차원적인 각각의 조각은 두 개의 입체도형에서 나온 하나의 수평열에 대응한다. 그림 5.10 이 보여주는 것과 같이 그것은 두 열들 내의 점들이 만들 수 있는 가능한 융합에 따른 각기 다른 깊이를 모두 표상한다. 그 배열 내의 각 처리기는 하나의 신경세포와 어느 정도 유사한 유한상태의 장치 (제 3 장 참조) 이다. 그것은 활성적이거나 비활성적이다. 만약 활성적이면, 일반적으로 그것은 그 배열의 가장자리에서 입력된 두 점들 간의 한 융합점을 표상한다. 그것이 비활성적이라면, 그것은 일반적으로 융합점이 아닌 한 점을 표상한다. 독특성 제약과 연속성 제약은 직접적으로 구현된다. 처리기들은 같은 깊이의 평면에 있는 이웃한 것들과 다른 수평면에 있는 이웃한 것들에서부터 (연속성 제약에 따라) 흥분을 받는다. 그것들은 동일 시선 내의 처리기들로부터 (독특성 제약에 따라) 억제를 받는다. 처리기들은 역치 (threshold) 를 가지며, 흥분과 억제의 조합이 역치값을 넘을 때에만 활성화된다. 입체도형이 그 배열로 입력된 후, 그것은 일련의 주기를 통해 진행되며 그것이 안정된 형태 (configuration) 로 정착할 때까지 계속된다. 이 형태는 두 입체도형들 간의 적절한 대응을 표상하며, 입체도형 내의 각 점의 상대적인 깊이를 명료화시킨다.
그림 5.10 : 두 개의 입체도형 조각들에서 융합점을 계산하는 처리기 배열.
그림 5.11 : <완화> 방법을 써서 무선점 입체도형에서 깊이를 산출해 내는 처리기능들의 3 차원적 배열의 주기 계열 (From J. P. Friby, Seeing : Illusion, Brain and Mind. Oxford : Oxford University Press, 1979, p. 151)
두 입체도형의 깊이에 대한 해석을 점진적으로 드러내 주는 주기에 대한 순서 도표가 그림 5.11 에 제시되어 있다. 여기에서 각 평면들은 각기 다른 깊이를 나타내고, 그것들은 그림 5.10에서 본 입체도형들에서 나온 조각들과의 직각을 이루고 있다.
이론상, 프로그램은 많은 양의 계산이 병렬적으로 진행되도록 할 수 있다. 각각의 처리기는 그 이웃한 것들로부터 나온 결과들에 대한 정보만을 필요로 하기 때문이다. 그렇다 할지라도, 처리과정은 많은 주기를 필요로 하며, 실제의 신경세포들이 다소 느리다는 점을 고려할 때 (예컨대, 각 주기에 1/100 초가 걸림), 포유류의 시각을 수행하기에는 시간이 너무 오래 걸릴 수도 있다.
무선점 프로그램은 흥미있는 계산원리와, 대응시에 제약조건들이 구현하는 방식을 보여준다. 그러나 심리학적으로 가능성 있는 절차를 개발하기 위해 우리는 인간이 입체시에 사용하는 입력정보를 발견해 낼 필요가 있다. 그것들은 어떤 종류이건 간에 하위 수준의 자료들이겠지만, 어떤 요소들이 실제로 대응이 되는 것일까? 회색 수준 배열에서 강도는 조도의 변화에 영향을 받았다. 따라서 강도는 표면의 물리적인 특징들과는 직접 대응되지 않는다. 그러나 연속성 제약이 적용되는 것은 표면이다. 따라서 대응되어야 하는 요소들은 표면의 표상에 가까운 어떤 것이어야만 한다. 마와 그 동료들은 영점 교차가 대응해야 하는 요소의 분명한 후보라고 생각했고, 그들은 영점교차들을 대응시키는 프로그램을 고안하였다. 영점교차란 어두운 부위에서 밝은 곳으로 (왼쪽에서 오른쪽으로) 이동하는 경계를 지적하느냐, 아니면 밝은 부위에서 어두운 부위로 이동하는 경계를 지적하느냐에 따라 양의 부호나 음의 부호가 주어지는 것이다.
그 프로그램은 처음에는 크기가 큰 멕시코 모자 (그림 4.5 참조를 통해 회색 수준 배열을 여과시킴으로써 얻어진 (동일 부호의) 영점 교차들을 맞추어 본다. 그것은 영점 교차들을 따라 한 점 한 점 진행되지만 그 위치에 대하여는 별로 상관하지 않는다. 큰 여과기로 시작하는 이유는 영점 교차가 상대적으로 드문 조야한 영상을 만들어주기 대문이다. 만약 사람들이 멕시코 모자의 중앙 정점의 넓이에 해당하는 부위 내에서만 탐색을 한다면, 대응 오류를 일으킬 확률은 훨씬 적다. 한 영상 내의 어떤 영점 교차가 다른 영상 내에서 두 개의 대응점을 갖는다면, 이 탐색 영역 내에서 하나의 대응은 응시점보다는 관찰자와 더 가까운 점에 상응되는 것일 것이고, 다른 대응은 더 멀리 있는 한 점에 해당할 것이다. 모호성은 이미 대응처리가 된 것 중 가장 인접한 것과 동일한 종류의 대응을 만듦으로써 해결될 수 있다. 이러한 방법은 연속성 제약을 구현하는 것이다. 즉 표면의 한 부분이 관찰자로부터 특정 깊이에 있다면, 동일 표면에서 인접한 부분은 거의 같은 깊이에 있어야만 할 거시다. 처리의 시초에 있어서 이러한 대응 절차는 조야하게 여과된 영상을 도출하게 한다. 그리고서 이러한 절차는 작은 크기의 멕시코 모자로부터 얻어진 영점 교차들에서 반복될 수 있다. 마침내 가장 작은 크기의 여과기로 얻어진 영상들이 대응되면 이는 양안시 차이의 정확한 크기를 계산하는 데 사용될 수 있고, 양안시 차이의 크기에서 상대적인 깊이가 계산된다.
이 프로그램은 무선점들에 대한 완화 방법보다 심리학적으로 더 그럴 듯하다. 그것은 로봇 시각에도 적합하다. 그림은 (Eric Grimson) 은 이 프로그램을 항공 입체사진을 다루도록 확장시켜, 항공 입체사진이 묘사하는 지표면의 상대적인 깊이 정도를 명료히 나타낼 수 있도록 하였다 (깊이는 위장을 노출시키는 데에 아주 좋을 수 있다). 그러나 인간의 입체시도 이와 동일한 절차를 사용하는지는 분명하지 않다. 분명히 인간의 체계는 양안시 차이들에 민감하다. 신경생리학자인 블랙모어 (Collin Blackmore) 는 포유류의 시각 피질 내에 세포들로 이루어진 열 (column) 이 존재하며, 한 열 내의 각 세포는 동일 시선 내의 각기 다른 양안시 차이가 정확히 무엇들 사이의 차이인지 수수께끼이다. 문제는 마가 말한 것처럼 영점 교차가 후보라는 답변이 맞는 것 같지 않다는 점이다. 메이휴와 프리스비는 영점 교차보다는, 경사변화에서 이웃한 정점들이 입체시에 사용되는 경우들이 있다는 것을 입증하였다. 게다가 그레고리 (Richard Gregory)와 그 동료들은 사물의 가장자리 (최선의 영점 교차)가 입체시 대응되는 요소들에 항상 대응하는 것이 아님을 발견하였다. 그리고, 이전 장에서 개관한 와트 (R. Watt)와 모건 (M. Morgan)의 분석이 맞다면, 영점 교차는 세상을 깊이 있게 보는데 중요한 역할을 담당하지 않는다. 안전한 결론은 입체시가 일차 스케치의 하위 수준의 요소들에서 수행되어 나올 수 있으며, 대응 절차는 물리적 세계의 성질에서부터 비롯되는 생득적인 제약에 의해 주도되어야 한다는 것이다. 일단 요소들이 대응되면 입체시의 나머지는 대체로 삼각법적으로 해결된다.
깁슨 (James J. Gibson) 은 여러 해 동안 그림 5.12 에서 묘사된 것과 같은 결의 경사도가 깊이와 표면, 방향에 대한 정보의 주 원천이라고 논의했다. 결의 경사는 한 표면상에 규칙적인 간격으로 놓여진 동일 모양과 크기를 지닌 사물들이나 표시물들에 의해 만들어진다. 경사는 표면의 방향, 즉 관찰자와 관련하여 그것이 기울어진 정도와 방향을 나타내 준다. 깊이와 표면 방향과의 관련은 분명하다 : 즉 어떤 표면의 각 부분이 한 관찰자로부터 어떠한 깊이에 있는가를 고려하면 그 방향 역시 결정된다. 따라서 시각체계는 결의 경사 내에 있는 정보에 직접적으로 반응할 수도 잇다. 예를 들어 그것은 경사의 축을 요소들의 밀도가 가장 많이 변화하는 방향과 수직되게 놓음으로써 표면의 기울기를 계산할 수 있다. 이와 같은 방법들을 사용하는 컴퓨터 프로그램이 있기는 하지만, 어떻게 인간의 시각체계가 결의 경사를 해석하는지에 대해서는 거의 알려져 있지 않다.
깊이를 지각하는 다른 가능한 단서들이 있다. 어떤 단서들은 모양이나 방향보다는 거리에 대한 정보를 더 많이 제시한다. 먼 사물들은 더 흐리고, 더 푸르스름하며, 시각 장에서 보통 높은 곳에 있다 ; 그리고 기차길이나 건물의 측면과 같이 평행적인 가장자리들은 거리가 멀어지면서 수렴된다. 한편 다른 단서들은 사물의 모양을 나타내 준다. 한 대상의 이동이나 관찰자의 이동은 하나 이상의 관점에서 보도록 하고, 이는 삼차원적인 모양을 결정하는데 도움이 될 수 있다. 한 대상이 배경과 이루는 현저한 경계, 즉 외부 윤곽은 그 대상의 모양에 대한 주요 단서이다. 이제 이들 단서를 보다 상세히 다루겠다.
그림 5.12 : 결의 경사도 대한 두 예. (From J. J. Gibson, The Perception of the Visual World. Boston : Houghton. Mifflin, 1950 ; pp. 84, 86. Copyright © 1950 by James J. Gibson, renewed 1977 by Houghton Mifflin Company.)
대상의 운동이 그 대상의 모양을 나타낼 수 있다. 울만 (Shimon Ullman) 은 이 문제를 교묘하게 보여주었다 : 점들의 집합을 스크린에 투사하는 것이다. 점들이 정지해 있을 때 관찰자는 단지 스크린 가득히 무선적으로 분포된 점들만을 본다. 그러나 점들이 움직이면 그 배열은 갑자기 살아 움직이게 된다. 관찰자는 두 개의 원통이 반대방향으로 도는 것을 보게 된다. 그 효과는 회전축이 순간순간 갑작스럽게 변화해도 일어난다. 사실상 거기에 원통은 없다 : 그 진열은 컴퓨터 프로그램에 의해 제조된 것으로서, 아무것도 투사하지 않고, 단지 점들로 이루어진 그림들이 움직이는 순서가 있을 뿐이다 (그림 5.13 참조). 원통의 모양을 만드는 것은 점들의 운동인 것이다.
그림 5.13 : 울만의 무선점들로 이루어진 회전하는 실린더 (스크린에는 점들만이 투사된다). (From S. Ullman, The Interpretation of Visual Motion. Cambridge, Mass. : MIT Press, 1979)
운동으로부터 하나의 대상의 모양이 포착되는 문제는 입체시의 문제와 유사하다. 시각체계는 짧은 시간을 두고 따로 떨어진 두 개의 영상 내에서 움직인 대상 위의 대응점들을 서로 부합시켜야만 하고, 그리고서 각 점이 움직였던 양을 사용하여 그 대상의 상응부분들의 깊이 (와 운동의 방향) 를 결정한다. 입체시에서처럼, 운동에서의 대응은 하나의 대상이 주어진 시간에 한 장소로만 움직일 수 있다는, 시간에서의 독특성 제약원리 때문에 독특해야만 한다. 물론, 대상들은 입체시에서처럼 나타났다 사라지며, 한눈에 보이거나 보이지 않거나 할 수도 있다. 그러나 입체시와 운동 지각 간에는 중요한 차이가 있다. 어떤 순간에 두 눈은 동일한 모양을 본다 ; 그러나 대상의 모양은 여러분이 주먹을 쥐었다 폈다 할 때처럼 조만간 계속 변화할 수 있다.
울만은 움직이는 영상들 사이에서 대응이 일어날 수 있는가에 대한 계산이론을 형성했다. 그러나 입체시에서처럼 거기에는 몇가지 해결되지 않는 문제들이 있다. 그 체계에 대한 입력정보는 회색 수준 배열일 수는 없다. 그러나 그것이 무엇인지는 물음으로 남아 잇다. 마는 아마도 영점 교차가 사용될 것이라는 힌트를 다시 주지만, 이런 생각에는 문제점들이 있다.
하나의 영상이 다음 영상과 대응되었다면, 다음 단계는 그것들을 해석하는 것이다. 이 과정은 해석을 하기 위해 제약조건들을 필요로 한다. 하나의 제약은 대상들이 비교적 견고하고나, 비교적 견고한 부분들로 만들어지는 경향이 있다는 것이다. 견고성 (rigidity) 의 중요성은 스웨덴의 심리학자 요한슨 (Gunnar Johansson) 이 보여주었다. 그는 깜깜한 방안에서 사람의 주요 관절에만 작은 불들을 달아놓았을 때, 비록 실제로 볼 수 있는 것은 작은 불빛들의 궤도 이외에 아무것도 없지만. 관찰자는 걷고 있는 사람을 충분히 지각할 수 있음을 발견했다. 그러나 그 불들을 다리 중간에 부착시키면 사람의 움직임을 알아보는 것이 더 이상 가능하지 않다. 분명히 시각 체계는 가까이 있는 불빛들이 물체들에 의해 연결되어 있다고 가정한다. 그렇지 않을 때는 두 번째 경우에서처럼, 불빛의 운동에서 인간의 모습을 지각할 수 없었다.
울만은 견고성 가정에 의해, 시간적으로 분리된 영상들을 가지고도 움직이는 대상들의 구조를 충분히 추측할 수 있다는 것을 보여주었다. 하나의 견고한 대상 위에 있는 네 점들을 세 개의 연속적인 관점에서 서로 대응시킬 수 있다고 한다면, 그것들의 정적인 (static) 삼차원의 형태가 재구성될 수 있다. 네 개의 점들은 동일한 평면 내에 있어서는 안된다. 그것들은 조망적이라기보다는 병렬적으로 시각 상에 투사될 것으로 가정되기 때문에, 어떤 것이 더 가까운 점들이고, 어떤 것이 더 떨어진 점들인가는 애매하다. 어떤 형태들은 정보를 덜 요구하기는 하지만, 네 점들에 대한 세 관점이 삼차원적 형태 파악에 하나의 해결을 보장한다.
그림 5.14 : 공항에 착륙하는 비행기 조종사에게 나타나는 광학적 흐름의 장. (From J. J. Gibson, The Perception of the Visual World. Boston : Houghton Mifflin, 1950. Copyright © 1950 by Jame J. Gibson, renewed 1977 by Houghton Mifflin Company.)
울만의 증명은 동일 평면에 놓인 점들에 적용되지 않는다. 바로 이런 배열은 그림 5.14 에서 보이듯이 비행기를 착륙시키는 조종사가 당면한 상황의 예에서처럼, 한 관찰자가 큰 표면과 관련하여 움직이고 있는 <광학적 흐름 (optical flow)> 의 경우에서 일어난다. 광학적 흐름을 설명하는 수학은 롱겟 히긴스 (C. Longuet - Higgins) 에 의해 확립되엇다. 원칙적으로 견고한 표면의 방향과, 그것과 관련된 눈의 움직임은 한 눈 위에서 변화하는 영상의 순간적인 속도에 의해 결정될 수 잇다. 이와 관련된 계산은 견고성 가정을 검토하는 것이다. 그러나 그러한 계산이 인간의 시각에서 일어나는지에 대한 증거는 아직 없다.
나는 손을 불빛과 벽 사이에 들고서 적절하게 조작한다. 여러분이 벽 위에서 보는 것은 토끼의 그림자이다. 이 현상은 시각의 불가능성에 대한 논의를 다시 불러일으킨다 : 동일한 이차원적인 그림자를 일으킬 수 있는 각기 다른 삼차원적인 모양들은 수없이 많다. 그러나 여러분은 어떻게 토끼를 보는 것일까?
그런 질문은 그림자에서 뿐 아니라, 실루엣과, 배경에 대조되어 있는 대상의 윤곽 (관찰자에게서 떨어진 표면 깊이에 비연속성이 있는 곳) 에서도 일어난다. 다시 문제는 시각이 토끼와 같은 대상에 대한 지식에 의존하는 것인지, 아니면 하위 수준 가정들을 사용하여 시각 자료들에서부터 상향적으로 처리하는지가 된다.
마는 대상들의 그림자와 실루엣. 윤곽을 해석하는데에는 하위 수준의 생득적인 제약들이 있다고 논의하였다. 시각체계는 한 윤곽에 대한 영상 내의 각 점들이 그것을 야기시킨 대상의 실제 윤곽과 일 대 일로 대응될 수 있으며, 윤곽의 영상 내의 인접점들은 대상의 인접점들에서 비롯되고, 대상의 점들은 단일 평면에 놓여 있다고 가정한다. 다시 말해 여러분이 자신의 손의 윤곽을 볼 때, 각 시선은 그 표면 위의 한 점을 스쳐 지나가며, 이런 점들이 동일한 평면의 대상을 밖으로 감싸는 하나의 연속적인 윤곽을 만든다.
물론 이런 원리들에는 예외가 있다. 한 대상의 분리된 두 부분들이 특정한 관점에서는 아주 똑같이 보이는 윤곽을 만들 수도 있다. 만약 여러분이 손가락을 붙이고 손을 세워서 측면에서 손을 본다면, 여러 손가락들이 여러 부분에서 일치하는 실루엣을 만들 수도 있다. 비슷하게 여러분이 여러분의 손을 약간 돌리면 그 실루엣의 인접 점들은 두 개의 아주 다른 손가락들에 속할 수도 있다. 물론 그것의 실루엣은 동일한 평면에 놓여 있는 점들로 이루어져 있지는 않을 것이다. 일반적으로 그러한 위반이 일어날 때, 그것이 여러분의 손등만큼 친숙한 것이 아니라면 그 실루엣에서 대상의 진정한 삼차원의 모습을 보는 것은 불가능하다. 그러나 대상의 인접점들과 영상의 인접점들이 대응되고 또 동일한 단일 평면 위에 놓여 있다는 가정이 타당하면, 시각체계는 대개 대상의 참모습을 지각할 수 있다.
2¹/₂차원 스케치
불가능한 것처럼 여겨지는 과제를 수행할 때마다, 마음은 세계에 대해 별도의 독립적인 정보를 가져야 한다. 시각은 불가능한 것으로 보이지만, 진화는 그것에 대처할 수 있는 생득적인 제약을 시각체계에 마련해주었다. 독특성과 표면의 연속성, 견고성, 그리고 윤곽에서의 제약들은 모두 일차 스케치에서 나온 표면의 깊이와 방향을 표착하는 데 일익을 담당한다. 생리적으로 중요한 다른 단서들도 있다. 예를 들어 표면의 명도 (brightness) 와 색채 (hue), 그리고 그림자와 표면 윤곽이다. 그것들 역시 그런 기존의 제약에 의존하여, 자동적이고, 무의식적으로 작동하며, 대상에 대한 지식에 의해서는 비교적 영향받지 않을 수 있을지도 모른다. 그것들은 사람들이 순수한 (pure) 지각이라고 부르는 것의 일부이다. 지각체계란 시각 단원들 (modules)의 집합으로서, 회색 수준 배열의 일차 스케치로 전환시키는 상향적인 양상으로 작용하며, 그리고는 입체시를 수행하고, 운동을 해석하며, 윤곽에서부터 모양을 포착해 내고, 표면 지각을 가능케 하는 모든 다른 과정들을 수행한다.

그림 5.15 : 2¹/₂차원 스케치의 착시.
(From D. Marr, Vision. San Francisco : W. H. Freeman, 1982, p. 129)
마의 시각이론의 초석은, 순수 지각의 마지막 단계에서 한 장면에서 보이는 각 표면의 상대적인 깊이와 (관찰자와 관련된) 방향에 대해 분명한 표상을 제공하는 것이다. 그는 이 표상을 <2¹/₂차원 스케치 (two - and - half dimensional sketch> 라고 부른다. 이 표현은 글자 그대로 받아들여서는 안된다 : 그것은 깊이가 관찰자와 상대적으로 결정되기 때문에, 대상들간에 있는 모든 삼차원적인 관계를 분명히 해주지는 못하는 표상을 지칭하는 것이다. 그 표상은 흔히 각각의 핀이 표면 부위의 깊이와 방향을 표현하는 핀꽂이 (pin - cushion) 처럼 보이는 도형으로 묘사된다 (그림 5.15 참조). 2¹/₂차원 스케치의 근원은 입체시와, 운동, 윤곽, 그리고 이전 장에서 논했었던 모든 다른 깊이 단서들이다. 2¹/₂차원 스케치는 그 단서들이 제공하는 정보를 통합하여 표면의 빠진 부분들을 채우면서, 일관성을 확립시킨다고 할 수 있다. 사실상 인간의 시각체계가 그러한 표상을 구성하는지는 알려져 있지 않다.
이런 정보 근원들 중 많은 것들을 컴퓨터 프로그램들이 구현하여 왔지만, 불행히도 우리 로봇에게 세계를 깊이 있게 보도록 하는 과정들을 모두 모형화하는 것은 아직 가능하지 않다. 더욱이 2¹/₂차원 스케치는 로봇이 세계를 안전하게 항해하기에는 충분하지 않다. 왜냐하면 그것은 단지 로봇의 관점에서 본 표면들의 모습만 분명히 하기 때문이다. 다음 장에서 보겠지만, 어떤 장면에 대한 적절한 표상은 대상들이 파악될 수 있도록 하는 것이어야 하고, 따라서 특정 관점과는 독립적일 필요가 있다. 대상 전체의 파악은 더 이상 순수한 지각의 문제가 아니다. 왜냐하면 그것은 한 개인 자신의 경험의 결과인 가정들에 의존하기 때문이다.
읽을거리
마 (1982) 와 울만 (1979) 은 이 장의 내용들에 대한 가장 좋은 출처이다. Artificial Intelligence (1981, Vol. 17) 와 Cognition (1984, Vol. 18) 특집은 시각에 대한 것만을 다루고 있다. 쾬데링크 (Koenderink, 1984) 는 모양에 대한 단서로서의 윤곽의 역할을 설명하고, 또한 마의 분석의 오류들을 지적한다. 브래디 (Brady, 1983) 는 모양에 대한 분석을 기계 시각의 관점에서 고려한다. 입체시 기제의 예에서 드러난 마의 시각 단원에 대한 견해는 포더 (Fodor, 1983) 로 하여금 다른 논의와 더불어 마음의 대부분에 대한 단원적인 구조를 제안하도록 하였다.