데이터 마이닝의 개요

 

데이터 마이닝 : 장남식.홍성완.장재호 지음, 대청미디어, 1999

 

1. 등장배경

(1) 정보화 시대의 도래

(2) 정보기술의 가속적 발전

(3) 전통적인 전문가시스템의 한계

(4) 데이터의 홍수, 정보의 빈곤

2. 정의 및 유사개념

(1) 정의

(2) data mining과 지식발견

(3) data mining과 기존의 조회 도구

3. 작업유형

(1) 연관(Association) 규칙

(2) 연속(Sequence) 규칙

(3) 분류(Classification) 규칙

(4) 데이터 군집화(Clustering)

4. 응용분야

5. 프로젝트를 위한 고려사항

(1) 목표 및 활용방안

(2) 데이터의 충실도

(3) 법률문제

(4) 전문 인력 확보

(5) 적절한 data mining 도구

 

 

기업간의 경쟁이 심화되고 정보의 중요성에 대한 인식이 확산됨에 따라 대량의 데이터에서 유용한 정보를 캐내는 'data mining'이 주목 받고 있다. 이미 외국에서는 다양한 연구와 프로젝트가 추진되어 그 결과물들이 속속 발표되고 있으나 국내의 경우 data mining의 전 단계라 할 수 있는 데이터웨어하우스(data warehouse) 구축 작업이 일부 진행되고 잇을 뿐 본격적으로 data mining을 적용한 사례를 찾기는 어렵다. 그러나 21세기 기업경영에서 데이터베이스마케팅(Database Marketing)이나 고객관계관리(CRM: Customer Relationship Management), 위험관리(Risk Management) 등의 중요성이 크게 부각되기 시작하면서 국내에서도 다양한 분야에서 data mining 작업이 이루어질 전망이다. 이 장에서는 아직은 우리 귀에 생소한 data mining에 대한 전반적인 개요를 등장배경 및 정의, 대표적인 작업유형과 산업별 주요 응용 분야, 그리고 프로젝트 수행시 고려해야 할 사항 등을 통해 설명하고자 한다.

1. 등장배경

  (1) 정보화 시대의 도래

  최근 들어 우리가 가장 많이 듣는 단어 가운데 하나가 '정보'일 것이다. 신문이나 잡지, 방송 등의 미디어와 모임, 강연 등에서 주제에 관계없이 한 번 이상 나오는 이 단어에 우리는 어느새 친숙해져 있다. 정보라는 것 없이도 과거에는 별 문제없이 살아갈 수 있었는데, 이제는 정보없이는 아무 것도 할 수 없다는 위기감을 느끼기도 한다. 인간은 누구나 환경에 적절히 적응하여 맡은 일을 무리 없이 효과적으로 수행하려는 욕구를 가지고 있다. 그러나 개인의 능력이나 지식에는 한계가 있으므로 이러한 한계를 극복하기 위하여 과거에도 늘 정보라는 것을 수집하고 활용하려 애써왔다. 그렇다면 정보화 사회라 일컫는 오늘날, 정보의 중요성과 필요성이 어느 때보다도 크게 부각되는 까닭은 무엇일까? 그 이유를 기업경영 측면에서 찾아보면 정보화 사회에서는 정보가 기업경영의 경쟁력을 결정하는 가장 중요한 요소라는 것이다.
  18세기 중엽부터 시작된 산업화의 물결은 지난 200여년 동안 인류 문명을 지배하였다. 산업사회에서 인류의 육체적인 노동은 기계로 대체되었으며, 대량 생산과 소비를 가능케하여 이전에는 기대할 수 없었던 물질적인 풍요를 인류에게 제공하였다. 이 시기의 기업들은 정부의 보호와 규제 속에서 업종별로 독과점을 형성하였으며, 전통적인 자원인 인력, 자금, 그리고 물자의 효율적 운용을 통해 다량의 제품이나 서비스를 만들어내면 성공을 보장받을 수 잇었다. 물론 자원의 효율적 운용이나 제품의 개발, 마케팅 활동 등을 위해 정보의 수집과 활용이 요구되었지만 환경의 변화가 거의 없었고 시장은 생산자 위주로 형성되었기 때문에 경영자나 소수 전문가의 오랜 경험을 통해 얻어진 지식이나 주관적인 판단, 간단한 통계수치 등 단순한 수준의 정보로도 충분히 기업을 경영할 수 있었다.
  하지만 오늘날 기업이 처한 환경은 과거와는 완전히 다르다. 시장은 다품종 소량 생산이 요구되는 소비자 주도로 바뀌었고 소비자의 취향은 하루가 다르게 변하며, 기업간의 경쟁은 날로 심화되고 있다. 이러한 환경에서 기업이 생존하고 발전하기 위해서는 지속적으로 소비자의 동향을 파악하고, 자사는 물론 경쟁사의 경영 전략을 효과적으로 분석하고 대처할 수 있는 능력이 절실하게 요구되는데, 이를 가능하게 하는 것이 바로 정보다. 따라서 정보화 시대의 기업경영에서 정보란 전통적인 자원들을 효과적으로 운영·관리하며 새로운 제품이나 서비스를 창출하는 역할을 담당하는 또 다른 자원으로서, 이것을 제대로 수집하고 활용할 수 있는 기업만이 경쟁에서 살아남고 우위를 확보하게 되는 것이다.

  (2) 정보기술의 가속적 발전

  70년대만 하더라도 정보기술은 일부 연구소나 학계 등 특정직에 종사하는 사람들의 전유물로 여겨졌다. 그러나 80년대 중반 이후 개인용 컴퓨터가 시장을 주도하기 시작하면서 전문 지식이 별로 없는 일반 사용자들도 컴퓨터를 쉽게 사용할 수 있는 환경이 조성되었다. 데이터를 저장하고 처리하는 성능 또한 급속도로 발전하고 잇는데 예를 들어, 2000년 이후에나 가능하리라 예상했던 기가 바이트급 하드디스크나 300MHz이상의 CPU가 이미 개인용 컴퓨터에 장착되고 있다. 하드웨어의 발전과 더불어 소프트웨어 측면에서도 지능을 갖춘 데이터 분석시스템을 개발하기 위한 노력이 80년대 이후부터 꾸준히 진행되어 왔는데, 학습능력(learning ability)을 갖춘 알고리즘이나 프로그램들이 주요 대상이었다. 여기서 학습능력이란 미리 정해진 순서와 절차에 따라 문제를 해결하는 전통적인 프로그래밍 방식과는 달리 주어진 레코드들로부터 추론이나 직관적 판단을 통해 스스로 문제 해결을 꾀하는 능력을 의미한다. 이렇듯 학습능력을 지닌 프로그램의 등장은 컴퓨터의 가공할 만한 정보처리 능력뿐 아니라 정보통신 기술의 정보유통 기능과 연계하여 대량의 데이트를 실시간에 분석하고 이를 통해 경영전략을 수립할 수 있는 길을 열었다.

  (3) 전통적인 전문가시스템의 한계

  전문가시스템은 인공지능의 한 분야로서 특정 분야에서 전문가의 축적된 지식과 경험을 시스템화하여, 필요할 때 사용하도록 하는 소프트웨어이다. 여기서 '지식(knowledge)'이라는 용어는 '정보(information)'와 혼용하여 사용되기도 하며 구분되기도 하는데, 데이터 관점에서 엄밀하게 정의하면 정보란 데이터를 가공·처리해서 얻어지는 산출물이고, 지식이란 정보의 체계적인 활용을 통해 축적된 노하우이다. 예를 들면, 일기예보를 하기 위해서는 구름의 이동, 바람의 방향 및 속도 등과 같은 데이터들이 필요하며, 이들을 분석하여 "금일 비가 올 확률은 70%이다."라고 얻은 결론이 정보다. 그리고 이러한 정보와 과거의 경험을 근거로 "비올 확률이 60% 이상이면 우산을 준비하라!"라는 지식을 도출할 수 있다. 정보는 그 자체로서도 기업 경쟁력의 원천이 되지만, 지식으로 발전하게 되면 경쟁력은 더욱 강화된다.
  전문가시스템은 1960년대에 화합물의 구조를 추정하기 위해 만들어진 덴드럴(DENDRAL)시스템이 시초가 되어 발전하였다. 그 후 의료진단시스템인 마이신(MYCIN), 광물탐사시스템인 프로스펙터(PROSPECTOR) 등이 1970년대에 만들어졌으며, 기계고장 진단, 설계 지원, 손해배상 판정 등 산업계의 전 분야에서 광범위하게 응용되고 있다. 전문가시스템의 구성요소 중 핵심이 되는 지식베이스(knowledge-base)에는 전문가의 지식을 저장하는데, 과거에는 주로 해당 분야 전문가와의 인터뷰나 전문서적 등을 토대로 구축하였다. 그러던 것이 기업환경의 급속한 변화와 시스템을 이용해 해결하고자 하는 문제영역이 점차 확대되고 복잡해짐에 따라 해당 분야에 통달한 전문가를 찾기가 어려워지면서 지식획득에 장기간에 걸쳐 많은 비용을 투자해야 하는 경제적인 문제에 봉착하였다. 이것을 소위 '지식획득의 병목현상 (knowledge acquisition bottle-neck)'이라 표현하는데, 이로 인해 데이터를 분석하여 자동적으로 지식을 추출해 내는 방안에 대한 요구가 급속히 증가하고 있는 것이다.

  (4) 데이터의 홍수, 정보의 빈곤

  남아메리카 출신 작가 조지 루이스(George Louis)는 자신의 소설 '바벨 도서관(The Library of Babel)'에서 끝없이 펼쳐진 무한한 규모의 도서관(infinite library)에 대해 묘사하고 있다. 이 도서관에는 서적들로 가득 찬 열람실들이 무수히 연결되어 있으나 모든 서적들은 그 내용을 알 수 없으며 제목도 'a*%$#$^$@!'와 같이 이해할 수 없는 문자로 씌여있어 의미를 해석하는 것이 불가능하다. 이곳의 사람들은 원하는 책을 찾기 위해 여기저기를 헤매다가 한 평생을 허비하고 학자들은 "도서관 어딘가에 도서 목록이 있을 것이다.", "그 책이 도서관 어딘가에 분명히 비치되어 있을 것이다." 등의 말만 되풀이한다 (자료원 : Data Mining by Adriaans, P. and Aantinge, D., Syllogic, 1998).
  이 소설은 오늘날 정보기술 문명의 혜택을 받으며 살아가는 우리에게 의미하는 바가 크다. 정보기술의 빠른 발전은 업무의 자동화를 촉진시켜 엄청난 양의 데이터를 전자적으로 수집하고 보관하는 것을 가능하게 하였다. 실제로 최근에 발표된 한 보고서에 따르면 세상에서 전자적으로 수집되는 데이터의 양은 매년 기하급수적으로 증가하고 있으며, 대기업에서 일주일 동안 기업 활동을 통해 수집하는 데이터는 일반인이 평생에 걸쳐 읽는 데이터의 양보다 많다고 한다. 이렇듯 우리는 데이터의 홍수 속에서 많은 양의 데이터를 축적해 왔다. 그리고 이렇게 데이터를 축적하게 된 배경의 일면에는 그 안에 무엇인가가 있으리라는 기대가 존재한다. 기업경영 측면에서 볼 때 데이터는 중요한 시장, 경쟁자, 고객 등에 관한 정보를 내재하고 있다. 생산관리 측면에서 데이터는 처리과정을 향상시키고, 문제를 해결하는 방법뿐만 아니라 운영의 최적화 기회를 제공한다. 그러나 가공되지 않은 데이터 자체는 아무런 의미가 없다. 데이터의 양이 오늘날과 같이 방대하지 않았던 과거에는 소수의 전문가들이 통계기법이나 질의 등을 통해 데이터를 분석하고 요약된 결과를 보고서 형식으로 제공하곤 했다. 이러한 접근법은 데이터의 양이 증가하고 차원(속성)의 수가 증가할수록 효율성이 떨어지고, 분석을 통해 얻을 수 있는 정보의 품질도 기대하기 어렵게 된다. 과연 누가 수 백가지의 속성으로 구성된 수백기가 또는 테라 바이트 상당의 데이터를 제대로 이해하고 분석할 수 있겠는가? 따라서 데이터의 홍수와 정보의 빈곤이라는 환경에 처한 지금, 기업들은 정보기술을 이용하여 데이터를 여과하고, 분석하며, 결과를 해석하는 자동화 된 데이터 분석 방안에 높은 관심을 갖게 되었다.

 

2. 정의 및 유사개념

  (1) 정의

  지금까지 기업들은 거대한 양의 업무 데이터를 축적해 왔고 그양은 앞서도 설명했듯이 향후에도 계속 증가할 전망이다. 예를 들어 약 2천개의 소매점 체인망을 가지고 있는 미국의 월마트(Wal-Mart)에는 매일 2천만건의 판매 레코드가 추가 또는 갱신되고 있고, 에이티엔티(AT&T)의 통신망 이용요금 관리시스템의 경우, 기록되는 레코드가 한 달에만 수기가 바이트에 이른다. 이들 데이터는 관련 업무를 처리한 결과로 축적된 것이지만 다른 한편으로 생각해 보면 실제로 업무 현장의 다양한 특성을 반영하고 있기 때문에 그 속에는 기업들이 미처 발견하지 못한 귀중한 정보와 기업의 전략 수립에 도움이 될 만한 힌트가 숨어 있을 수 있다. 예컨대 한 백화점에서는 회원들의 구매 데이터를 분석한 결과 "밍크코트를 구입한 고객의 상당수가 가죽치마를 함께 구입한다."라는 다소 예기치 못한 정보를 얻을 수 잇다. 이러한 정보는 "가죽치마를 구입하는 고객은 롱부츠도 구입할 것이다."와 같이 일반 마케팅 전문가들이 통상적으로 생각해 낼 수 있는 정보가 아닐뿐더러 다른 백화점들에 적용할 만한 정보도 아니다. 그러나 이러한 정보가 생성된 곳, 즉 상기 백화점의 경우는 이 정보를 바로 마케팅 활동에 활용할 수가 있는데, 예를 들어 밍크코트만을 구입한 회원들을 대상으로 하여 가죽치마 상품할인권을 발송한다든지, 상품 카탈로그를 제작할 때 밍크코트와 가죽치마를 함께 보여주는 전략을 구상할 수 있다. 그러나 몇 기가 바이트 혹은 테라 바이트에 이르는 거대한 양의 데이터를 분석하기란 쉽지 않기 때문에 많은 기업들은 단순한 통계 정보만을 얻는데 그치거나 아예 분석할 엄두조차 내지 못하고, 이 귀중한 자산을 제대로 이용되지 못하고 있다. 이러한 분석 작업을 지원하는 정보기술이 바로 data mining이다.
  data mining이란 자동화되고 지능을 갖춘(automated and intelligent) 데이터베이스 분석기법으로 90년대 초반부터 지식발견(KDD: Knowledge Discovery in Databases), 정보발견(information discovery), 정보수확(information harvesting) 등의 이름으로도 소개되어 왔는데 일반적으로 "대량의 데이터로부터 새롭고 의미있는 정보를 추출하여 의사결정에 활용하는 작업"이라 정의된다. 용어에 '채굴하다'라는 의미의 'mining'을 포함시킨 이유는 데이터로부터 정보를 찾아내는 작업이 마치 금이나 다이아몬드를 발견하기 전에 수 많은 양의 흙과 잡석들을 파헤치고 제거하는 것과 유사하다는 데에 기인한다.

  (2) data mining과 지식발견

  서적이나 논문들을 접해보면 data mining과 지식발견(KDD)이라는 용어를 혼용해서 사용하는 경우가 많아 독자들이 혼동하기가 쉽다. 개념이 소개되던 초창기에는 data mining이라는 용어는 특히 통계학자, 데이터베이스 연구가, 그리고 기업체에서 많이 사용한 반면, 지시발견의 경우는 인공지능이나 전문가시스템 관련 연구에 주로 등장하였다. 그러나 1995년 캐나다 몬트리얼에서 개최된 지식발견과 data mining에 관한 국제 학술대회 (The first international conference on knowledge discovery & data mining)에서 지식발견은 데이터로부터 유용한 정보를 발견하는 프로세스의 전 과정이라 하였고, data mining은 지식발견 프로세스 중에서 데이터로부터 정보를 추출하기 위해서 기법을 적용하는 특정 단계라 제안했다. 이 책에서 우리는 위의 정의를 따르고자 한다. 일반적으로 지식발견 프로세스는 데이터 선택, 정제, 보완, 변환, data mining 기법 선택 및 적용, 모형의 평가와 같은 여섯 단계로 구성된다.

  (3) data mining과 기존의 조회 도구

   data mining은 OLAP(On-Line Analytical Processing)과  같은 다차원분석(multi-dimensional analysis) 도구나 일반질의(query) 등과 같은 기존의 데이터베이스 조회 도구와 어떻게 다른가? 과연 data mining은 기존의 방식으로는 조회할 수 없었던 정보를 찾아 주는가?
  결론부터 말하자면 data mining은 기존의 조회 도구를 대체하는 것이 아니라 보완하는 기능을 제공하는 것이다. 하지만 data mining을 통해 추가적으로 얻게되는 정보의 가치는 그야말로 무한하다. 어느 유통업체가 수년간의 영업활동을 통해 상당한 양의 고객 구매데이터를 수집하여 관리하고 있다고 가정해 보자. 데이터 조회를 위해 가장 많이 사용하는 일반질의는 "1998년 12월에 A제품을 구매한 고객 명단을 조회하시오.", "1999년 상반기에 R지역의 A제품 판매현황을 보여주시오." 등의 형식을 취하며, 테이블의 형태로 결과를 제공한다. 이에 반해 N개의 독립된 속성으로 구성된 데이터를 N차원(dimension) 공간에서 분석한다는 개념을 기반으로 하는 OLAP 도구는 데이터를 다차원으로 분석하며, 결과를 주로 이해하기 쉬운 차트의 형태로 제공한다. OLAP 도구를 이용하여 "R지역에서는 어떤 상품들이 팔렸는지를 월별 및 고객 연령대별로 보여주시오."라는 조회를 할 경우 이것은 4차원(상품, 지역, 기간, 연령) 질의에 해당한다. 그림 1은 가전제품사에서 OLAP을 이용하여 특정지역의 제품 판매현황을 월별, 연령대별로 조회한 결과이며, 그림 2는 신용카드사에서 고객들의 카드 도용현황을 지역별, 도용유형별로 분석한 화면이다.

그림 1 OLAP을 이용한 월별, 연령대별 매출현황 분석

그림 2 OLAP을 이용한 지역별, 사기유형별 신용카드 도용현황 분석

  일반질의나 OLAP 도구 등의 기존 조회 방식과는 달리 data mining은 데이터에 숨겨져 있는 정보를 찾아내는데 사용한다. 예를 들어 "A라는 제품을 구매하는 고객들의 특성은 무엇인가?", "B상품을 위한 이벤트에 어떤 고객들을 초대할 것인가?" 등과 같은 조회의 결과를 도출하기 위해 기존의 조회방식을 이용한다고 가정해보자. 물론 기대하는 결과를 얻을 수도 있다. 그러나 기준이 되는 속성들을 사전에 파악할 수 없기 때문에 결과를 얻기 위해서는 수많은 시도와 실패가 요구된다. 다시 말하자면 지금까지 데이터의 분석과 활용에 사용되어 온 질의나 OLAP 도구, 그리고 이들을 기반으로 만들어진 의사결정지원시스템(decision support systems)이나 중역정보시스템(executive information systems)등은 그림 3에서 보여주듯이 원칙적으로 미리 가설(정보)을 세우고 데이터를 통해 그 가설을 확인하는 방식이었다. 즉 사용자가 자신의 경험에 비추어 가설을 세우고, 여기에 맞추어 질의를 만들어 실행하며, 결과를 검토하여 가설이 맞는지 틀리는지를 확인하는 것이다. 만약 가설이 틀리다는 결과가 나온 경우에는 확인되는 결과가 나올 때까지, 혹은 사용자가 가설이 틀렸다고 생각할 때까지 질의를 반복한다. 그러나 이러한 방식은 적절한 가설을 세울 수 없는 상황에서는 적용하기 곤란하며, 가설이 확인되거나 부정되는 것 외에는 새로운 정보가 거의 생성되지 않는다. 앞에서 언급했듯이 밍크코트와 가죽치마의 관계는 예전에는 전혀 예상하지 못했던 정보이므로 가설조차 세우지 않아도 컴퓨터시스템이 가능한 가설을 스스로 생성하고 이를 검증하는 data mining은 그림 4와 같이 가설을 발견하는 방식으로 사용자의 가이드를 거의 받지 않고 정보를 찾는다. 잘 설계된 data mining 도구는 데이터로부터 짧은 시간 내에 가능한 한 다수의 유용한 가설을 산출해내는 방식으로 정보를 발견하도록 설계되어 있다.

그림 3 가설 확인 중심의 기존 조회 방식

그림 4 가설 발견 중심의 data mining 방식

  재차 강조하고자 하는 바는 기존의 조회 방식과 data mining 방식은 상호 보완 관계에 있다는 것이다. data mining은 상호 보완 관계에 있다는 것이다. data mining은 기존의 방식으로는 얻을 수 없는 추가적인 정보를 제공한다. 그리고 이러한 정보는 기존의 방식을 통해 검증된다. 따라서 기존의 조회방식이 지원하지 못하는 환경에서 data mining을 사용하려는 것은 일반적으로 데이터에 내재되어 있는 정보의 90% 정도를 차지하는 기본 정보는 무시한 채 10% 이내의 숨겨진 정보만을 찾겠다는 발상으로, 이는 걷지도 못하는 아기에게 줄넘기를 가르치는 것에 비유할 수 있다. 그림 5는 일반질의, OLAP, 그리고 data mining을 통해 얻을 수 있는 정보의 깊이를 보여주는 그림이다.

그림 5 분석 방식에 따른 정보의 깊이

 

3. 작업유형

  data mining 작업 유형은 데이터를 분석하여 어떤 종류의 정보를 찾고자 하는가에 따라 구분된다. data mining을 통해 도출되는 정보의 종류는 다양하나 여기서는 널리 알려진 대표적인 종류 몇 가지를 살펴보겠다.

  (1) 연관(Association) 규칙

   "어떤 상품들이 함께 잘 팔리나?", "A제품을 구입한 고객에게 어떤 제품을 함께 팔 수 있을까?", "카드사기 유형간에는 어떤 관계가 있나?" 한 항목의 값을 알 경우 다른 항목의 값을 예측할 수 있다면 두 항목간에는 종속(dependency) 관계가 존재한다. 연관 규칙을 발견하는 작업이란 데이터 안에 존재하는 항목간의 종속관계를 찾아내는 작업이며, 마케팅에서는 손님의 장바구니에 들어있는 품목간의 관계를 알아본다는 의미에서 장바구니 분석(market basket analysis)이라고도 한다.
  연관규칙은 '(항목A) & (항목B) ⇒ (항목C)'의 형태로도 표현하는데, "항목A와 항목B를 폼함한 거래는 항목C도 포함한다." 또는 "품목A와 품목B를 구입한 고객은 C라는 품목도 구입한다." 등으로 해석한다. 그러나 이러한 규칙들은 실제 데이터를 분석할 때에는 100% 신뢰도를 가지는 경우가 거의 드물기 때문에 통상적으로 확류이나 도표 등을 이용하여 정량화한다.
  그림 6은 남성의류 상점의 POS시스템에 저장된 데이터로부터 제품간의 연관관계를 찾아보는 예로 "넥타이(NT011)를 구입한 고객은 셔처(ST001)도 구입한다."와 "정장(FS123)과 벨트(BT432)를 구입하면 코트(CT005)도 함께 구입한다."고 하는 두 가지 연관규칙을 발견하였다. 이와 같은 결과를 이용하여 매장에 넥타이(NT011)와 셔츠(ST001)를 함께 진열한다든지, 카탈로그 제작시 정장(FS123)과 벨트(BT432)를 코트(CT005)와 함께 패키지화하는 마케팅 전략을 수립할 수 있다. 일반적으로 연관규칙은 제품이나 서비스의 교차판매(cross selling), 매장진열(display), 첨부우편(attached mailings), 사기적발(fraud detection) 등의 다양한 분야에 활용된다.

그림 6 POS데이터를 이용한 연관규칙 발견

  (2) 연속(Sequence) 규칙

   연속규칙이란 연관규칙에 시간관련 정보가 포함된 형태이다. 예를 들어, "지난주에 X주식이 5일 동안 10% 오르고 Y주식이 같은 기간 동안 10~20% 올랐을 때, 금주에 Z주식이 오를 확률은 70%이다.", "새 냉장고를 구입한 고객 중 한 달 이내에 새 오븐을 구입하는 경향이 많다." 등과 같이 시간상에 순차적으로 나타나는 사건이나 거래의 종속관계를 의미한다.
  그림 7은 연속규칙을 찾아내는 예를 상품판매 데이터를 이용하여 설명하고 잇다. 데이터는 회원별, 거래일별에 따라 오름차순으로 정리되어 있는데, 99년 2월 5일에 A품목을 구입한 1번 회원이 99년 2월 19일에 H품목도 구입한 것을 알 수 있다. 마찬가지로 회원번호가 2번, 4번인 고객도 A품목을 구입한 후 H품목을 구입했다. 이러한 데이터를 근거로 "A품목을 구입한 회원이 향후 H품목을 구입할 가능성은 75%이다."라는 연속규칙을 도출해 낼 수 있으며, 99년 2월 21일에 A품목을 구입한 5번 회원에게 H품목을 권하는 마케팅 전략을 세울 수 있다. 위에서 보듯이 연속규칙에는 시간의 흐름이 포함되어 있기 때문에 연관규칙에 비해 더 구체적이며, 목표(target) 마케팅이나 일대일(one-to-one) 마케팅에 바로 활용할 수 있다. 그러나 연속규칙을 찾기 위해서는 데이터에 거래일이나 거래품목 이외에도 고객의 구매 이력(history) 속성이 반드시 필요하다는 조건이 만족되어야 한다.

그림 7 POS데이터를 이용한 연속규칙 발견

  (3) 분류(Classification) 규칙

   동물을 파충류, 포유류, 양서류 등으로, 인간을 황인종, 백인종, 흑인종으로, 그리고 소고기를 1등급, 2등급, 3등급으로 분류하듯이 사람들은 편의를 위해 세상의 많은 사물이나 사건 등의 개체를 부류나 등급으로 나누곤 한다. 분류는 data mining에서 가장 많이 사용되는 작업으로 부류값이 포함된 과거의 데이터로부터 부류별 특성을 찾아내어 분류모형을 만들고, 이를 토대로 새로운 레코드의 부류값을 예측하는 것을 의미한다. 예를 들어 A업체가 새로운 통신기기의 프로모션 대상고객을 선정하기 위해 임의로 고객 표본을 추출하여 우편물을 발송하였다고 가정해 보자. 고객 및 응답 결과 데이터와 긍정적인 반응을 보인 응답자의 특성은 그림 8과 같다. 여기서 분류규칙을 발견하는 작업이란 '예'라고 응답한 고객이나 '아니오'라고 응답한 고객의 일반적인 특성을 찾아내는 것인데, 분석결과 '예'라고 응답한 고객들은 나이나 거주지에 관계없이 직업이 '자영'이거나, 43세 이하의 고용직, 또는 직업은 없으나 강남에 거주한다는 특성을 가지고 있는 것을 알 수 있다. 이러한 규칙을 바탕으로 고객 전체의 모집단에서 프로모션 대상을 선정한다면 낮은 비용으로 구매 가능성이 높은 고객만을 목표마케팅을 전개할 수 있다. 분류규칙의 다른 예로는 신용카드 회사의 고객 신용평가 모형이다. 이 회사에서는 지금까지의 거래를 토대로 고객들의 신용을 <우수, 보통, 불량>으로 분류했다. '불량' 평가를 받은 고객층의 특성 중 하나가 "25~30세 가량의 미혼남으로 월 평균 수입이 200만원 이하인 고객"이라면, 신규 카드 가입자들의 신용평가시 이러한 규칙을 활용함으로써 보다 객관적인 의사결정을 유도할 수 있다.

그림 8 응답 데이터 분석을 통한 분류규칙 발견

  (4) 데이터 군집화(Clustering)

   군집화란 레코드들을 유사한 특성을 지닌 몇 개의 소그룹으로 분할하는 작업을 뜻한다. 작업의 특성이 분류작업과 흡사하다고 생각할 수 있으나, 분석하고자 하는 데이터에 부류가 포함되어 있지 않다는 점에서 차이가 있으며, 다른 data mining 작업을 위한 선행 작업으로서의 역할을 수행하는 경우가 많다. 예를 들어 어떤 백화점에서 고객을 효율적으로 관리하기 위해 고객들을 몇 개의 부류로 구분하려 한다고 가정해 보자. 이 백화점에서는 지금까지 고객의 최근 구매경력, 구매빈도, 구매액(RFM: Recency, Frequency, Monetary) 등을 기준으로 고객을 VIP고객, 우수고객, 일반고객 등으로 분류하여 관리하였다. 그러나 이벤트나 프로모션 대상을 선정하는데 있어 현재의 고객부류는 너무나 추상적이고 고객의 개인별 특성을 전혀 고려하지 못하고 있어 활용도가 그다지 높지 않다. 그림 9는 고객의 구매이력뿐만 아니라 인류통계학적 데이터, 라이프스타일 데이터, 그리고 지불유형 등의 다양한 데이터에 군집화 기법을 적용하여 여섯 개의 고객 부류를 새롭게 형성한 후, 각 군집별 특성을 분류모형을 통해 알아보는 절차와 B군집에 속한 고객들의 특성을 보여주고 있다. 이와 같이 고객의 군집별 특성을 파악할 수 있다면, 적어도 B군집에 속한 고객들에게 어린이 의류나 장난감 카탈로그를 발송하는 우려는 피할 수 있다.

 

4. 응용분야

  국내의 경우 data mining은 아직은 개념이나 기법, 제품 등이 소개되는 초기 도입 단계이다. 그러나 정보화에 앞서가는 많은 외국 선진기업들을 통해 실제 응용 사례들을 접할 수 있는데 예를 들어 미국의 카드회사인 아메리칸 익스프레스사(American Express)와 통신업체인 에티엔티사(AT&T)는 고객데이터 분석을 통한 마케팅 활동 지원을 위해, 영국의 BBC방송은 프로그램에 대한 고객별 선호도를 분석하기 위해 data mining 프로젝트를 수행하였다. 이외에도 은행이나 보험사 등에서의 실구축 사례를 다수 접할 수 있는데 이들은 data mining이 앞으로 자사의 경쟁력 향상에 상당한 역할을 할 것으로 기대하고 있다. 그러나 data mining은 위에서 언급한 특성 업종에만 국한된 것이 아닌 모든 분야에 적용할 수 있는 수평적 응용적 기술이다. 사실 "누가 필요로 하는가?" 보다는 "누가 필요로 하지 않는가?" 라고 묻는 편이 더 나을 것이다. 단지 아직까지는 data mining의 성공사례가 주로 데이터의 충실도가 상대적으로 높은 은행, 카드, 보험 등의 금융분야와 통신분야에서 주로 발표되고 있을 뿐이다.
  표 1에서는 data mining을 적용할 수 있는 분야 및 사례들의 일부를 나열하였다. data mining이 제공하는 정보들은 호과적인 광고전략 개발이나 상품 배치, 목표고객 선정, 프로세스의 개선 등에 활용됨으로써 전체적인 비즈니스 효율 향상과 비용 절감을 꾀할 수 있다. 또한 data mining에서 발굴되는 정보를 통해 기업은 선점 효과를 누릴 수 있는 경우가 많다. 즉 먼저 그 정보를 확보하여 활용함으로써 고객을 모으고 서비스를 제공하는데 유리한 위치를 확보하게 되는 것이다.

표 1 data mining의 응용분야 및 적용 사례

분   야

적용 사례

소매/마케팅

  • 고객의 구매패턴과 선호도 발견
  • DM(Direct Mail)에 응답할 가능성이 높은 고객 예측
  • 제품/서비스 교차판매
  • 판매 실적에 영향을 미치는 요소 발견
  • 고객 분류, 그룹별 특성 발견
  • 광고, 프로모션, 이벤트의 효과 측정

은행, 카드

  • 신용카드 도용패턴 추적
  • 이탈 예상고객 선정 및 특성 분석
  • 우수고객 선정 및 특성 분석
  • 서비스별 홍보 대상고객 선정
  • 신용평가 모형 개발
  • 주식 거래규칙 발견

보험

  • 고객분류를 통한 보험료 가격 정책 수립
  • 보험료 청구 사기 패턴 추적
  • 클래임 처리시간에 영향을 미치는 요소 발견

통신

  • 장거리 전화/무선 전화의 부정한 이용패턴 추적
  • 이탈 예상고객 선정 및 특성 분석
  • 서비스간의 연관관계 발견
  • 우수고객 선정 및 특성 분석

제조

  • 최종 생산품의 품질에 영향을 미치는 요인 발견
  • 경쟁사의 입찰액 예측
  • 제품의 수요 예측
  • 대리점 여신평가 모형 개발

유통

  • 매장진열 전략 수립
  • 상품 카탈로그 디자인
  • 상품 교차판매

의료

  • 환자의 질병 진단이나 질병의 예후 분석
  • 환자의 특성에 따른 의약품의 부작용 분석

 

5. 프로젝트를 위한 고려사항

  data mining 제품을 구입하여 기존의 데이터를 분석하면 유용한 정보가 쏟아져 나올 것이라는 환상을 가지고 섣불리 프로젝트를 시작하면 십중팔구 낭패를 본다. 이것은 data mining을 단지 하나의 기술(technology)로 인식하고, 기법이나 도구의 선택과 기술적인 지원 등에만 과다하게 치중하는 것이 주요 원인이다. 여기에서는 기업의 규모나 프로젝트의 크기에 관계없이 성공적으로 data mining 시스템을 구축하기 위해 반드시 고려해야 하는 사항들을 점검해 보겠다.

  (1) 목표 및 활용방안

   "데이터로부터 무엇을 얻을 것인가?" 이 질문에 대한 명확한 해답을 갖고 있어야 한다. 이를 위해서는 기업의 경쟁력 제고 측면에서 사업목표를 제대로 이해하고, 해당 목표를 성취하기 위해 수반되는 주요 성공요소(critical success factor)들을 확인해야 한다. 예를 들어 자동차보험사의 사업목표 중 하나가 '특정 상품의 시장점유율 유지'라고 한다면 주요 성공요소로는 계약 만기 전에 해약하는 고객이나 만기 후 재계약 하지 않는 고객들을 대상으로 하는 '이탈고객 최소화', 그리고 새로 신차를 구입한 고객이나 타 보험사 고객을 대상으로 하는 '신규고객 유치' 등을 들 수 있다. 그러나 만약 사업목표가 이윤을 극대화하는 것이라면, 주요 성공요소 중의 하나는 마찬가지로 '이탈고객의 최소화'일 수 있으나, 여기에서 이탈고객의 의미는 해약이나 미계약 고객 중에서도 계약 기간 동안 사고경력이 없거나 경미한 고객으로 한정해야 한다. data mining 프로젝트를 수행할 때 목표가 불분명하고 주요 성공요소가 구체적이지 못하면 원천 데이터(source data)의 선정에 어려움이 따르며, 도출되는 정보의 신뢰도 또한 떨어진다. 이제 새롭고 흥미있는 정보를 얻었다고 하자. 두 번째 질문은 "앞으로 이들 정보를 어떻게 활용할 것인가?"이다. data mining과 관련된 대부분의 연구나 프로젝트를 살펴보면 정보를 얻을 때까지의 계획이나 실행과정은 비교적 상세하나 그 이후가 불분명한 경우가 많다. 즉 정보를 업무에 어떻게 활용(business action)할 것인가에 대한 방안이 미흡하다는 것이다. 이것은 새로운 건물을 근사하게 건축하여 놓았을 뿐 운영계획도 없이 그냥 방치하고 있는 경우와 마찬가지이다. 따라서 도출한 정보에 대한 구체적이고 현실성이 있는 활용방안을 마련하여야 한다. 위의 예에서 만약 과거에 이탈한 고객들의 특성이 파악되었다면, 내달에 계약이 만료되는 고객 중에서 이탈고객들과 유사한 특징을 지닌 고객들을 특별 관리대상으로 삼아 작게는 보다 친절하고 관심어린 전화를 걸 수 있으며, 나아가서는 비용이 허락하는 한도 내에서 고객 특성에 맞는 간단한 선물을 발송한다든지 보험요금을 조정해 주는 것과 같은 인센티브를 제공하는 전략을 구상할 수 있다.

  (2) 데이터의 충실도

   "Garbage in garbage out!" 즉, 쓰레기가 들어가면 쓰레기가 나온다는 말이다. data mining을 통하여 얻은 정보의 원천은 입력되는 데이터이기 때문에 도출되는 정보의 신뢰도는 바로 원천 데이터의 품질에 달려있다고 해도 과언이 아니다. 따라서 data mining 작업을 수행하기 전에 반드시 점검해야 할 사항이 데이터의 충실도이다. 충실도란 데이터를 구성하는 레코드와 속성의 수가 충분한가에 대한 양적 척도와 속성이 취한 값들이 정확한가 또는 빠진 속성 값은 어느 정도인가에 대한 질적 척도, 이 두 가지를 함께 의미한다. 데이터의 충실도는 data mining 프로젝트의 성패를 좌우하는 가장 중요한 요소로서 실제 프로젝트의 대부분이 이것을 높이는데 할애된다.

  (3) 법률문제

   개인의 프라이버시를 보호한다는 것 또한 중요한 문제이다. 프랑스에서는 2명의 보험 대리인이 개인의 데이터를 불법으로 사용하여 10개월의 징역과 미화 3000달러 정도의 벌금을 선고받은 사례가 있다. 이들은 프랑스의 전력회사인 EDF(Electricite De France)로부터 새로운 전선을 설치한 사람들의 명단을 확보한 후, 관계부처에 이를 알리지 않고 목표마케팅에 사용하였다. 국내의 경우에도 얼마 전 한 도서판매업체가 모 대학의 신입생 명단을 인터넷을 통해 확보한 후, 일대일 마케팅에 활용하여 문제가 발생하기도 하였다. 실제로 많은 선진국가들은 기업이 개인의 데이터를 수집, 정리 또는 처리하는 것과 관련된 지침이나 법을 지정하고 있따. 우리나라의 경우도 유사법률이 제정되어 있는데 예를 들어, 신용정보의 이용 및 보호에 관한 법률 제23조 및 제24조에 의하면 기업이 개인의 신용데이터를 사용하기 위해서는 개인의 동의를 받도록 되어 있으며, 제3자를 통해 수집한 데이터를 사용하기 위해서는 해당 기업뿐 아니라 제3자 또한 개인의 동의를 받아야 한다. 이것은 만약 전자제품을 제조하고 판매하는 회사가 각 대리점을 통해 수집한 고객 데이터를 이용하여 마케팅 활동을 전개하려 한다면, 전자회사와 대리점 공히 개인의 동의를 얻어야만 한다는 것을 의미한다. 그러나 개인의 데이터를 몰래 수집하고 이를 범죄에 사용하는 사건이 증가함에 따라 개인이 자신의 데이터에 대한 공개를 꺼리는 경향이 늘어나고 있으며, 국내의 경우는 그 정도가 더 심한 상황이다. 따라서 합법적으로 개인의 데이터를 사용하거나 수집 또는 보강하는 방안을 반드시 강구해야 한다.

  (4) 전문 인력 확보

   data mining은 데이터로부터 자동으로 정보를 추출하기 때문에 전문가의 전문지식이나 경험을 대체할 수 있다. 또한 일반질의나 OLAP과는 달리 사용자가 미리 가설을 세우거나 지침을 제공하지 않는다. 이 말들은 사용자들에게 data mining은 마치 이야기 속에 나오는 도깨비 방망이와 같은 것이라는 환상을 갖게 하기 쉽다. 그러나 data mining은 오직 주어진 데이터에서만 정보를 찾기 때문에 "필요한 정보를 얻기 위해서는 어떤 데이터, 특히 어떠한 속성들로 구성된 데이터가 필요하다."와 같은 정보는 알려주지 못한다. 예를 들어, A상품을 구매할 만한 고객의 특성을 알아내고 그런 특성을 가진 고객들만을 대상으로 이벤트를 개최하려 한다고 하자. 만약 A상품을 구매할 고객들의 실제 특성이 '월수입이 200만원 이상'임에도 불구하고 data mining에 이용된 데이터에 월수입이라는 속성이 없다면, data mining은 '여성이며 거주지역은 송파구'라는 다소 엉뚱한 특성을 찾아내어 제시할 수도 있다. 또한 data mining을 통해 일차적으로 추출되는 정보의 양은 상당히 많을 수가 있다. 이 중에는 data mining의 정의에서 알 수 잇듯이 과거에 알지 못했던 가치있는 정보들도 존재하지만, 데이터에 내재되어 있는 오류값(incorrect value)이나 특이값(outlier) 등으로 인해 의미가 없거나 틀린 정보들도 다수 포함되곤 한다. 이와 같은 정보를 아무런 여과없이 기업경영에 그대로 활용한다면 그 결과가 기업에 미치는 손실은 엄청날 수가 있다. 따라서 적절한 데이터의 선택이나 추출되는 정보의 올바른 해석을 위해 반드시 역량있는 업무 전문가나 데이터 분석가의 도움을 받아야 한다.

  (5) 적절한 data mining 도구

   data mining 작업에는 전통적인 통계, 의사결정나무(decision tree), 신경망(neural networks) 등 다양한 기법들이 독자적으로 혹은 결합되어 이용되며, 최근 들어 이러한 기법들을 기반으로 하는 사용화된 data mining 도구들이 소프트웨어나 하드웨어 공급업체(vendor)들을 통해 대량으로 소개되고 있다. 그 중에는 얼마전까지만 해도 최신 질의 도구나 OLAP 도구라고 선전되어오던 제품들이 선진 data mining 도구로 둔갑해 있는 경우도 간혹 발견할 수 있다. data mining 도구는 SAS의 Enterprise Miner, SPSS의 Clementine, 그리고 IBM의 Intelligent Miner 등과 같이 여러 가지 기법들을 지원하여 data mining의 다양한 작업을 가능하게 하는 범용제품군에서, Rulequest사의 C5.0이나 Neuro Dimension사의 NeuroSolutions 등과 같이 특별히 하나의 기법만을 지원하는 전용제품군까지 다양하다. 제품들에 대한 리스트와 자세한 내용은 부록을 참고하기 바란다. 일반적으로 data mining 도구를 선택할 때는 가격과 지원하는 하드웨어 플랫폼이 적절한가를 평가하는 것 외에도 다음의 사항들을 항상 고려해야 한다.