데이터 마이닝의 개요 : 장남식.홍성완.장재호 : Data Mining의 기본 개념은 새로운 것이 아니라 인공지능 분야의 기계학습(machine learning) 이론에 그 뿌리를 두고 있다. 즉 현실 세계에서 데이터 베이스에 감춰진 유용한 정보를 캐내고자 하는 욕구가 기계학습에서 사용된 기법을 Database에 응용하기에 이르렀다. 기계학습은 규칙을 찾아내기 위한 자동화된 유도과정(inductive process)이라 할 수 있다. 기계학습에서는 트레이닝 세트(training set)라 불리는 적은 양의 실험실용 데이터를 사용하여 알고리즘을 만들어내는 작업이다. 그러나 이러한 일련의 기계학습 작업은 현실세계의 Database에는 적용하기가 곤란하다. 왜냐하면 현실 세계의 Database는 갱신이 수시로 이루어지는 등 다이내믹하고, 오류도 있을 수 있으며 데이터가 없을 수도 있고, 더욱이 대량의 데이터를 보유하고 있기 때문이다. 따라서 데이터 마이닝에서는 현실세계의 대규모 Database를 트레이닝 세트로 간주해서 이로부터 유용한 지식을 캐내는 일련의 작업인 것이다 ........ Data Mining은 기존의 조회 도구를 대체하는 것이 아니라 보완하는 기능을 제공한다. 기존의 조회방식이 지원하지 못하는 환경에서 Data Mining을 사용하려는 것은 일반적으로 데이터에 내재되어 있는 정보의 90% 정도를 차지하는 기본 정보는 무시한 채 10% 이내의 숨겨진 정보만을 찾겠다는 무리한 발상이다. 하지만 Data Mining을 통해 추가적으로 얻게되는 정보의 가치는 그야말로 무한하다. 데이터 마이닝에서 얻고자 하는 지식은 연관(association), 분류(classification), 순서(sequence)등에 관한 지식들이다.
Introduction : 서울대 Data Mining lab : 조성준 : 데이터마이닝이라는 용어는 데이터베이스 분야를 연구하던 컴퓨터 과학자들이 만든 것이고 현재 미국 등지에서는 컴퓨터 과학자들의 주도하에 ACM (association for computing machinery) 의 ACM SIGKDD (special interest group on knowledge discovery in database) 에서 매년 학술대회가 개최되고 있다. 그러나 실제 데이터마이닝의 기본 개념은 통계학에 그 바탕을 두고 있으며, AI 에서 개발된 모델과 알고리즘을 많이 사용하고 있어서 근본적으로 학제적인 (inter-disciplinary) 분야이다. 분야별 해당 기법들을 구체적으로 보면 다음과 같다. 먼저, 통계학 분야의 기법들은 다양한 전처리 기법, 선형/비선형 회귀분석, K-means 군집화 알고리즘, 분류회기분석나무 모형 (Classification and Regression Tree: CART), 부트스트래핑 (bootstrapping), 선형 /비선형 주성분 분석 (linear/nonlinear PCA) 등이 있다. 또한 인공지능의 기계학습과 뉴로컴퓨팅 기법들은 C4.5 나무 모형, 다층퍼셉트론 뉴럴네트웍, 레이디얼 베이시스 함수 네트웍 (radial-basis function network), 자기조직특징지도 (Self-organizing feature map) 네트웍 등이 있다. 끝으로 데이터베이스 분야에서 개발된 연관 규칙 발견 알고리즘 (“A priori”), 순서분석 알고리즘 등이 많이 사용되고 있다.
데이터 마이닝의 기법 : 장남식.홍성완.장재호 : Data Mining 의 기법에는 전통적 통계(예: regression analysis, discriminant analysis), Decision Tree, Neural Networks, Co-Occurrence Matrix, Genetic Algorithm, K-Means Clustering 등이 있다. 전통적인 통계기법들은 오랜 역사와 탄탄한 이론을 배경으로 한 검증된 기법으로 타 기법들에 비해 월등하다. 반면 데이터 값들의 정규분표, 공분산(covariance) 등과 같이 여러 가지 통계학적 가정을 요구하는 경우가 많고, 데이터에 다수의 범주형(categorical) 변수가 포함되어 있을 때 이들을 가변수(dummy variable)로 변환시키는 과정에서 발생할 수 있는 치우침(bias) 등의 한계를 지니고 있다. 따라서 이러한 가정을 만족하지 않는 데이터를 분석하여 얻어지는 정보는 신뢰도가 낮고 '의미있는' 정보가 될 수 없다. 그래서 기계 학습 이론을 사용하게 되는 것이다. 그러나 통계는 데이터 분석 작업에 항상 기초가 되는 분야로서, 실제로 기계학습을 근간으로 하는 기법들의 이론적 근거가 되며 기법을 통해 도출되는 정보를 평가하고 해석하는데 있어서도 반드시 필요하다