Text  Mining

 

기업에서 생성, 저장, 재사용하는 정보 중 20% 만이 활용성이 높은 정형 데이터로 구성되어 있고, 나머지 80% 는 워드프로세서, e-mail, 프리젠테이션, 스프레드시트, PDF 와 같은 복합문서와 인터넷 페이지 등의 비정형 텍스트 형태로 구성되어 있다. 정형데이터의 SQL 검색으로부터 시작한 정보검색 (Information Retrieval) 은 비정형 테이터를 위한 검색으로 발전하게 되고 다양한 검색 agent를 이용한 웹 검색으로 발전하게 된다. 그러나 검색엔진들이 너무나 많은 정보를 검색해 주기 시작하면서 검색의 문제는 원하지 않는 정보들 사이에서 유용한 정보를 찾는 것으로 변화하였다. 이와같은 정보검색 환경에서 유용한 정보를 효과적으로 찾기위해서 비정형 데이터인 문서로부터 유용한 정보를 추출하고 가공하는 기술의 필요성이 대두되게 되었다.

대량의 정보를 효과적으로 다룰 수 있는 방법에 대한 연구는 이미 활발히 진행되고 있다. DB 에 저장된 자료와 같이 정형화된 데이터로부터 정보를 추출, 가공하는 데이타마이닝 (Data Mining) 은 이미 실용성을 갖추고 많은 분야에서 널리 활용되고 있다. 그러나 디지털 정보의 대부분은 비정형 데이터로서, Text Mining 은 이러한 비/반정형 데이터에 대하여 자연어처리 (Natural Language Processing)  기술과  문서처리 기술을 적용하여 유용한 정보를 추출, 가공하는 것을 목적으로 하는 기술이다. 문서요약 (summarization), 특성추출 (feature extraction) 등이 text mining 의 핵심 연구분야며 그 응용 분야는 매우 다양하다.

Data mining 관점에서 문서로부터 구조화된 정보를 추출하여 database 화 시키거나 규칙을 찾아내는 것은 가장 일반적인 응용이며, 사용자가 Web 상에서 문서를 찾는 것을 도와주거나 사용자 profile 의 생성 및 분석, 문서에 쓰인 자연언어 식별, 대량 DB에서 문서의 분류 및 군집화, 문서분류 (Text Categorization) 정보를 이용한 문서 재해석, 신문/논문/보고서 요약, 문서 번역, 시계열 (time series) 정보의 획득을 통한 시장 및 위험도 분석, 문서 색인, 문서 여과 (filtering) 및 추천 (recommendation), 대표적 키워드나 토픽 (topic) 의 추출, 질의응답 시스템 (Question Answering System), 대규모 문서에서의 탐색 등이 가장 대표적인 응용분야라 할 수 있다.

term :

텍스트마이닝 (Text Mining)     자연어처리 (Natural Language Processing)   정보검색 (Information Retrieval)    문서분류 (Text Categorization)

site :

Wikipedia : Text mining

paper :

텍스트마이닝 기반 고정밀 검색시스템 : 이경일, 서형국, 안태성, 한국정보처리학회 11권 2호, 2004

A Preliminary Study on Clinical Decision Support System based on Classification Learning of Electronic Medical Records : 양신규, 한국데이터정보과학회 14권 4호, 2003

인터넷 뉴스 기사에 대한 자동분류 정보시스템에 관한 연구 : 서용무, 백용규, 한국경영정보학회 추계학술대회, 2003