텍스트 마이닝

텍스트 마이닝(text mining), 텍스트 데이터 마이닝(text data mining, TDM) 또는 텍스트 분석(text analytics)은 텍스트에서 고품질 정보를 추출하는 프로세스이다. 여기에는 "다양한 서면 자원에서 정보를 자동으로 추출하여 이전에 알려지지 않은 새로운 정보를 컴퓨터로 발견하는 것"이 포함된다. 서면 리소스에는 웹사이트, 서적, 이메일, 리뷰 및 기사가 포함될 수 있다. 일반적으로 통계적 패턴 학습 등을 통해 패턴과 추세를 고안함으로써 고품질 정보를 얻는다. 호토(Hoto, 2005) 등에 따르면 우리는 텍스트 마이닝의 세 가지 다른 관점, 즉 정보 추출, 데이터 마이닝, 데이터베이스 프로세스의 지식 발견(KDD)을 구분할 수 있다. 텍스트 마이닝은 일반적으로 입력 텍스트를 구조화하는 프로세스(일반적으로 일부 파생된 언어적 특징을 추가하고 다른 기능을 제거한 후 데이터베이스에 삽입하는 것과 함께 구문 분석), 구조화된 데이터 내에서 패턴을 파생하고 최종적으로 평가 및 해석하는 프로세스를 포함한다. 출력의. 텍스트 마이닝에서 '높은 품질'이란 일반적으로 관련성, 참신함, 관심도의 조합을 의미한다. 일반적인 텍스트 마이닝 작업에는 텍스트 분류, 텍스트 클러스터링, 개념/엔티티 추출, 세분화된 분류 생성, 감정 분석, 문서 요약 및 엔터티 관계 모델링(즉, 명명된 엔터티 간의 관계 학습)이 포함된다.

텍스트 분석에는 정보 검색, 단어 빈도 분포를 연구하기 위한 어휘 분석, 패턴 인식, 태깅/주석, 정보 추출, 링크 및 연관 분석을 포함한 데이터 마이닝 기술, 시각화 및 예측 분석이 포함된다. 가장 중요한 목표는 본질적으로 자연어 처리(NLP), 다양한 유형의 알고리즘 및 분석 방법을 적용하여 텍스트를 분석용 데이터로 변환하는 것이다. 이 프로세스의 중요한 단계는 수집된 정보를 해석하는 것이다.

일반적인 응용 프로그램은 자연어로 작성된 문서 집합을 스캔하고 예측 분류 목적으로 문서 세트를 모델링하거나 추출된 정보로 데이터베이스 또는 검색 색인을 채우는 것이다. 문서는 텍스트 마이닝을 시작할 때 가장 기본이 되는 요소이다. 여기서는 문서를 일반적으로 다양한 유형의 컬렉션에 존재하는 텍스트 데이터 단위로 정의한다.

같이 보기[편집]

출처[편집]

Ananiadou, S. and McNaught, J. (Editors) (2006). Text Mining for Biology and Biomedicine. Artech House Books. ISBN 978-1-58053-984-5
Bilisoly, R. (2008). Practical Text Mining with Perl. New York: John Wiley & Sons. ISBN 978-0-470-17643-6
Feldman, R., and Sanger, J. (2006). The Text Mining Handbook. New York: Cambridge University Press. ISBN 978-0-521-83657-9
Hotho, A., Nürnberger, A. and Paaß, G. (2005). "A brief survey of text mining". In Ldv Forum, Vol. 20(1), p. 19-62
Indurkhya, N., and Damerau, F. (2010). Handbook Of Natural Language Processing, 2nd Edition. Boca Raton, FL: CRC Press. ISBN 978-1-4200-8592-1
Kao, A., and Poteet, S. (Editors). Natural Language Processing and Text Mining. Springer. ISBN 1-84628-175-X
Konchady, M. Text Mining Application Programming (Programming Series). Charles River Media. ISBN 1-58450-460-9
Manning, C., and Schutze, H. (1999). Foundations of Statistical Natural Language Processing. Cambridge, MA: MIT Press. ISBN 978-0-262-13360-9
Miner, G., Elder, J., Hill. T, Nisbet, R., Delen, D. and Fast, A. (2012). Practical Text Mining and Statistical Analysis for Non-structured Text Data Applications. Elsevier Academic Press. ISBN 978-0-12-386979-1
McKnight, W. (2005). "Building business intelligence: Text data mining in business intelligence". DM Review, 21-22.
Srivastava, A., and Sahami. M. (2009). Text Mining: Classification, Clustering, and Applications. Boca Raton, FL: CRC Press. ISBN 978-1-4200-5940-3
Zanasi, A. (Editor) (2007). Text Mining and its Applications to Intelligence, CRM and Knowledge Management. WIT Press. ISBN 978-1-84564-131-3

외부 링크[편집]

Marti Hearst: What Is Text Mining? (October, 2003)
Automatic Content Extraction, Linguistic Data Consortium 보관됨 2013-09-25 - 웨이백 머신
Automatic Content Extraction, NIST