비정형 데이터

비정형 데이터(unstructured data, unstructured information, 비정형 정보), 또는 비구조화 데이터, 비구조적 데이터는 미리 정의된 데이터 모델이 없거나, 정해진 방식으로 구조화되지 않은 정보를 말한다. 비정형 정보는 일반적으로 텍스트를 중심으로 구성되지만, 날짜·숫자·사실과 같은 요소를 포함할 수도 있다. 이러한 특성으로 인해 변칙성과 모호함이 발생하며, 전통적인 데이터베이스의 표 형식이나 문서에 주석화된(의미적으로 태그된) 데이터와 달리 기존 프로그램으로는 해석하기가 어렵다.
1998년 메릴린치는 잠재적으로 활용 가능한 전체 비즈니스 정보 가운데 약 80~90%가 비정형 형식에서 비롯된다는 경험 법칙을 제시하였다. 이 경험 법칙은 1차 연구나 정량적 연구에 근거한 것은 아니지만, 그럼에도 불구하고 일부 분야에서는 널리 인용되고 있다.
2012년 기준으로, IDC와 델 EMC는 2020년까지 데이터가 40 제타바이트로 증가하여 2010년 초보다 50배 성장할 것으로 전망했다.[1] 더 최근에는 IDC와 씨게이트 테크놀로지가 전 세계 데이터스피어가 2025년까지 163 제타바이트로 성장할 것이며[2] 그 중 대부분이 비정형 데이터일 것으로 예측했다. 컴퓨터월드 잡지는 조직 내 모든 데이터의 70~80% 이상이 비정형 정보일 수 있다고 명시하고 있다.
배경
[편집]비즈니스 인텔리전스에 관한 초기 연구는 수치 데이터보다 비정형 텍스트 데이터에 초점을 두었다.[3] 1958년 무렵 H. P. 룬 등을 포함한 컴퓨터 과학 연구자들은 특히 비정형 텍스트의 추출과 분류에 관심을 가졌다.[3] 그러나 기술이 이러한 연구적 관심을 충분히 뒷받침할 수 있게 된 것은 세기가 바뀐 이후의 일이었다.
2004년에는 SAS 인스티튜트가 보다 효율적인 분석을 위해 특이값 분해(SVD)를 활용하여, 고차원 텍스트 공간을 더 낮은 차원으로 축소하는 데 사용되는 SAS 텍스트 마이너를 개발하였다.[4]
기계 텍스트 분석에 의한 수학적 및 기술적 발전은 많은 기업이 응용 분야를 연구하도록 자극했으며, 이는 감정 분석, 고객의 목소리 마이닝, 콜센터 최적화와 같은 분야의 발전으로 이어졌다.[5] 2000년대 후반 빅 데이터의 등장은 예측 분석 및 근본 원인 분석과 같은 현대적 분야에서 비정형 데이터 분석의 응용에 대한 높은 관심을 불러일으켰다.[6]
용어 관련 문제
[편집]이 용어는 여러 가지 이유로 정밀하지 않다:
비정형 데이터의 처리
[편집]데이터 마이닝, 자연어 처리(NLP), 텍스트 분석과 같은 기술은 이러한 정보에서 패턴을 찾거나 해석하는 다양한 방법을 제공한다. 텍스트를 구조화하기 위한 일반적인 기술은 대개 추가적인 텍스트 마이닝 기반 구조화를 위해 수동으로 메타데이터 태그를 지정하거나 품사 태깅을 하는 과정을 포함한다. 비정형 정보 관리 아키텍처(UIMA) 표준은 의미를 추출하고 정보에 대한 정형 데이터를 생성하기 위해 이러한 정보를 처리하는 공통 프레임워크를 제공했다.
기계가 처리 가능한 구조를 생성하는 소프트웨어는 모든 형태의 인간 의사소통에 존재하는 언어적, 청각적, 시각적 구조를 활용할 수 있다.[7] 알고리즘은 단어 형태론, 문장 구문 및 기타 소규모 및 대규모 패턴을 조사함으로써 텍스트에서 이러한 내재적 구조를 추론할 수 있다. 그 후 비정형 정보는 모호성을 해결하기 위해 풍부해지고 태그가 지정될 수 있으며, 검색과 발견을 용이하게 하기 위해 관련성 기반 기술이 사용된다. "비정형 데이터"의 예로는 도서, 저널, 문서, 메타데이터, 의료 기록, 오디오, 비디오, 아날로그 데이터, 이미지, 파일 및 이메일 메시지 본문, 웹 페이지 또는 워드 프로세서 문서와 같은 비정형 텍스트가 포함될 수 있다. 전달되는 주요 콘텐츠는 정의된 구조를 가지고 있지 않지만, 일반적으로 그 자체가 구조를 가진 객체(예: 파일 또는 문서 내 등)에 담겨서 제공되므로 정형 데이터와 비정형 데이터의 혼합체이지만, 통칭하여 여전히 "비정형 데이터"라고 불린다.[8] 예를 들어, HTML 웹 페이지는 태그가 지정되어 있지만 HTML 마크업은 일반적으로 렌더링만을 목적으로 한다. 이는 페이지 정보 콘텐츠의 자동화된 처리를 지원하는 방식으로 태그된 요소의 의미나 기능을 캡처하지 않는다. XHTML 태깅은 요소의 기계 처리를 허용하지만, 일반적으로 태그된 용어의 세만틱 의미를 캡처하거나 전달하지는 않는다.
비정형 데이터는 일반적으로 전자 문서에서 발생하므로, 문서 전체를 분류할 수 있는 콘텐츠 관리 또는 문서 관리 시스템을 사용하는 것이 문서 내부로부터의 데이터 전송 및 조작보다 종종 선호된다. 따라서 문서 관리는 문서 집합에 구조를 부여하는 수단을 제공한다.
검색 엔진은 이러한 데이터, 특히 텍스트를 인덱싱하고 검색하는 데 널리 사용되는 도구가 되었다.
자연어 처리에서의 접근 방식
[편집]텍스트 문서 내에 포함된 비정형 데이터에 구조를 부여하기 위해 특정한 계산 워크플로가 개발되었다. 이러한 워크플로는 일반적으로 수천 또는 수백만 개의 문서 세트, 즉 수동 주석 방식이 허용하는 범위를 훨씬 초과하는 양을 처리하도록 설계되었다. 이러한 접근 방식 중 일부는 온라인 분석 처리(OLAP) 개념에 기반을 두고 있으며, 텍스트 큐브와 같은 데이터 모델에 의해 지원될 수 있다.[9] 데이터 모델을 통해 문서 메타데이터를 사용할 수 있게 되면, 구문 기반 접근 방식을 사용하여 문서 하위 집합(즉, 텍스트 큐브 내의 셀)의 요약을 생성할 수 있다.[10]
의학 및 생물 의학 연구에서의 접근 방식
[편집]연구자들이 종종 학술지에 연구 결과를 발표하기 때문에 생물 의학 연구는 비정형 데이터의 주요 원천 중 하나를 생성한다. 이러한 문서에 담긴 언어는 (예를 들어, 포함된 복잡한 전문 용어와 관찰 결과를 완전히 맥락화하는 데 필요한 도메인 지식 때문에) 구조적 요소를 도출하기 어렵지만, 이러한 활동의 결과는 기술 연구와 의학 연구 간의 연결 고리를 제공하고[11] 새로운 질병 치료법에 대한 단서를 제공할 수 있다.[12] 생물 의학 문서에 구조를 강제하려는 최근의 노력에는 문서 간의 주제를 식별하기 위한 자기조직화 지도 접근 방식,[13] 범용 비지도 알고리즘,[14] 그리고 문헌에서 단백질 이름과 심혈관계 질환 주제 간의 연관성을 결정하기 위한 CaseOLAP 워크플로[10]의 적용이 포함된다.[15] CaseOLAP은 정확하고(관계 식별), 일관되며(재현성 높음), 효율적인 방식으로 구문-범주 관계를 정의한다. 이 플랫폼은 향상된 접근성을 제공하며 광범위한 생물 의학 연구 응용을 위한 구문 마이닝 도구를 생물 의학계에 제공한다.[15]
데이터 프라이버시 규정에서의 "비정형" 사용
[편집]스웨덴(EU)에서는 2018년 이전까지 해당 데이터가 "비정형"인 것으로 확인되면 일부 데이터 프라이버시 규정이 적용되지 않았다.[16] 이러한 비정형 데이터라는 용어는 2018년 GDPR이 시행된 이후 EU에서 거의 사용되지 않는다. GDPR은 "비정형 데이터"를 언급하거나 정의하지 않는다. 다만 다음과 같이 "정형(structured)"이라는 단어를 (정의 없이) 사용한다.
- GDPR 전문(Recital) 15항의 일부, "자연인의 보호는 개인정보의 처리에 적용되어야 한다... 만약... 파일링 시스템에 포함되어 있다면."
- GDPR 제4조, "'파일링 시스템'이란 특정 기준에 따라 접근 가능한 개인정보의 정형화된 집합을 의미한다..."
파일링 시스템을 정의하는 GDPR 판례에 따르면; "전도를 수행하는 각 구성원이 수집한 개인정보 집합이 실제로 구조화된 구체적인 기준과 형태는, 해당 데이터 집합이 접촉된 특정 개인에 관한 데이터를 쉽게 검색할 수 있게 해주는 한 중요하지 않으며, 이는 본 소송의 모든 정황을 고려하여 수소 법원이 확인해야 할 사항이다." (CJEU, Todistajat v. Tietosuojavaltuutettu, Jehovan, 61항).
개인정보를 쉽게 검색할 수 있다면 그것은 파일링 시스템이며, "정형" 또는 "비정형" 여부에 관계없이 GDPR의 범위에 속한다. 오늘날 대부분의 전자 시스템은 액세스 및 적용된 소프트웨어에 따라 데이터를 쉽게 검색할 수 있도록 허용한다.
같이 보기
[편집]각주
[편집]- ↑ “EMC News Press Release: New Digital Universe Study Reveals Big Data Gap: Less Than 1% of World's Data is Analyzed; Less Than 20% is Protected”. 《www.emc.com》. EMC Corporation. December 2012.
- ↑ “Trends | Seagate US” (미국 영어). 《Seagate.com》. 2018년 10월 1일에 확인함.
- 1 2 Grimes, Seth. “A Brief History of Text Analytics”. 《B Eye Network》. 2016년 6월 24일에 확인함.
- ↑ Albright, Russ. “Taming Text with the SVD” (PDF). 《SAS》. 2016년 6월 24일에 확인함.
- ↑ Desai, Manish (2009년 8월 9일). “Applications of Text Analytics”. 《My Business Analytics @ Blogspot》. 2016년 6월 24일에 확인함.
- ↑ Chakraborty, Goutam. “Analysis of Unstructured Data: Applications of Text Analytics and Sentiment Mining” (PDF). 《SAS》. 2016년 6월 24일에 확인함.
- ↑ “Structure, Models and Meaning: Is "unstructured" data merely unmodeled?” (영어). 《InformationWeek》. 2005년 3월 1일.
- ↑ Malone, Robert (2007년 4월 5일). “Structuring Unstructured Data” (영어). 《Forbs》.
- ↑ Lin, Cindy Xide; Ding, Bolin; Han, Jiawei; Zhu, Feida; Zhao, Bo (December 2008). 〈Text Cube: Computing IR Measures for Multidimensional Text Database Analysis〉 (미국 영어). 《2008 Eighth IEEE International Conference on Data Mining》. IEEE. 905–910쪽. CiteSeerX 10.1.1.215.3177. doi:10.1109/icdm.2008.135. ISBN 978-0-7695-3502-9. S2CID 1522480.
- 1 2 Tao, Fangbo; Zhuang, Honglei; Yu, Chi Wang; Wang, Qi; Cassidy, Taylor; Kaplan, Lance; Voss, Clare; Han, Jiawei (2016). “Multi-Dimensional, Phrase-Based Summarization in Text Cubes” (PDF).
- ↑ Collier, Nigel; Nazarenko, Adeline; Baud, Robert; Ruch, Patrick (June 2006). 《Recent advances in natural language processing for biomedical applications》. 《International Journal of Medical Informatics》 75. 413–417쪽. doi:10.1016/j.ijmedinf.2005.06.008. ISSN 1386-5056. PMID 16139564. S2CID 31449783.
- ↑ Gonzalez, Graciela H.; Tahsin, Tasnia; Goodale, Britton C.; Greene, Anna C.; Greene, Casey S. (January 2016). 《Recent Advances and Emerging Applications in Text and Data Mining for Biomedical Discovery》. 《Briefings in Bioinformatics》 17. 33–42쪽. doi:10.1093/bib/bbv087. ISSN 1477-4054. PMC 4719073. PMID 26420781.
- ↑ Skupin, André; Biberstine, Joseph R.; Börner, Katy (2013). 《Visualizing the topical structure of the medical sciences: a self-organizing map approach》. 《PLOS ONE》 8. Bibcode:2013PLoSO...858779S. doi:10.1371/journal.pone.0058779. ISSN 1932-6203. PMC 3595294. PMID 23554924.
- ↑ Kiela, Douwe; Guo, Yufan; Stenius, Ulla; Korhonen, Anna (2015년 4월 1일). 《Unsupervised discovery of information structure in biomedical documents》. 《Bioinformatics》 31. 1084–1092쪽. doi:10.1093/bioinformatics/btu758. ISSN 1367-4811. PMID 25411329.
- 1 2 Liem, David A.; Murali, Sanjana; Sigdel, Dibakar; Shi, Yu; Wang, Xuan; Shen, Jiaming; Choi, Howard; Caufield, John H.; Wang, Wei; Ping, Peipei; Han, Jiawei (2018년 10월 1일). 《Phrase mining of textual data to analyze extracellular matrix protein patterns across cardiovascular disease》. 《American Journal of Physiology. Heart and Circulatory Physiology》 315. H910–H924쪽. doi:10.1152/ajpheart.00175.2018. ISSN 1522-1539. PMC 6230912. PMID 29775406.
- ↑ “Swedish data privacy regulations discontinue separation of "unstructured" and "structured"”.