지식기반 사회에서는 넘쳐나는 정보를 선별하고 가공하여 유용한 지식을 획득하는 작업이 대단히 중요하다. 이런 작업에는 색인, 검색, 필터링, 요약, 시각화 등이 포함되며 이들은 모두 인간의 인식 행위의 기본이 되는 분류에 기반하고 있다. 지식 분류의 도구로서의 클 ...
지식기반 사회에서는 넘쳐나는 정보를 선별하고 가공하여 유용한 지식을 획득하는 작업이 대단히 중요하다. 이런 작업에는 색인, 검색, 필터링, 요약, 시각화 등이 포함되며 이들은 모두 인간의 인식 행위의 기본이 되는 분류에 기반하고 있다. 지식 분류의 도구로서의 클러스터링은 1960년대 후반에 용어 분류와 문헌 분류에 대한 응용 연구로 시작되었으며, 1990년대에 들어서 컴퓨터 처리 능력의 향상과 정보의 폭증에 힘입어 클러스터링에 대한 관심이 다시 커지고 있다. 특히 최근에는 지식 분류와 시각화 분야에서 많은 응용이 시도되고 있다.
어떤 대상을 분류하기 위한 클러스터링 모형은 대상 항목의 선정, 분류자질의 빈도행렬 작성, 유사계수의 적용, 클러스터링 기법의 적용 등 여러 단계로 구성된다. 각 단계마다 다양한 경우의 수가 있으므로 클러스터링 결과도 모형에 따라서 달라지게 된다. 예를 들어 동일한 대상에 대해서 상이한 유사계수를 적용하거나 상이한 클러스터링 기법을 적용하면 결과도 다르게 나타난다. 또한 본 연구의 예비실험 결과 동일한 유사계수와 클러스터링 기법을 적용하더라도 클러스터링 대상이 다를 경우에는 결과의 좋고 나쁨도 달라질 수 있음이 증명되었다. 예비실험에서는 동일한 말뭉치를 대상으로 얻어진 용어-문헌 행렬에서 유클리드거리와 같은 거리계수를 유사계수로 이용할 경우에는 행렬을 구성하는 각 값의 특성 때문에 용어 클러스터링은 별다른 문제가 없으나 문헌 클러스터링은 유효한 결과를 얻지 못하는 것으로 나타났다.
이와 같이 클러스터링은 상황에 따라서 대단히 많은 경우의 수가 생기게 되지만 지식 분류와 시각화를 비롯한 최근의 여러 연구에서는 대부분 대상 항목의 특성에 따른 적절한 클러스터링 모형에 대한 비판적인 검토가 결여되어 있다. 특히 지식의 구성 단위가 되는 용어와 문헌에 대한 클러스터링에 있어서 이런 사례가 많은데, 이는 클러스터링을 용어와 문헌의 분류에 적용하면서 두 다른 응용 영역에 대한 모형을 구분하지 않은 것도 한 가지 원인으로 판단된다.
이에 따라 본 연구에서는 자동분류 실험 문헌집단을 구축하고, 이를 기반으로 용어와 문헌을 대상으로 다양한 클러스터링 기법을 적용하는 실험을 통해 클러스터링 기법 사이의 연관성을 분석하고, 분류자질과 유사계수 및 클러스터링 기법이 분류 결과에 미치는 영향을 파악함으로써 다양한 지식 분류의 상황별 최적 클러스터링 모형을 개발하고자 한다.
이 연구에서 얻을 수 있는 결과 및 기대 효과는 다음과 같다. 첫째, 분류 자질의 차이가 클러스터링 결과에 미치는 영향을 파악할 수 있다. 둘째, 유사계수의 선택이 클러스터링 결과에 미치는 영향을 파악할 수 있다. 셋째, 클러스터링 기법의 선택이 클러스터링 결과에 미치는 영향을 파악할 수 있다. 넷째, 지식분류를 위한 최적 클러스터링 모형을 발견할 수 있다. 다섯째, 자동분류의 객관적 실험을 위한 한국어 문헌집단을 구축하여 관련 분야 연구의 활성화에 기여할 수 있다. 여섯째, 정보 검색과 시각화를 비롯한 관련 분야의 연구에 기여할 수 있다.
결과등록초록
본 연구에서는 문헌을 기반으로 한 지식의 자동분류를 위해 최적의 클러스터링 모형을 제시하고자 하였다. 클러스터링 실험을 위해서 신문기사 실험집단과 학술논문 초록 실험집단을 구축하였고, 분류 성능 평가 척도인 WACS를 개발하였다. 분류자질로 사용한 용어의 집합 ...
본 연구에서는 문헌을 기반으로 한 지식의 자동분류를 위해 최적의 클러스터링 모형을 제시하고자 하였다. 클러스터링 실험을 위해서 신문기사 실험집단과 학술논문 초록 실험집단을 구축하였고, 분류 성능 평가 척도인 WACS를 개발하였다. 분류자질로 사용한 용어의 집합은 다양한 자질 축소 기준을 적용하여 생성하였으며, 다양한 용어 가중치를 사용하였다. 유사계수 공식으로는 코사인 계수와 자카드 계수를 적용하였으며, 클러스터링 알고리즘으로 비계층적 기법인 완전연결 기법과 계층적 기법인 K-means 기법을 각각 사용하였다. 실험 결과 신문기사 원문 집단에서의 성능이 좋았으며, 완전연결 기법의 성능이 K-means 기법보다 높게 나타났다. 역문헌빈도의 적용은 완전연결 클러스터링에서는 긍정적인 효과가 나타났으며, K-means 클러스터링에서는 그렇지 못했다. 분류자질은 전체의 7.66%만 사용하였을 경우에도 성능 저하가 크지 않았으며, K-means 클러스터링에서는 오히려 성능 향상 효과가 있었다.