Sử dụng giải thuật HDBSCAN và các độ đo thông dụng trong phân cụm văn bản tiếng Việt

Từ khóa:
HDBSCAN Cosine Euclidean Jaccard Coefficient phân cụm văn bản tiếng Việt
Tóm tắt
Phân cụm văn bản là quá trình nhóm các tập văn bản có tính chất tương đồng nhau từ trong một tập dữ liệu thành các cụm riêng lẻ. Kết quả của việc phân cụm văn bản đóng vai trò quan trọng trong các lĩnh vực như phân loại văn bản, trích xuất chủ đề văn bản hay tìm kiếm và trích lọc thông tin. Mỗi giải thuật phân cụm sẽ sử dụng độ đo khoảng cách hay độ đo tương đồng để xác định sự giống nhau, khác nhau giữa các văn bản. Độ chính xác của các kết quả phụ thuộc nhiều vào việc lựa chọn độ đo tương đồng kết hợp với giải thuật. Do đó việc chọn độ đo không phù hợp sẽ ảnh hưởng đến kết quả phân cụm, cho ra kết quả không mong muốn. Trong bài báo này tôi tập trung nghiên cứu phương pháp Density-based clustering trong việc phân cụm văn bản và sử dụng giải thuật Hierarchical Density-Based Spatial Clustering of Applications with Noise (HDBSCAN) kết hợp với các độ đo thông dụng để so sánh, tìm ra độ đo thích hợp khi sử dụng kết hợp với giải thuật HDBSCAN. Nghiên cứu sử dụng các độ đo thông dụng như: Cosine, Euclidean và Jaccard Coefficient dựa trên tập dữ liệu 2,000 văn bản được thu thập ngẫu nhiên từ hai trang báo điện tử vnexpress.net và vietnamnet.vn. Kết quả thực nghiệm cho thấy giải thuật HDBSCAN kết hợp độ đo Euclidean cho ra kết quả tốt nhất so với các độ đo còn lại.
Tài liệu tham khảo
  1. [1] . A. K. Jain and R. C. Dubes, Algorithms for Clustering data. Prentice Hall, 1988.
  2. [2] . R. Sharan and R. Shamir, “CLICK: a clustering algorithm with applications to gene expression analysis.,” Proceedings. Int. Conf. Intell. Syst. Mol. Biol., vol. 8, pp. 307–16, 2000.
  3. [3] . N. Jardine and C. J. V. A. N. Rijsbergen, “The use of hierarchic clustering in Information retrieval,” vol. 7, pp. 217–240, 1971.
  4. [4] . A. GRIFFITHS, L. A. ROBINSON, and P. WILLETT, “Hierarchic agglomerative clustering methods for automatic document classification,” J. Doc., vol. 40, no. 3, pp. 175–205, 1993.
  5. [5] . K. Wang, S. Zhou, and Y. He, “Classification of Real Life Documents,” Proc. 2001 SIAM Int. Conf. Data Min., pp. 1–16, 2001.
  6. [6] . J. Silva, J. Mexia, A. Coelho, and G. Lopes, “Document clustering and cluster topic extraction in multilingual corpora,” pp. 513–520, 2002.