文件名称:kmeans算法文本聚类java源码(分词,TF/IDF等)
文件大小:29KB
文件格式:ZIP
更新时间:2014-07-23 09:57:15
JAVA kmeans 文本聚类
算法思想:提取文档的TF/IDF权重,然后用余弦定理计算两个多维向量的距离来计算两篇文档的相似度,用标准的k-means算法,整个工程可以直接运行,
【文件预览】:
textcluster
----src()
--------com()
----.classpath(340B)
----.mymetadata(306B)
----.myeclipse()
----.project(1013B)
----WebRoot()
--------META-INF()
--------index.jsp(831B)
--------WEB-INF()