[{"source":{"position":11,"lines":["给定数据集合$D=\\{\\vec\\{x_1, ....,x_n\\}\\}$,使用某个参考模型的簇分为$C\\^\\*=|C\\^\\*_1....C\\^\\*_K|$,若算法给出的簇划分为$C=|C_1, ..., C_K|$"],"changePosition":null},"target":{"position":11,"lines":["给定数据集合$D={\\vec{x_1, ....,x_n}}$,使用某个参考模型的簇分为$C^*=|C^*_1....C^*_K|$,若算法给出的簇划分为$C=|C_1, ..., C_K|$"],"changePosition":null},"type":"CHANGE"},{"source":{"position":13,"lines":["a:同事包含于$C\\^*$和$C$的样本对数","b:包含于$C$,但是不属于$C\\^*$的样本对数","c:不包含于$C$,但是属于$C\\^*$的样本对数","d:不包含于$C$,也不属于$C\\^*$的样本对数"],"changePosition":null},"target":{"position":13,"lines":["a:同事包含于$C^*$和$C$的样本对数","b:包含于$C$,但是不属于$C^*$的样本对数","c:不包含于$C$,但是属于$C^*$的样本对数","d:不包含于$C$,也不属于$C^*$的样本对数"],"changePosition":null},"type":"CHANGE"},{"source":{"position":19,"lines":["$$\begin{gathered}JC=\\frac\\{a\\}\\{a + b + c\\}\end{gathered}$$"],"changePosition":null},"target":{"position":19,"lines":["$$\begin{gathered}JC=\\frac{a}{a + b + c}\end{gathered}$$"],"changePosition":null},"type":"CHANGE"},{"source":{"position":22,"lines":["$$\begin{gathered}FMI=\\sqrt\\{\\frac\\{a\\}\\{a+b\\} * \\frac\\{a\\}\\{a+c\\}\\}\end{gathered}$$"],"changePosition":null},"target":{"position":22,"lines":["$$\begin{gathered}FMI=\\sqrt{\\frac{a}{a+b} * \\frac{a}{a+c}}\end{gathered}$$"],"changePosition":null},"type":"CHANGE"},{"source":{"position":28,"lines":["给定数据集合$D=\\{\\vec\\{x_1, ....,x_N\\}\\}$,簇划分为$C=|C_1, ..., C_K|$,","$$\begin{gathered}avg(C_k)=\\frac\\{2\\}\\{|C_K|(|C_k| + 1)|\\}\\sum distane(x_i, x_j)\end{gathered}$$"],"changePosition":null},"target":{"position":28,"lines":["给定数据集合$D={\\vec{x_1, ....,x_N}}$,簇划分为$C=|C_1, ..., C_K|$,","$$\begin{gathered}avg(C_k)=\\frac{2}{|C_K|(|C_k| + 1)|}\\sum distane(x_i, x_j)\end{gathered}$$"],"changePosition":null},"type":"CHANGE"},{"source":{"position":42,"lines":["$$\begin{gathered}DBI=\\frac\\{1\\}\\{K\\}\\sum_\\{k=1\\}\\^\\{K\\}max\\ (\\frac\\{avg(C_K) + avg(C_i)\\}\\{decn(C_k,C_i)\\})\end{gathered}$$"],"changePosition":null},"target":{"position":42,"lines":["$$\begin{gathered}DBI=\\frac{1}{K}\\sum_{k=1}^{K}max\\ (\\frac{avg(C_K) + avg(C_i)}{decn(C_k,C_i)})\end{gathered}$$"],"changePosition":null},"type":"CHANGE"},{"source":{"position":48,"lines":["$$\begin{gathered}DI=\\frac\\{min_\\{k!=i\\}dmin(C_k, C_i)\\}\\{max_idiam(C_i)\\}\end{gathered}$$"],"changePosition":null},"target":{"position":48,"lines":["$$\begin{gathered}DI=\\frac{min_{k!=i}dmin(C_k, C_i)}{max_idiam(C_i)}\end{gathered}$$"],"changePosition":null},"type":"CHANGE"},{"source":{"position":51,"lines":[],"changePosition":null},"target":{"position":51,"lines":["# 常用聚类方式及其特点","## 硬聚类","所谓的硬聚类就是指聚类算法中每个点必须属于一个簇,这里典型的算法有DBSCAN和K-means.","其中DBSCAN需要执行一个簇中最少有几个节点,以及半径。而这个半径尤其难以启发式的指定。所以进一步会有HDBSCAN,HDBSCAN的典型特点是不需要执行半径,HDBSCAN能够学出不同密度的簇。","K-means也比较简单,超参数是K,也就是你想要聚出多少个簇。","","## 软聚类"," 软聚类是指一个节点可以同时属于多个簇,在某些场景下也是比较好用的算法。典型的算法是高斯混合模型。",""],"changePosition":null},"type":"INSERT"}]