博客 > 人工智能&数据科学 > 通用算法和模型 > 聚类算法
# 聚类基本概念和评价方法 ![0142e32b168f216c845fe947681eaf16.png](/resources/6f2ce536891b48c8b569505911ebc9bc) ![aae1dca58c4af84748988fcef08f4b31.png](/resources/1d5c75101c1449c3807d551381594cba) ## 内部指标 ![bda75077fb6c7b078087f518bb7417e3.png](/resources/aafec31ab81e479c982e4080149a0df7) ### 距离度量 欧氏距离(欧几里得距离):$d = \displaystyle\sqrt{\sum_{k=1}^m(x_{ik}-x_{jk})^2}$ 曼哈顿距离(城市街区距离):$d = \displaystyle\sum_{k=1}^m|x_{ik}-x_{jk}|$ 切比雪夫距离:$d = \displaystyle\lim_{t\to \infty}\sqrt[t]{|x_{ik}-x_{jk}|^t}$ 明可夫斯基距离:$d = \displaystyle\sqrt[p]{|x_{ik}-x_{jk}|^p}$,其中$p$为任意常数(或无穷)可见其为上述三种距离的推广。同时由于它们都形近Lp范数,也可分别称为L2度量、L1度量、L$\infty$度量和Lp度量。 ### 紧密度(Compactness) 描述类内各样本间的距离,越小越好。可视为簇中每一点到本簇中心的L1损失。如对一个由$n$个样本点组成的以$z_c$为中心的聚类$C$,其紧密度$CP_c$为: $$CP_c = \frac1n\sum_{i=1}^n||x_i-z_c||$$ 所有$k$个类别共同计算出一个平均紧密度$CP$为: $$CP = \frac1k\sum_{i=1}^kCP_i$$ ### 分隔度(Seperation) 描述不同类间的距离,越大越好。 $$ \begin{align} SP &= C^2_k\sum_{i=1}^k\sum_{j=i+1}^k||z_i-z_j|| \\ &= \frac{2}{k(k-1)}\sum_{i=1}^k\sum_{j=i+1}^k||z_i-z_j|| \end{align} $$ ### 其他内部指标 ![97162cab011985f7d4322826cc324c2f.png](/resources/bf072e5abf2f40bea434b92b05d3a44a) ![462313c7dbef3167a51031ced9025caf.png](/resources/a7bde8a54ece488d9cd1b670b5bfd538) ## 外部指标 ![1721ed1211e930ac2a302f351d155a35.png](/resources/1e7c2c38e6714128b0ab727ce88e7c7d) ![cf211954d2178fedb4856d878e0e24a3.png](/resources/78863ed5a7d24636a4d0797c2079394c) ![68a895c5f90d5ae14adb9f8a09dab77d.png](/resources/af600e0fab4b47159304a64ce224b657) ## 补充 ![bb22fb519b7e0457ff303cd208561733.png](/resources/c37ce4d60e9b4bfab8c341ba6256509e) ![6583c28f84eb3a581cb23351b41da378.png](/resources/e109873914a14634ac21765436f47acd)