数据岗位面试题更新 2026-08-05

请说明数据挖掘场景下,聚类模型效果评估的常用方法有哪些?可以列举并比较几个常见的聚类评价指标。

数据技术原理方案权衡

考察说明

考查对聚类模型评估指标的理解及适用场景辨析能力。

回答思路

  1. 【回答框架 1】聚类评价指标分为内部指标和外部指标两大类,前者无需真实标签,通过簇内紧密性和簇间分离度衡量,后者需要真实标签比较聚类结果与真实类别的吻合度。
  2. 【回答框架 2】内部指标典型有轮廓系数,它综合样本与自身簇内平均距离和最近其他簇平均距离,取值范围从负一到一,越接近一表示聚类越合理;还有Davies-Bouldin指数,度量各簇最大相似度均值,值越小说明簇间分离越好;Calinski-Harabasz指数计算簇间协方差与簇内协方差的比值,值越大表示聚类效果越好。
  3. 【回答框架 3】外部指标如纯度,统计正确聚类的样本占比;兰德指数计算样本对在聚类和真实标签中一致的比例;归一化互信息NMI,通过互信息除以熵的调和平均,范围零到一,越接近一越吻合。
  4. 【回答框架 4】实际使用时需根据是否有标签选择指标类型;无标签时常用轮廓系数,还可用Elbow方法观察SSE拐点辅助确定簇数。对比指标差异时,内部指标侧重几何结构,外部指标侧重标签一致性,适合不同验证需求。
  5. 【回答框架 5】评估前应做数据标准化,处理异常值和缺失值,否则特征尺度差异会扭曲距离计算,影响所有基于距离的聚类和指标结果。
  6. 【关键点 1】聚类评估分内部指标与外部指标,依据有无真实标签选择。
  7. 【关键点 2】轮廓系数是常用内部指标,值越接近一表示簇结构越合理。
  8. 【关键点 3】NMI和兰德指数属于外部指标,需要真实标签对比。
  9. 【关键点 4】Davies-Bouldin指数值越小越好,Calinski-Harabasz指数值越大越好。
  10. 【关键点 5】评估前标准化数据,否则指标结果不可靠。
  11. 【易错点 1】混淆内部与外部指标的适用条件,无标签时误用外部指标。
  12. 【易错点 2】忽略数据标准化,使距离度量被特征尺度主导。
  13. 【易错点 3】只依赖单一指标,应结合多个指标和可视化综合判断。