数据挖掘任务里,异常检测通常采用哪些实现方式?请列举并简要说明几种常见的异常检测算法。
考察说明
考查对异常检测概念、常用方法及主流算法的掌握程度。
回答思路
- 【回答框架 1】异常检测(Anomaly Detection)是识别与正常行为模式显著不同的数据点的过程,常见应用包括欺诈检测、网络入侵检测、医疗诊断等。
- 【回答框架 2】根据标签可用性,可分为监督、无监督和半监督三类。无监督最常用,因为异常标签稀缺。
- 【回答框架 3】基于统计的方法假设正常数据服从某种分布(如高斯分布),计算数据点偏离分布的程度,常用3σ原则或四分位距(IQR)。
- 【回答框架 4】基于邻近性的方法通过距离或密度判断异常,如K近邻(KNN)计算到最近邻居的平均距离,孤立森林(Isolation Forest)通过随机划分特征空间快速隔离异常点。
- 【回答框架 5】基于聚类的方法如DBSCAN,将密度低的点视为异常;基于重构误差的方法如自编码器(Autoencoder),重构误差大则可能为异常。
- 【关键点 1】异常检测分为监督、半监督和无监督,无监督应用最广。
- 【关键点 2】常见算法包括统计方法(3σ)、KNN、孤立森林、DBSCAN和自编码器。
- 【关键点 3】孤立森林适合高维大数据,基于随机划分的隔离思想。
- 【关键点 4】自编码器通过重构误差识别异常。
- 【易错点 1】不要混淆异常检测和分类任务,异常检测通常无标签或极少标签。
- 【易错点 2】统计方法对分布假设敏感,若数据不满足假设则效果差。
- 【易错点 3】基于距离的方法受维度灾难影响,高维下距离度量失效。