面包屑图标 当前位置: 首页
AI资讯
热点详情

机器学习模型可解释性结果分析完整指南

AI热点日报
AI热点日报时间:2026-07-20
热点解读

近年来,机器学习模型的可解释性已成为行业关注的核心议题。随着AI应用场景不断拓展,单纯依赖黑盒模型的模式已难以满足需求。尤其是在金融、自动驾驶等强监管领域,法律法规对模型可解释性提出了明确要求。此前我们探讨过可解释AI的总体背景与主流方法,本文将直接通过一个具体案例,演示如何在MATLAB中应用这些

近年来,机器学习模型的可解释性已成为行业关注的核心议题。随着AI应用场景不断拓展,单纯依赖黑盒模型的模式已难以满足需求。尤其是在金融、自动驾驶等强监管领域,法律法规对模型可解释性提出了明确要求。此前我们探讨过可解释AI的总体背景与主流方法,本文将直接通过一个具体案例,演示如何在MATLAB中应用这些可解释性方法,并解读分析结果。

要分析的机器学习模型

本文以经典的人体姿态识别任务为例进行演示。模型目标明确:通过传感器数据判断人体活动状态。数据来源为手机或其他设备上的三轴加速度计与三轴陀螺仪,共6路原始信号。模型需从这些信号中识别出走路、站立、坐、躺等六种姿态。实际处理时,首先对原始数据进行统计分析——例如计算均值与标准差,从而提取出18个特征。随后,可在MATLAB中通过分类学习器App或直接编程训练模型。训练得到的混淆矩阵如下所示,可见部分姿态识别存在误差,这正是我们深入分析的重点。

从混淆矩阵中可清晰看出,模型对“躺”(Laying)的识别准确率达到100%,但走路、上楼梯、下楼梯三种运动姿态的识别准确率则明显偏低,其中上楼梯与下楼梯均不足70%。这一结果符合直觉——躺姿的特征极为独特,而步行类动作之间的差异较小。

然而,有一个现象值得特别关注:模型在“坐”(Sitting)与“站”(Standing)之间也出现了较大混淆。按理说这两者的区别较为明显,问题究竟出在哪里?我们首先从图中圈定一个样本点(query point),该样本的真实标签为“坐”,但模型将其错误地预测为“站”。为便于后续分析,我们列出该样本点的全部18个特征值——它们分别对应原始6个传感器数据的均值、标准差以及第一主成分。

使用可解释性方法进行分析

进行模型可解释性分析的目的,在于为黑盒模型的预测结果提供合理解释——定性揭示输入特征与预测结果之间的因果关系。对于预测正确的样本,我们可以验证模型决策是否与领域知识一致,是否存在“蒙对”的成分,从而确保模型可靠上线并满足监管要求。对于预测错误的样本(如上述姿态识别案例),可解释性方法有助于定位导致错误的具体特征。具体而言,即18个特征中哪个对模型误判贡献最大。有了这一线索,后续的特征选择与参数调优才能有的放矢。

接下来,我们将尝试使用多种不同的可解释性方法,对上述query point进行深入分析,以探寻模型分类错误的根本原因。

2.1 Shapley 值

首先介绍Shapley值。它源自合作博弈论,理论基础扎实,能够提供完整的解释链。作为一种局部解释方法,Shapley值通过枚举所有可能的特征组合,计算每个特征对预测结果的平均边际贡献——需要注意的是,该贡献是相对于该类别的平均得分而言的。分值越高,表示该特征对当前预测结果的影响越大。由于理论基础坚实且发展成熟,Shapley值在金融领域被广泛用于满足合规要求。在MATLAB中调用Shapley值非常简便,只需一行代码:

exp = shapley(model,humanActivityDataTest,'QueryPoint',queryPt,'MaxNumSubsets',400);
plot(exp)

函数shapley需要传入三个主要参数:训练好的模型、测试数据集以及我们关注的query point。需要注意的是,严格计算Shapley值需要枚举所有特征组合,计算时间随特征数量呈指数增长,因此我们通过MaxNumSubsets参数限制计算规模。函数输出exp为一个结构体,直接使用plot即可可视化,结果如下图所示。

图中按Shapley值的绝对值大小进行了排序。如何理解这些得分?如前所述,Shapley值反映的是每个特征相对于类别平均得分的边际贡献。首先计算整个数据集中所有样本关于“站”类别的平均预测得分——此处为0.17577。而我们关注的query point被预测为“站”的得分为1,远高于平均值,差值0.82423。Shapley值正是体现每个特征对这一差值的贡献,所有特征的贡献之和恰好等于0.82423。图中仅显示了排名前十的特征及其对应的Shapley值。可见,特征rowmean_body_gyro_z的Shapley值最大,表明它对错误判断的影响最大。紧随其后的几个特征贡献也较为接近。

特征rowmean_body_gyro_z的实际含义是z方向陀螺仪的平均值。为什么该特征可能导致错误?我们继续深入分析。

2.2 PDP - 部分依赖图

Shapley值虽然清晰给出了每个特征的贡献大小,但要理解错误产生的具体机制,一个有效的方法是结合部分依赖图(PDP)进行分析。PDP是一种全局解释方法,关注单个特征对某类预测结果的整体影响。其思路朴素:假设所有样本的该特征都取某个固定值,然后计算预测结果的平均值;当该特征取一系列不同值时,即可绘制出一条曲线。我们延续Shapley值的分析,选择特征rowmean_body_gyro_z(对应数据中的第6个特征),分别针对真实类别“坐”和错误类别“站”绘制PDP。MATLAB代码及结果如下:

plotPartialDependence(model,6,'Sitting');
% rowmean_body_gyro_z is the 6th predictor in our data table

plotPartialDependence(model,6,'Standing');

结合第1节中query point在该特征上的实际取值0.017来看,当该特征接近0时,模型预测为“站”的分数较高;而当取值向两端偏移,尤其是接近-0.5时,预测为“坐”的分数反而更高,甚至超过0.5。这与该样本的实际预测结果一致。为进一步验证,我们抽取了约1000个样本点,绘制body_gyro_z的实际取值分布。结果如下图所示:可见,“坐”(紫色数据)的整体趋势确实比“站”(绿色数据)略小,说明模型的训练与预测过程具有一定的逻辑性。但问题在于,两者的差异并不显著,且具体到某个样本点(如我们关注的query point),其取值可能偏大或偏小,不符合大多数样本的整体趋势——这正是个别样本分类错误的原因之一。

通过部分依赖图,我们对Shapley值的分析结果有了更直观的认识——虽然该样本点被预测错误,但结合原始数据的整体分布来看,模型的错误是有迹可循的,并非毫无道理。

在讨论下一步之前,我们再来尝试一种新的可解释性方法。

2.3 LIME - 局部可解释模型无关解释

除Shapley值外,LIME是另一种广泛使用的局部解释方法。其思想朴素易懂:针对感兴趣的样本点,在其附近生成一组扰动数据,利用黑盒模型获得预测结果,然后用这些数据训练一个局部近似的可解释模型(如线性模型或决策树),借助该近似模型来理解黑盒模型的决策过程。在MATLAB中,线性模型和决策树均可作为局部近似模型。需要注意的是,由于近似模型基于随机生成的扰动数据训练,每次运行结果(包括特征排序)都会存在一定随机性。我们仍使用上述姿态识别模型中的query point,采用线性模型进行局部近似,代码及结果如下:

limeObj = lime(model, humanActivityData, 'QueryPoint',queryPt,'NumImportantPredictors',6);
f = plot(limeObj);

由于使用了线性模型,预测结果仅简单给出是否为“站”。横坐标表示每个特征在线性模型中的系数。有趣的是,这个简单模型的预测结果与黑盒模型的预测结果并不一致——这是否意味着LIME的结果无效?先别急于下结论。我们挑选出系数正负值中绝对值最大的两个特征——rowstd_total_acc_z(第9个特征)和rowmean_total_acc_x(第1个特征),利用PDP将“坐”和“站”两个类别的曲线绘制在同一张图中:

plotPartialDependence(model,9,{'Sitting','Standing'},humanActivityDataTest)

plotPartialDependence(model,1,{'Sitting','Standing'},humanActivityDataTest);

这两个特征分别代表z方向加速度的标准差和x方向加速度的均值。结合query point的实际取值——rowstd_total_acc_z=0.0048、rowmean_total_acc_x=1.0129——可以看出,1.0129这个值对模型做出正确预测具有积极作用,这可能也是简单模型判定它不是“站”的原因:站立姿态通常不会在x方向产生如此大的加速度。而rowstd_total_acc_z的系数虽然很大,但样本点取值很小(标准差小,数据集中),从PDP中也能看出,在该取值区间内它对“站”与“坐”的区分度不高,需等到数值增大后影响才会显著。需要说明的是,LIME得到的特征排序(或系数大小)与Shapley值的结果差异较大。部分原因在于LIME基于随机扰动数据得到的近似模型与黑盒模型本身存在偏差。可以尝试不同的随机数种子,或改用其他简单模型,获得多样化的结果再进行对比分析。回到最初的问题:这个简单模型到底是否有效?机器学习模型的预测过程本就极其复杂,黑盒模型之所以强大,正是由于其内部的高度非线性。无论是Shapley值、PDP还是LIME,每种解释方法都仅是从某个角度帮助我们窥探模型决策的机理。将这些不同角度的分析结合起来,才能逐步逼近一个更全面的结论——从这个意义上说,每个方法都有其价值。而LIME自带的随机性以及可选择的局部模型,反而给了我们更多尝试的可能性。关于LIME的更多使用细节,可参考之前的文章。

后续工作

获得模型的解释结果仅是第一步。拿到上述分析结果后,我们能做些什么?

现在我们知道,rowmean_body_gyro_z、rowstd_total_acc_z等几个特征对错误分类影响显著。接下来可以从原始数据入手,深入挖掘背后的原因:例如,采集样本点时数据本身是否存在误差?如果原始数据无误,那么采用均值、标准差这类统计方式提取特征是否足够?是否需要选择更复杂的统计方法?在模型训练阶段,能否通过修改代价函数来提升准确率?显然,仅分析一个样本点就对整个模型下结论是不严谨的。但上述分析提供了明确线索——我们可以对更多错误样本进行类似的解释分析,再结合其他手段逐步改进模型。同样的方法也可用于预测正确的样本:对正确样本进行可解释性分析,并与我们对问题的先验知识进行对比,从而验证模型决策的合理性。

其他方法

上面通过实例介绍了三种不同的可解释性方法。除此之外,MATLAB还支持ICE图(与PDP类似,但会绘制每个样本的预测结果以展示分布),以及本身具备可解释性的广义加性模型(Generalized Additive Model)等。如需了解更多,可查阅MATLAB帮助文档。对于深度学习模型——如图像、语音、信号处理等领域——也有类似的可解释性方法,例如Occlusion Sensitivity、GradCAM、Image LIME等。限于篇幅,此处不再展开。

热点追踪提示词
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:机器学习模型可解释性结果分析完整指南要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
来源:https://m.elecfans.com/article/2260295.html
机器学习

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关热点
AI热点2026-07-21 09:10
技嘉发布RTX 5080木艺显卡与X870E蝶翼主板的独特设计

在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印

AI热点2026-07-21 09:10
星际荣耀火箭海上回收导航系统关键试验成功

星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证

AI热点2026-07-21 09:10
Origin Code发布全新英特尔CQDIMM与AMD EXPO ULL内存新品带来AI与渲染性能的强劲提升

PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E

AI热点2026-07-21 09:10
东风本田5月销量环比增长20% CR-V等车型限时购车权益

东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。

延伸阅读