重庆市技术创新与应用发展专项重点项目(CSTB2023TIAD- KPX0048)
目的基于我国社区老年人易获取的非影像学特征,建立并验证可解释的机器学习模型,用于轻度认知障碍(MCI)的早期筛查。方法采用中国健康与养老追踪调查(CHARLS)2011-2022年纵向数据,纳入年龄≥60岁且完成认知评估的研究对象1 198例,按7∶3比例随机分为训练集(n=838)和验证集(n=360)。在12项候选预测变量中以Boruta算法筛选预测特征,构建XGBoost等多种机器学习模型。采用受试者工作特征曲线下面积(AUC)、准确度、灵敏度、特异度、Brier分数评价模型性能,用决策曲线分析(DCA)评估临床实用性,采用SHAP方法进行可解释性分析。结果训练集内部,与非MCI组相比,MCI组年龄更大、受教育年限更短,农村户籍和自评健康状况差的比例更高,抑郁症状评分更高,即时记忆、延迟记忆和综合认知功能得分更低,平均红细胞体积(MCV)及空腹血糖水平更高,血红蛋白水平更低,差异均有统计学意义(均P<0.05)。Boruta算法从训练集12项候选预测变量中,筛选出4项变量:延迟记忆得分、即时记忆得分、综合认知功能得分、MCV。在验证集中,XGBoost模型表现最佳,AUC为0.854(95%CI:0.810~0.898),准确度为0.819,灵敏度为0.831,特异度0.803,Brier分数0.122,明显大于AdaBoost(AUC=0.801)、MLP(AUC=0.795)、Lasso-Logistic(AUC=0.792)、递归特征消除(RFE)-Logistic(AUC=0.781)模型的AUC,差异均有统计学意义(P<0.05)。剔除MCV后,XGBoost模型AUC由0.854(95%CI:0.810~0.898)降至0.777(95%CI:0.729~0.824),ΔAUC=0.077(95%CI:0.034~0.120),差异有统计学意义(Z=3.52,P<0.001)。DCA分析显示,XGBoost模型在15%~65%阈值概率区间内净获益最高。SHAP可解释性分析揭示,延迟记忆得分对模型预测贡献最大,MCV升高是发生MCI的独立危险因素(P<0.05)。结论基于4项易获取指标(包括MCV)的XGBoost模型具有良好的判别性能、临床实用性和可解释性,适用于基层医疗机构开展MCI早期筛查。MCV作为检测简便、低成本的血液生物标志物,对MCI具有独立预测价值,值得进一步探索其潜在机制和临床应用前景。
刘刚 ,佘强 ,杜建霖 ,王凯娟 △.可解释机器学习模型在轻度认知障碍早期筛查中的应用[J].检验医学与临床,2026,23(16):2173-2181