← 实验记录
进行中2026年6月25日

Exp022 · 分类模型 Plan_3 — 临床特征工程 + 5折 OOF Stacking

分类模型OOF Stacking特征工程Platt校准消融实验

实验目标

完全跳出 Plan_1/2 的 NN + CatBoost Blending 框架,从零设计全新架构:不使用神经网络,改用临床特征工程 + 5 折 OOF 集成堆叠 + LGB Meta 学习器 + Platt Scaling 校准,验证不同路线的天花板。

架构设计

原始 19 特征
    ↓ 临床特征工程(+9 个派生特征 → 共 28 个)
    ↓ 5 折 OOF(LGB / XGB / CatBoost / RF / ExtraTrees)
    ↓ LGB Meta 学习器(输入 = 5 维 OOF 概率)
    ↓ Platt Scaling 校准(Val 集,区别于 Isotonic)
    ↓ 操作点选择(Val 集,Recall≥80%)
    ↓ Test 集最终报告 + 外部验证 Bayes 调整

临床特征工程(+9 个)

特征含义临床依据
FH_x_AC宫高 × 胎儿腹围EFW 公式核心组合,重要性排名第一
FH_x_FL宫高 × 股骨长
BDP_x_AC双顶径 × 腹围Hadlock EFW 核心项
HC_x_AC头围 × 腹围
FL_x_AC股骨 × 腹围
EFW_proxyHadlock 简化 EFW 估算线性近似出生体重
BMI_gainPNBMI − PPBMI孕期代谢负担增量
GWG_rateGWG ÷ GA每孕周增重速率
AC_ratioAC_baby ÷ AC_mom胎儿/母体腹围相对大小

基模型 OOF AUC

模型5-Fold OOF AUCTest AUC
LGB0.889 ± 0.0100.909
XGB0.892 ± 0.0090.914
CatBoost0.904 ± 0.0070.916
RF0.903 ± 0.0150.924
ExtraTrees0.905 ± 0.0210.929
Meta (LGB)0.883

关键发现:堆叠退步

Meta 学习器 Val AUC 仅 0.803,低于所有基模型(0.860~0.879)。最终 Test AUC=0.883 也低于 Plan_1/2 的 0.902/0.903。

根因:5 个基模型全是树模型,OOF 概率输出高度同质化(分布形态几乎一致),Meta LGB 从 5 列冗余信号中学不到增量信息,反而过拟合了 OOF 训练噪声。

Test 集结果

指标数值
Sensitivity (Recall)97.78%
Specificity56.13%
FP / FN118 / 1
AUC-ROC0.883
Brier Score0.092

外部验证(Bayes 先验调整)

策略FPFNRecallSpec
原始 Meta 输出460100%69.3%
Platt 校准后640100%57.3%
Bayes 调整(推荐)14185.7%90.7%

三方案对比总结

Plan_1(选定)Plan_2Plan_3
Test FP3559118
Test FN851
Test AUC0.9020.9030.883
外部 FP(Bayes)101914

附带发现(有价值)

  1. 特征工程有效:工程特征霸占 Top-5(FH_x_FL、FH_x_AC、EFW_proxy 等),超过全部原始特征
  2. ET 单模型 AUC=0.929,高于 Plan_1/2 的 0.902/0.903
  3. 堆叠无效的核心原因是基模型同质性,而非特征或数据问题

潜在方向:直接用工程特征 + 单个 ExtraTrees(或 CatBoost),不做堆叠,可能得到更低 FP。

代码文件

Week17/分类模型/Plan3_OOF_Stacking/Plan3_ClinicalStack.py