← 实验记录实验目标
完全跳出 Plan_1/2 的 NN + CatBoost Blending 框架,从零设计全新架构:不使用神经网络,改用临床特征工程 + 5 折 OOF 集成堆叠 + LGB Meta 学习器 + Platt Scaling 校准,验证不同路线的天花板。
架构设计
原始 19 特征
↓ 临床特征工程(+9 个派生特征 → 共 28 个)
↓ 5 折 OOF(LGB / XGB / CatBoost / RF / ExtraTrees)
↓ LGB Meta 学习器(输入 = 5 维 OOF 概率)
↓ Platt Scaling 校准(Val 集,区别于 Isotonic)
↓ 操作点选择(Val 集,Recall≥80%)
↓ Test 集最终报告 + 外部验证 Bayes 调整
临床特征工程(+9 个)
| 特征 | 含义 | 临床依据 |
|---|
| FH_x_AC | 宫高 × 胎儿腹围 | EFW 公式核心组合,重要性排名第一 |
| FH_x_FL | 宫高 × 股骨长 | — |
| BDP_x_AC | 双顶径 × 腹围 | Hadlock EFW 核心项 |
| HC_x_AC | 头围 × 腹围 | — |
| FL_x_AC | 股骨 × 腹围 | — |
| EFW_proxy | Hadlock 简化 EFW 估算 | 线性近似出生体重 |
| BMI_gain | PNBMI − PPBMI | 孕期代谢负担增量 |
| GWG_rate | GWG ÷ GA | 每孕周增重速率 |
| AC_ratio | AC_baby ÷ AC_mom | 胎儿/母体腹围相对大小 |
基模型 OOF AUC
| 模型 | 5-Fold OOF AUC | Test AUC |
|---|
| LGB | 0.889 ± 0.010 | 0.909 |
| XGB | 0.892 ± 0.009 | 0.914 |
| CatBoost | 0.904 ± 0.007 | 0.916 |
| RF | 0.903 ± 0.015 | 0.924 |
| ExtraTrees | 0.905 ± 0.021 | 0.929 |
| Meta (LGB) | — | 0.883 |
关键发现:堆叠退步
Meta 学习器 Val AUC 仅 0.803,低于所有基模型(0.860~0.879)。最终 Test AUC=0.883 也低于 Plan_1/2 的 0.902/0.903。
根因:5 个基模型全是树模型,OOF 概率输出高度同质化(分布形态几乎一致),Meta LGB 从 5 列冗余信号中学不到增量信息,反而过拟合了 OOF 训练噪声。
Test 集结果
| 指标 | 数值 |
|---|
| Sensitivity (Recall) | 97.78% |
| Specificity | 56.13% |
| FP / FN | 118 / 1 |
| AUC-ROC | 0.883 |
| Brier Score | 0.092 |
外部验证(Bayes 先验调整)
| 策略 | FP | FN | Recall | Spec |
|---|
| 原始 Meta 输出 | 46 | 0 | 100% | 69.3% |
| Platt 校准后 | 64 | 0 | 100% | 57.3% |
| Bayes 调整(推荐) | 14 | 1 | 85.7% | 90.7% |
三方案对比总结
| Plan_1(选定) | Plan_2 | Plan_3 |
|---|
| Test FP | 35 | 59 | 118 |
| Test FN | 8 | 5 | 1 |
| Test AUC | 0.902 | 0.903 | 0.883 |
| 外部 FP(Bayes) | 10 | 19 | 14 |
附带发现(有价值)
- 特征工程有效:工程特征霸占 Top-5(FH_x_FL、FH_x_AC、EFW_proxy 等),超过全部原始特征
- ET 单模型 AUC=0.929,高于 Plan_1/2 的 0.902/0.903
- 堆叠无效的核心原因是基模型同质性,而非特征或数据问题
潜在方向:直接用工程特征 + 单个 ExtraTrees(或 CatBoost),不做堆叠,可能得到更低 FP。
代码文件
Week17/分类模型/Plan3_OOF_Stacking/Plan3_ClinicalStack.py