保险损失数据具有典型的零膨胀与厚尾特征(如车险中无赔案保单占比极高),传统随机划分训练/测试集常导致极端值分配失衡,扭曲模型评估。论文通过模拟证明:随机拆分下极端观测落入测试集的标准差达7.72,而基于“支撑点”的最小能量距离拆分法将标准差压缩至1.28,且回归系数估计误差从2.6%降至0.7%,显著提升精算模型的稳定性与可重复性。
高维特征筛选是另一痛点。传统Pearson或Spearman相关系数仅能捕捉线性或单调关系,而Chatterjee相关系数(及多变量扩展)可检测任意函数依赖,且对离散、重尾分布无需分布假设。针对保险赔付中大量零值导致的排名并列问题,论文建议采用多次随机破平后平均的策略,避免特征筛选结果受破平方式随意摆动。
缺失数据处理上,简单均值填补或删除缺失记录在MAR/MNAR机制下引入严重偏差。论文推荐MissForest(随机森林迭代插补),并在其InformedAutoML框架中整合完整案例分析(删除高缺失率特征与含缺失行)与缺失插补两条管道,对完全观测样本用前者、对含缺失样本用后者,最终通过模型集成实现稳健预测。实证显示,在高缺失率(约75%)场景下,插补管道保留的有效特征数远超完整管道,系数平均绝对误差从0.097降至0.036。
该框架的保险业价值在于:将统计严谨性前置至数据准备环节,可降低模型过拟合风险、减少算力消耗(运行时间缩短至原1/4~1/5),且能适应费率厘定、准备金评估等高频更新场景。对于零膨胀率达99%的商业巨灾险数据,此方法尤为关键——它能确保风险极端值在训练与验证集中被稳定代表,避免定价偏差。未来需进一步解决超大样本下的计算扩展性,并将不平衡分布信息融入模型优化本身。

发布者:保险日报,转转请注明出处:https://www.insurdaily.com/archives/6761.html
微信扫一扫