保险纯保费预测是车险定价的核心,直接影响组合盈利性与费率公平性。传统精算实践普遍采用频率-严重性分解框架,将纯保费拆解为预期索赔频次与平均索赔强度,分别建模后再合并。该方法契合索赔过程的双重随机性,兼具可解释性与灵活性。
本研究基于法国车险数据,对比了传统广义线性模型(GLM)与机器学习方法(XGBoost)在频次、强度及纯保费预测中的表现。主要发现如下:
一、XGBoost显著提升频次预测能力
在频次建模中,XGBoost的均方误差、相关系数及高风险段提升率(Lift)均优于Poisson GLM、样条GLM及GAM。变量重要性显示,Bonus-Malus系数、驾驶年龄、车龄是关键风险因子,与精算直觉一致。
二、强度建模面临精度与分布拟合的权衡
Gamma GLM在Gamma离差指标上占优,但预测值过度向均值收缩;XGBoost则能捕捉非线性关系,获得更低的平均绝对误差和更高相关系数。二者各有侧重,说明机器学习在强度端可补充传统模型,但无法完全替代。
三、分解框架下“XGBoost频次 + XGBoost强度”获得最低预测误差,但风险分层表现并非最优——“XGBoost频次 + Gamma强度”在高风险段的提升率更高。这揭示了预测精度与风险排序之间存在微弱但一致的权衡:追求整体误差最小化,未必能最好地识别高赔付保单。
四、分解方法优于直接建模
相比直接预测总赔款的XGBoost和Tweedie GLM,分解框架在误差和相关性上均占优。这说明分别建模频次与强度,能更充分地利用索赔过程的结构信息,尤其当频次与强度受不同因素驱动时,优势更为突出。
实践启示:若定价目标为最小化整体误差,宜采用双XGBoost分解模型;若目标为优化承保筛选与风险分级,则应重视频次建模的准确性,并接受适度误差增加。模型选择应服务于业务目标,而非唯精度论。分解框架为机器学习提供了坚实的精算基础,二者融合是车险定价的可行方向。

发布者:保险日报,转转请注明出处:https://www.insurdaily.com/archives/6801.html
微信扫一扫