本文构建了一个面向人寿保险合同的可执行基准测试集,用于评估知识图谱在“差距与重叠分析”任务中的就绪性。该基准以十份经领域专家审核的合成人寿保险合同为核心,涵盖定期寿险、终身寿险、万能险、变额万能险、指数型万能险及联合生存险等主流产品类型。每份合同均被形式化为领域本体(TBox)并填充实例(ABox),每个实例都附有来源合同ID、条款章节及原文摘录,确保推理结果可追溯。
基准包含58个结构化保险场景(如“被保险人在保单签发后13个月自杀”),每个场景配有两组SPARQL查询——分别检索“覆盖”与“拒赔”的合同,并附有条款级证据标注。场景覆盖基础死亡理赔、贷款与转换、除外责任与附加险、联合保单、复杂产品机制及专家边界案例等类别。
实验对比了两种路径:一是纯文本大模型直接阅读合同文本并判断场景结果;二是基于本体的SPARQL查询管道。结果显示,Claude Sonnet 4.6准确率为87.76%(509/580),ChatGPT-5.3为72.93%,Gemini-3为65.17%。但文本模型在复杂合同(如变额万能险、联合生存险)上错误率显著上升,且最常见的误判是将“不适用”错误归类为“拒赔”(207例),因为模型倾向于将条款缺失视为拒赔依据,而基准中“不适用”表示合同未涉及该场景。例如,对酒驾意外死亡场景,多数合同无相关除外条款,应判定为“覆盖”,但模型却输出“拒赔”或“不适用”。另一案例中,仅一份联合保单适用“保单贷款处理”场景,其余合同应为“不适用”,但三个模型分歧严重,或全部判为覆盖,或全部判为拒赔。
相比之下,基于本体的管道通过显式编码除外期限、给付类型、宽限期等参数,以统一逻辑遍历所有合同,输出结果一致且附带证据链。这证明了结构化知识图谱在保险条款推理中的优势:它能强制消除歧义、枚举取值、声明约束,从而在查询时提供确定性、可审计的结论,而纯文本模型虽在简单场景表现尚可,但在处理合同范围、结构性适用性及证据引用时缺乏可靠性。
该基准不仅是保险知识图谱质量评估的工具,也为后续本体学习、知识图谱填充、可解释问答等任务提供了可复用模板。未来可扩展至医疗报销、金融监管等其他政策文档领域,并探索神经-符号混合方法,将大模型的语言理解力与知识图谱的严谨性结合,以实现高可靠性保险智能应用。

发布者:保险日报,转转请注明出处:https://www.insurdaily.com/archives/6587.html
微信扫一扫