该论文通过构建AgentDS基准测试,系统评估了AI代理在特定领域数据科学任务中的表现,其中保险行业是六个测试领域之一,包含理赔复杂度分类、风险定价回归和欺诈检测三项挑战。
核心发现对保险业的启示:
-
AI在保险领域推理能力不足:纯AI方案(GPT-4o、Claude Code)在保险挑战中表现低于人类团队中位数,尤其在处理理赔文本、定损图像、保单PDF等多模态数据时,无法有效提取领域关键信号。例如,AI常忽略屋顶损坏照片中的视觉特征,而人类专家能精准识别。
-
人类保险专业知识不可替代:参赛者通过构建精算规则(如信用风险阈值)、结合核保经验设计特征(如历史理赔频次、标的物折旧率)等方式显著提升模型表现。这些知识源于行业实践,无法从数据分布中直接学习。
-
人机协作成效最优:最佳解决方案均采用“人类指导方向+AI加速执行”模式——人类负责诊断模型偏差、制定风控策略,AI负责代码实现和快速迭代。例如,在风险定价中,人类判断需校准保费公平性,而AI仅优化统计拟合。
结论:保险领域数据科学仍高度依赖专家判断,全自动化AI尚未成熟。保险公司应优先部署辅助型AI工具,强化人机协作,而非追求完全替代。AgentDS为评估保险AI能力提供了可复用的测试框架。

发布者:保险日报,转转请注明出处:https://www.insurdaily.com/archives/6741.html
微信扫一扫