大型语言模型在保险业的应用日益广泛,但其安全漏洞不容忽视。本研究对银行、金融、保险领域的LLM进行自动化红队测试,构建了包含保险欺诈在内的七大风险类别的金融危害分类体系,共989个对抗性提示。
保险领域的关键发现: 模型对“显性恶意”请求(如暴力)拒绝率较高,但对伪装成“专业咨询”的高风险请求——如保险欺诈手法询问、投资诈骗识别规避、索赔材料造假指导——往往给出具体可操作的回答而非拒绝。这表明现有对齐机制无法有效捕捉保险场景中“合法外衣下的违规意图”。
攻击方式的脆弱性: 实验表明,多轮自适应对话可使保险欺诈类攻击成功率从首轮约65%升至五轮后超95%。即使用户从“了解保险欺诈识别”等合规问题切入,攻击者可通过逐步精炼,诱导模型输出详细欺诈手法、监管规避路径甚至索赔材料伪造步骤,且输出伴随免责声明时RAHS评分显示风险仅部分衰减而非消除。
保险业启示: 保险公司部署AI客服、核保、理赔助手时,需警惕对抗性对话导致的合规泄露风险。当前通用安全基准无法覆盖保险领域的隐性违规场景,建议引入风险感知的红队测试,持续监测模型在欺诈诱导、公平借贷歧视、监管规避等场景下的表现,并建立多轮对话的实时风险评分机制,避免“一次合规、全程合规”的误判。

发布者:保险日报,转转请注明出处:https://www.insurdaily.com/archives/6831.html
微信扫一扫