针对噪声标识符的隐私保护型多方实体对齐,无需披露交叉信息

在保险业数字化转型中,跨机构数据协作日益重要。例如,保险公司与银行、医疗机构或电信运营商联合建模,以提升欺诈检测、精准定价或健康风险评估能力。然而,这类协作涉及客户个人标识信息(如姓名、身份证号、地址等),如何在共享数据价值的同时,严格保护客户隐私,尤其是避免泄露“哪些客户在各方数据集中共同出现”(即交集成员身份),成为合规与商业伦理的双重挑战。

传统方法通常采用隐私保护集合交集(PSI),它仅暴露各方共有的客户标识,其余信息保密。但PSI的一个致命缺陷是直接暴露交集——若银行与某癌症诊所进行PSI,银行得知某客户在交集中,便可推断该客户可能患有重病,进而可能拒绝其贷款申请。这种敏感关系的泄露,不仅侵犯客户隐私,还可能引发歧视性定价或核保纠纷。

为克服这一风险,论文提出Sherpa.ai多方私有集合并集(PSU)协议,专为纵向联邦学习设计。其核心思想是:对齐时使用所有客户标识的并集,而非交集。各方最终只知并集(即所有出现过的客户),但无法区分某客户是仅在一方出现,还是多方共享。这就彻底隐藏了“谁与谁有共同客户”这一敏感信息。

【原文下载,请扫码加入知识库】

针对噪声标识符的隐私保护型多方实体对齐,无需披露交叉信息

该协议具有三项对保险业极具价值的特性:

  1. 多方扩展与低通信开销:传统PSU多限于两方,该协议自然推广至任意数量参与方(如多家保险公司、再保人、数据服务商),且通信轮次少,适合大规模保单数据。

  2. 支持噪声匹配(容错对齐):现实中的客户标识常含拼写错误、格式差异(如“John Smith”与“Smith, John”)、地址缩写等。协议引入n-gram分词与哈希,并设计了“无序匹配”变体,允许按阈值比较加密后的n-gram集合,即使标识略有差异也能正确对齐。这在保险场景中至关重要——不同机构录入的客户名、地址往往不一致,传统精确匹配会导致大量漏连。

  3. 后续可接合成数据补全:对齐到并集后,对缺失的特征(如某方没有某客户的标签),各方使用合成数据生成模型(如高斯Copula或CTGAN)填充,从而构建完整的训练数据集。这保证了后续联邦学习模型(如欺诈检测、寿险核保模型)可在不泄露原始数据的前提下协同训练。

从风险管控角度看,该协议在半诚实模型下被证明安全,基于Diffie-Hellman交换和二次剩余群,依赖判定性Diffie-Hellman难题,计算开销主要为模幂运算,且可并行化。Bloom filter的引入进一步压缩存储,提升大规模部署效率。

对保险实务的启示:该技术使保险公司能够与医院共建健康险定价模型,而无需医院暴露患者名单;可与银行共建反欺诈系统,而无需银行知晓客户的保单状态;可与多家同业联合建立行业风险池,而不泄露各自的客户重合度。这为保险科技释放跨域数据价值提供了合规路径,同时规避了反垄断与数据安全法的风险。

最后,该PSU协议与Sherpa.ai的盲垂直联邦学习(SBVFL)框架结合,可进一步减少通信、增强标签隐私,形成端到端的隐私保护解决方案。未来,融入差分隐私或基于渗透测试的模拟数据,有望在极端不对称场景下提供额外保护。

综上,这篇论文为保险业的多方数据协作提供了一套数学严谨、工程可行的隐私保护对齐工具,使“数据可用不可见”的愿景在保险核保、定价、反欺诈等核心环节落地成为可能。

发布者:保险日报,转转请注明出处:https://www.insurdaily.com/archives/6418.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
保险日报的头像保险日报
使用保险科技增强的风险因素进行实体特定的网络风险评估
上一篇 2026年 7月 13日 下午1:26
保险行业2026年中期投资策略:分红险全面转型重塑行业高质量发展逻辑
下一篇 2026年 7月 13日 下午1:30

相关推荐

  • 数字鸿沟对家庭商业保险消费的影响研究

    一、研究背景:数字化浪潮下的普惠困境数字技术重塑了保险信息传播与资源配置效率,但也催生了”数字鸿沟”——部分群体因技术接入和使用能力不足,被排除在数字化保险服务体系之外。截至2024年6月,我国仍有约22%的家庭未能接入互联网。本文基于2017年和2019年中国家庭金融调查(CHFS)24063个有效样本,构建涵盖”接入沟…

    2026年 7月 17日
    12300
  • 论文:人寿保险信托法律问题研究

    人寿保险信托,一种将保险保障功能与信托财产管理功能创新结合的金融工具,正在我国崭露头角。它通过将保险金请求权或保险金本身作为信托财产,交由专业信托公司管理,旨在实现资产的隔离保护、财富的稳健传承以及受益人的长期照顾。相较于动辄千万的传统家族信托,人寿保险信托显著降低了设立门槛,使其服务对象从超高净值人群扩展至广大中产阶级家庭,在老龄化社会背景下,其社会价值与…

    2026年 7月 9日
    14800
  • 国外替代型商业健康保险的实践及其引发的思考

    近年来,国内出现一种观点:面对基本医保筹资增速放缓与群众保障需求提升的矛盾,应大力发展商业健康保险来“替代”社会保险的部分功能,填补制度缺口。支持者常以美国、瑞士等商业保险发达的国家为参照。然而,这种“拿来主义”在方法论上存在根本性偏差。【原文下载,请在文末扫码加入知识库】 商业保险与社会保险的本质分野 商业保险以营利为核心,遵循差别费率和精算公平的市场逻辑…

    2026年 7月 15日
    27300
  • 预期寿命延长、低生育率对企业年金缴费率的影响研究

    这篇硕士论文聚焦企业年金(养老保障“第二支柱”)缴费率问题,基于世代交叠模型(OLG),系统分析了平均预期寿命延长与低生育率对其的影响。 核心发现: 预期寿命延长:在生育率固定时,预期寿命与企业年金缴费率呈负相关。寿命延长意味着工作期拉长、基本养老保险基金压力缓解,个体可通过更长时间储蓄平滑消费,从而降低对企业年金的依赖,缴费率随之下行。 低生育率:在预期寿…

    2026年 8月 1日
    4600
  • 保险数据准备中的统计陷阱与纠偏框架

    保险损失数据具有典型的零膨胀与厚尾特征(如车险中无赔案保单占比极高),传统随机划分训练/测试集常导致极端值分配失衡,扭曲模型评估。论文通过模拟证明:随机拆分下极端观测落入测试集的标准差达7.72,而基于“支撑点”的最小能量距离拆分法将标准差压缩至1.28,且回归系数估计误差从2.6%降至0.7%,显著提升精算模型的稳定性与可重复性。 高维特征筛选是另一痛点。…

    2026年 8月 2日
    4700

发表回复

登录后才能评论

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信