法律AI检索系统基准测试:以失业保险法为例

该研究系统评估了三种AI工具在跨州法定调查任务中的表现,测试场景为美国50个州的失业保险(UI)法律。结果显示,定制化检索系统STARA准确率达83%(经人工复核修正后为92%),显著优于Westlaw AI(58%)和Lexis+ AI(64%)。研究发现,商业平台存在输入长度限制、推理错误和检索遗漏等缺陷,而STARA通过保留法律文本层级结构、运用正则过滤与语义分类,在保持较高召回率的同时降低了误报。值得关注的是,约75%被STARA标记为“误报”的条款,经核对实为美国劳工部专家汇编中遗漏的有效法定条文(如加州超额支付豁免条款、科罗拉多州退休金扣除规则等),涉及失业保险领域的多个具体规则。这表明即便官方专家编撰的“基准真相”也存在系统性疏漏。研究据此提出法定检索系统设计原则:明确问题时间范围与例外条款处理、区分监管与非成文法源、提供可追溯的引用路径,并指出商业化AI平台在高速输出与准确性之间需更透明的披露与独立验证。该研究的方法论对涉及复杂法规检索的场景具有参考价值,但未涉及商业保险业务。

法律AI检索系统基准测试:以失业保险法为例

发布者:保险日报,转转请注明出处:https://www.insurdaily.com/archives/6937.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
保险日报的头像保险日报
欧洲保险业年中展望:盈利韧性不改,结构性转型深化
上一篇 18小时前
商业健康保险创新药目录:落地难点与优化路径
下一篇 18小时前

相关推荐

  • 空间面板模型在非寿险消费研究中的应用

    该研究基于意大利103个省份1998—2002年的数据,运用梯度提升方法分析非寿险(不含强制车险)人均保费支出的影响因素。研究采用广义空间面板误差成分模型,并引入L₂提升算法与事后去选机制,在低维变量环境中实现了数据驱动的变量筛选与系数估计。 核心发现表明,人均GDP、银行人均存款、人口密度、家庭平均规模、司法效率、利率是影响非寿险消费的关键变量。其中,人均…

    2026年 8月 5日
    3600
  • 食品农业风险报告:保险认知与保障缺口

    WTW《2026全球食品、饮料与农业风险报告》揭示了一个令人警惕的现象:企业对保险覆盖的认知与实际保障之间存在显著脱节。50%的受访者声称购买了供应链风险专项保险,但市场上并不存在覆盖“非损害营业中断”的单一供应链保单;45%称购买了声誉风险保险,而此类产品尚属新兴,实际普及率远低于此。更可能的解释是,企业将货运险误认为供应链保障,将产品召回险等同于声誉险—…

    2天前
    3100
  • 机器学习与频率-严重性分解在车险定价中的应用

    保险纯保费预测是车险定价的核心,直接影响组合盈利性与费率公平性。传统精算实践普遍采用频率-严重性分解框架,将纯保费拆解为预期索赔频次与平均索赔强度,分别建模后再合并。该方法契合索赔过程的双重随机性,兼具可解释性与灵活性。 本研究基于法国车险数据,对比了传统广义线性模型(GLM)与机器学习方法(XGBoost)在频次、强度及纯保费预测中的表现。主要发现如下: …

    2026年 8月 5日
    3400
  • 受限AI模型对保险业的挑战:评估缺口与市场影响

    Anthropic以“限制分发”模式发布前沿AI模型Mythos,仅限少数经审核的合作伙伴使用,形成了继开源、开放权重、闭源之后的第四类模型。此举旨在降低模型被恶意利用的风险——Mythos在检测漏洞、开发利用链方面表现优异。 这对(再)保险公司构成双重挑战。其一,攻击威胁加速:AI压缩了漏洞披露到利用的时间窗口(从数月缩至数小时),类似2017年Shado…

    2026年 8月 4日
    3600
  • 1008 | 东德制定国家企业保险法

    1950年,东德制定国家企业保险法,成立保险监察机关。“二战”后,德国分为东德和西德,1949年9月20 日,德意志联邦共和国正式成立,简称“联邦德国或西德”;同年10月7日,德意志民主共和国成立,简称“民主德国或东德”。(图/《国有企业保险法》及《德国保险监管局设立法》的记录)

    2023年 10月 8日
    1.1K00

发表回复

登录后才能评论

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信