HICRIC
收藏资源简介:
HICRIC是一个精心策划的权威法律和医学文本集合,旨在支持需要理解美国健康保险覆盖规则的应用。该语料库包含来自六个类别的文档:法律、监管指南、覆盖规则、政策意见、案例描述和临床指南。它主要用于预训练语言模型和作为检索应用的知识库。
HICRIC is a curated authoritative collection of legal and medical texts, designed to support applications that require understanding of U.S. health insurance coverage rules. This corpus contains documents across six categories: legal materials, regulatory guidelines, coverage rules, policy opinions, case descriptions, and clinical guidelines. It is primarily used for pre-training language models and as a knowledge base for retrieval applications.
HICRIC: 健康保险覆盖规则解释语料库
数据集概述
HICRIC(Health Insurance Coverage Rules Interpretation Corpus)是一个精心策划的、包含法律和医学文本的语料库,旨在支持理解美国健康保险覆盖规则的应用。该语料库主要用于预训练语言模型和作为检索应用的知识库。
数据集组成
语料库
语料库包含六种类型的文档:
- legal(法律)
- regulatory-guidance(监管指南)
- contract-coverage-rule-medical-policy(合同覆盖规则和医疗政策)
- opinion-policy-summary(政策意见摘要)
- case-description(案例描述)
- clinical-guidelines(临床指南)
此外,每个文档还带有一个kb标签,表示该文档适合用作知识库。
语料库统计
| 类别 | 文档数量 | 单词数 | 字符数 | 大小(GB) |
|---|---|---|---|---|
| 所有分区部分 | 8,310 | 417,617,646 | 2,699,256,987 | 2.81 |
| kb | 1,434 | 170,717,368 | 1,120,961,295 | 1.13 |
| legal | 335 | 92,357,802 | 596,044,008 | 0.60 |
| regulatory-guidance | 1,110 | 5,536,585 | 38,607,587 | 0.04 |
| contract-coverage-rule-medical-policy | 7 | 196,156,813 | 1,228,184,524 | 1.31 |
| opinion-policy-summary | 2,094 | 19,462,399 | 133,049,956 | 0.14 |
| case-description | 2,629 | 214,267,074 | 1,351,074,791 | 1.45 |
| clinical-guidelines | 2,150 | 81,955,020 | 553,041,990 | 0.56 |
裁决基准
除了未标注的语料库外,还发布了一个用于外部上诉结果预测任务的v0基准。该基准包含(背景上下文,外部上诉结果,充分性标签)三元组。
数据使用
访问
- 语料库:可在Huggingface上获取,地址为https://huggingface.co/datasets/Persius/hicric。
- 案例裁决:可在Huggingface上获取,地址为https://huggingface.co/datasets/Persius/imr-appeals。
重新分发
请自行查阅所有源数据的许可证,如果您计划重新分发任何数据。
风险
数据集存在潜在的偏见传播和误用风险。
限制
数据集存在任务缺陷、基准简单性和语料库缺陷等限制。
许可证
- 原始数据、文档和媒体:采用Creative Commons Attribution-ShareAlike 4.0 International License。
- 代码:采用Apache 2.0 License。




