遇见数据集

Data-Gouv-FR/open-damir-base-complete-sur-les-depenses-dassurance-maladie-interregimes

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- license: other language: - fr tags: - data-gouv - donnees-publiques-francaises - parquet - csv - open-data pretty_name: "Open Damir : base complète sur les dépenses d'assurance maladie interrégimes" configs: - config_name: open-damir-2025 data_files: - split: train path: data/open-damir-2025.parquet - config_name: open-damir-2024 data_files: - split: train path: data/open-damir-2024.parquet - config_name: open-damir-2023 data_files: - split: train path: data/open-damir-2023.parquet - config_name: open-damir-2022 data_files: - split: train path: data/open-damir-2022.parquet - config_name: open-damir-2021 data_files: - split: train path: data/open-damir-2021.parquet - config_name: open-damir-2020 data_files: - split: train path: data/open-damir-2020.parquet - config_name: open-damir-2019 data_files: - split: train path: data/open-damir-2019.parquet - config_name: open-damir-2018 data_files: - split: train path: data/open-damir-2018.parquet --- # Open Damir : base complète sur les dépenses d'assurance maladie interrégimes ## Source - Source officielle : https://www.data.gouv.fr/datasets/open-damir-base-complete-sur-les-depenses-dassurance-maladie-interregimes - Identifiant du jeu de données data.gouv.fr : `54de1e8fc751df388646738b` - Slug data.gouv.fr : `open-damir-base-complete-sur-les-depenses-dassurance-maladie-interregimes` - Licence indiquée dans les métadonnées data.gouv.fr : fr-lo ## Structure Hugging Face - Un jeu de données data.gouv.fr = un dépôt Hugging Face - Une ressource tabulaire d’origine = un sous-ensemble/configuration Hugging Face - Chaque sous-ensemble/configuration contient un split nommé `train` ## Sous-ensembles - `open-damir-2025` → `data/open-damir-2025.parquet` - `open-damir-2024` → `data/open-damir-2024.parquet` - `open-damir-2023` → `data/open-damir-2023.parquet` - `open-damir-2022` → `data/open-damir-2022.parquet` - `open-damir-2021` → `data/open-damir-2021.parquet` - `open-damir-2020` → `data/open-damir-2020.parquet` - `open-damir-2019` → `data/open-damir-2019.parquet` - `open-damir-2018` → `data/open-damir-2018.parquet` ## Utilisation ```python from datasets import load_dataset # Choisir un sous-ensemble/configuration : ds = load_dataset("Data-Gouv-FR/open-damir-base-complete-sur-les-depenses-dassurance-maladie-interregimes", "open-damir-2025") print(ds["train"]) ``` ## Description originale Ce jeu de données est une extraction du système national des données de santé (SNDS) portant sur l'ensemble des remboursements de l'Assurance Maladie tous régimes confondus. Afin de préserver l'anonymat des professionnels de santé et des bénéficiaires des soins, les axes géographiques sont limités : * à 9 zones géographiques (zones d'études et d'aménagement des territoires) qui sont des regroupements de régions administratives de 2009 à 2014, * à 13 zones géographiques (proches des grandes régions administratives nouvellement créées) à partir de 2015. Les dépenses sont détaillées selon six axes d'analyse (période, prestation, organisme de prise en charge, bénéficiaire des soins, professionnel de santé exécutant, professionnel de santé prescripteur) et sept indicateurs de montant (total de la dépense, base de remboursement, montant remboursé, dépassement) et de volume (dénombrement, quantité, coefficient). Au total, chaque ligne de prestation est décrite par 55 variables. Il est indispensable de se référer au descriptif accompagnant le jeu de données. Les données sont téléchargeables au format csv. Les fichiers mensuels sont préfixés par P de 2009 à 2014 puis préfixés par A à partir de 2015. Ces fichiers sont suffixés par l'année et le mois de remboursement des dépenses. Concernant les dépenses de santé d'assurance maladie, d'autres jeux de données, couvrant des champs différents (régime général de l'Assurance Maladie), sont proposés : * [Données nationales sur les dépenses d'assurance maladie relatives aux soins de ville](https://www.data.gouv.fr/datasets/donnees-nationales-sur-les-depenses-dassurance-maladie-relatives-aux-soins-de-ville/) : base de données des remboursements de soins effectués par le régime général de l'Assurance Maladie, relatifs aux soins de ville (hors prestations hospitalières), au niveau national. * [Données nationales sur les dépenses d'assurance maladie relatives aux établissements de santé privés](https://www.data.gouv.fr/datasets/donnees-nationales-sur-les-depenses-dassurance-maladie-relatives-aux-etablissements-de-sante-prives/) : base de données des remboursements de soins effectués par le régime général de l'Assurance Maladie, relatifs aux établissements de santé privés, au niveau national. * [Données par CPAM sur les dépenses d'assurance maladie relatives aux établissements de santé privés](https://www.data.gouv.fr/datasets/donnees-par-cpam-sur-les-depenses-dassurance-maladie-relatives-aux-etablissements-de-sante-prives/) : base de données des remboursements de soins effectués par le régime général de l'Assurance Maladie, relatifs aux établissements de santé privés, au niveau national, par caisse primaire d'assurance maladie (CPAM).

This dataset is an extraction from the French National Health Data System (SNDS) covering all health insurance reimbursement expenditures across all insurance schemes. To preserve the anonymity of healthcare professionals and patients, geographical information is limited: to 9 geographic zones (groupings of administrative regions from 2009 to 2014) and to 13 geographic zones (close to the newly created large administrative regions) from 2015 onwards. Expenditures are detailed along six analysis axes (period, service, covering organization, care beneficiary, executing healthcare professional, prescribing healthcare professional) and seven amount and volume indicators (total expenditure, reimbursement base, reimbursed amount, excess, count, quantity, coefficient). Each service line is described by 55 variables. The data is downloadable in CSV format, with monthly files prefixed by P from 2009 to 2014 and by A from 2015, suffixed by the year and month of expenditure reimbursement. It is part of the French open data platform, focusing on comprehensive cross-scheme health insurance expenditure data.

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/open-damir-base-complete-sur-les-depenses-dassurance-maladie-interregimes 数据集图片
构建方式
本数据集源自法国国家健康数据系统(SNDS),汇集了跨医疗保险体制的全部报销记录。为保护医护人员与受益者的匿名性,地理维度被限制为9个(2009–2014年基于旧行政区划)及13个(2015年后根据新大区划分)研究规划区域。数据按月度文件组织,2009至2014年间文件以“P”为前缀,2015年后改为“A”前缀,文件名附有年份与月份标识。在HuggingFace平台上,数据集以年份为子集配置(2018至2025年),每个配置包含一个单一的“train”分片,数据以Parquet格式存储,便于高效加载。
使用方法
用户可通过HuggingFace的`datasets`库轻松调用该数据,例如指定`load_dataset("Data-Gouv-ML/open-damir-base-complete-sur-les-depenses-dassurance-maladie-interregimes", "open-damir-2025")`加载2025年子集,并访问其`train`分片。由于原始数据以CSV格式提供,但平台已转换为Parquet格式,推荐使用Python的Pandas或PyArrow库进行后续分析。数据字段多达55个,使用时务必参考随附的描述文档以正确理解每个变量的含义与单位,尤其注意地理代码体系在2015年后的变更。
背景与挑战
背景概述
Open Damir 数据集由法国公共数据平台 data.gouv.fr 发布,旨在提供法国跨制度医疗保险支出的全面记录。该数据集源自国家健康数据系统(SNDS),覆盖了2018年至2025年的保险报销数据,囊括了所有医疗保险制度的费用信息。其核心研究问题聚焦于医疗保险支出的结构化分析,通过六大分析维度(如时间、服务类型、受益人特征等)和七项金额与数量指标,对医疗费用进行精细化描述。作为法国公开医疗数据的重要资源,Open Damir为卫生经济学研究、公共政策评估及医疗资源优化提供了坚实的数据基础,极大地推动了法国健康数据开放运动的发展。
当前挑战
该数据集面临的主要挑战体现在领域问题与构建过程两个层面。在领域问题方面,医疗保险费用分析需处理高维数据(55个变量)和复杂指标(金额与数量),同时需确保匿名化处理以保护患者与医疗专业人员隐私,这限制了地理区域的精细度(仅允许9至13个区域分组)。在构建过程中,数据集整合了多年的异构数据(2009年起以月为单位,2015年后结构变化),需统一格式并处理历史数据不一致性;此外,大规模报销数据的清洗、去重及跨制度协调也带来了显著的技术挑战。
常用场景
经典使用场景
在法国医疗健康数据研究领域,Open Damir数据集是最具代表性的跨制度医保支出公开数据集之一。它系统收录了自2009年以来法国所有医疗保险制度下的报销记录,涵盖地区、时间、服务类型、受益人与医疗专业人员等多个维度。研究者常利用其55个变量的精细结构,对医保支出进行年度与月度趋势分析,或基于地理区域(如Z.E.A.T.分区)考察区域间医疗资源分配差异。该数据集尤其适用于横跨十余年的长期健康政策评估,通过对比不同制度与区域的报销模式,揭示医疗消费行为的演变规律。
解决学术问题
该数据集在学术层面有效回应了医疗保险研究中多个关键难题。它提供了跨制度、跨地域、长时间序列的标准化支出数据,解决了以往因数据分散、机构壁垒而难以进行全口径医保费用对比的问题。基于七大支出指标(总费用、报销基础、报销金额、超额部分及数量、系数、频次),学者能够剖析疾病负担、医疗资源利用效率及费用增长驱动因素。此外,匿名化处理的地理与人员维度设计,在保护隐私的同时支持区域卫生经济学分析,为评估医保改革政策(如2015年区域划分调整)的影响提供了坚实的实证基础,推动了卫生政策研究的科学化进程。
实际应用
在实际层面,Open Damir数据集展现出强大的应用潜力。法国国家与地方卫生行政部门可利用其对全民医保支出进行动态监测,识别不同地区、不同医疗保险制度下的费用差异与异常波动,从而优化预算分配与监管策略。医疗保险公司可基于历史报销模式建立风险预测模型,合理调整费率与偿付标准。公共卫生研究者则能结合疾病分类数据,追踪特定诊疗或药物在全法范围内的使用趋势,辅助制定更精准的干预措施。此外,该数据集也为媒体、智库及民间组织提供了透明化的公共信息基础,促进关于医疗资源配置的公众讨论与民主监督。
数据集最近研究
最新研究方向
在全球医疗健康数据治理浪潮的推动下,法国国家健康数据系统(SNDS)的开放数据集“Open Damir”正成为跨体制医保支出分析的核心枢纽。该数据集通过整合2009年至2025年涵盖9至13个地理分区的55维度支出变量,为研究者提供了前所未有的粒度来解构医疗消费模式。前沿研究方向聚焦于利用该历时性档案追踪新冠疫情前后医疗行为的结构性变迁,例如远程医疗的渗透率与药品消费的剂量弹性。同时,通过关联去标识化的专业与地理轴,学界正探索地理不平等指数在医保报销中的动态映射,以回应法国医疗系统区域公平性热点。该数据集的连续年度切片(2018至2025年)更支撑了基于梯度提升树与循环神经网络的时间序列预测模型,旨在提前识别慢性病支出的潜在激增,为公共卫生预算的精细化配置提供实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务