遇见数据集

Data-Gouv-FR/pesticides-dans-les-eaux-souterraines

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为地下水中的农药,是法国公开环境数据的一部分,旨在响应1992年地球峰会的承诺,定期发布与生态转型相关的信息,特别是水环境和生物多样性状态以及风险暴露情况。数据集重点关注地下水受农药污染的情况,基于法国(包括本土和海外领土)约2200个测量站的监测网络数据。这些数据涵盖了近600种不同的农药,包括杀虫剂、杀菌剂和除草剂,主要用于农业保护,但也涉及花园维护和交通基础设施。农药可能对生态系统(尤其是水生环境)和人类产生急性和/或慢性毒性影响。数据集包括测量站的特征、不同农药的特征(如类型、母分子、代谢物、可能的禁用日期)、监测水体的特征,以及2007年至2012年各年份的测量结果(如每年测量次数、农药检测情况、年平均浓度、与现行标准的比较等)。此外,还提供了每个站的农药总浓度和农药数量。数据以Parquet和CSV格式提供,用于分析和可视化地下水农药污染情况。

### 数据集基础信息 许可证:其他 语言:法语 标签: - 法国国家开放数据平台(data.gouv.fr) - 法国公共数据(donnees-publiques-francaises) - Parquet格式 - CSV格式 - 开放数据(open-data) 展示名称:「地下水中的农药」 配置项: 1. 配置名称:监测站变量字典,数据文件:拆分集`train`,路径:`data/dictionnaire-des-variables-pour-les-stations-de-mesures.parquet` 2. 配置名称:监测站特征信息,数据文件:拆分集`train`,路径:`data/caracteristiques-des-stations-de-mesures.parquet` 3. 配置名称:待检测农药特征信息,数据文件:拆分集`train`,路径:`data/caracteristiques-des-differents-pesticides-recherches.parquet` 4. 配置名称:2012年定量农药总浓度平均值,数据文件:拆分集`train`,路径:`data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2012.parquet` 5. 配置名称:2011年定量农药总浓度平均值,数据文件:拆分集`train`,路径:`data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2011.parquet` 6. 配置名称:2010年定量农药总浓度平均值,数据文件:拆分集`train`,路径:`data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2010.parquet` 7. 配置名称:2009年定量农药总浓度平均值,数据文件:拆分集`train`,路径:`data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2009.parquet` 8. 配置名称:2008年定量农药总浓度平均值,数据文件:拆分集`train`,路径:`data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2008.parquet` --- # 地下水中的农药 ## 来源 - 官方来源:https://www.data.gouv.fr/datasets/pesticides-dans-les-eaux-souterraines - data.gouv.fr数据集标识符:`594c298ec751df76726294d9` - data.gouv.fr数据集别名:`pesticides-dans-les-eaux-souterraines` - data.gouv.fr元数据中标注的许可证:fr-lo ## Hugging Face数据集结构 - 一个data.gouv.fr数据集对应一个Hugging Face仓库 - 一份原始表格资源对应一个Hugging Face子集合/配置 - 每个子集合/配置均包含名为`train`的拆分 ## 子集合 - `监测站变量字典` → `data/dictionnaire-des-variables-pour-les-stations-de-mesures.parquet` - `监测站特征信息` → `data/caracteristiques-des-stations-de-mesures.parquet` - `待检测农药特征信息` → `data/caracteristiques-des-differents-pesticides-recherches.parquet` - `2012年定量农药总浓度平均值` → `data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2012.parquet` - `2011年定量农药总浓度平均值` → `data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2011.parquet` - `2010年定量农药总浓度平均值` → `data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2010.parquet` - `2009年定量农药总浓度平均值` → `data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2009.parquet` - `2008年定量农药总浓度平均值` → `data/moyennes-des-concentrations-totales-en-pesticides-quantifiees-2008.parquet` ## 使用方法 python from datasets import load_dataset # 选择子集合/配置: ds = load_dataset("Data-Gouv-FR/pesticides-dans-les-eaux-souterraines", "dictionnaire-des-variables-pour-les-stations-de-mesures") print(ds["train"]) ## 数据集说明 为响应1992年里约地球峰会所作出的承诺,法国将环境信息列为优先发展方向。法国环境部定期发布与生态转型相关的信息,尤其是关于生态系统与生物多样性现状、以及风险与危害暴露情况的信息,其中就涵盖水生环境污染问题,例如农药对地下水的污染。 有关农药污染地下水的信息会定期发布,此类信息基于地下水监测网络的数据分析构建而成。该监测网络在法国本土及海外领地共设有近2200个监测站。 「农药」(又称「植物保护产品」或「植物源农药产品」)是一个通用术语,涵盖杀虫剂、杀菌剂与除草剂等品类。此类物质主要用于农业作物保护,同时也应用于园林(地方集体、个人)及交通基础设施的维护。农药可能会对包括水生生态系统在内的生态环境以及人类产生急性和/或慢性毒性作用。「数据可视化大赛:地下水中的农药——规则——2016年12月15日 第3页/共14页」 在地下水水质监测的采样环节中,共需检测近600种不同的农药,由此产生了海量监测数据。在地下水中检测的物质包括市售产品的活性成分及其降解残留物(代谢物)。 地下水农药监测的一大特点在于,地下往往存在多层相互独立程度不一的地下水含水层。监测的目标之一是全面掌握这些水体的水质状况,其中部分含水层被用作饮用水水源。 本次提供的数据集资源包括: - 监测站基本特征信息 - 待检测农药的基本信息:除草剂、杀虫剂、杀菌剂、母分子、代谢物、可能的禁用日期 - 待监测地下水含水层的基本信息 - 2007至2012年各监测站的监测结果:年度监测次数、检测农药种类、年度平均浓度、与现行标准的对比情况等 - 2007至2012年各监测站的监测结果:农药总浓度及单站检出农药数量

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/pesticides-dans-les-eaux-souterraines 数据集图片
构建方式
该数据集源自法国政府开放数据平台data.gouv.fr,旨在响应1992年里约地球峰会关于环境信息透明的承诺。构建方式遵循了Hugging Face数据集的结构规范,将原始数据资源映射为多个子集配置,每个子集对应一个独立的Parquet文件。核心数据涵盖法国地下水监测网络中约2,200个测量站点的相关信息,包括站点特征、农药特性、以及2008至2012年间每年量化农药总浓度的平均值。所有子集均包含一个统一的训练拆分,便于后续分析与建模。
特点
数据集具有显著的多维性和时间序列特征。其子集设计精细,分别聚焦于测量站属性、农药品种分类(如除草剂、杀虫剂、杀菌剂及代谢产物)以及年度浓度汇总,为研究者提供了从监测基础设施到化学物质特性的全景视角。尤其值得关注的是,数据涵盖了农药的法定禁用日期信息,以及地下水体质量评估所需的关键指标,如年均浓度与相关标准对比,这为环境风险评估和趋势分析奠定了坚实基础。
使用方法
用户可通过Hugging Face的datasets库便捷调用该数据集。加载时需指定具体子集名称,例如使用`load_dataset("Data-Gouv-ML/pesticides-dans-les-eaux-souterraines", "dictionnaire-des-variables-pour-les-stations-de-mesures")`命令,即可获取变量字典。每个子集均以Parquet格式存储,并预加载为训练集,极大简化了数据预处理流程。该设计特别适用于构建法国地下水农药污染的时间序列模型或空间分布研究。
背景与挑战
背景概述
该数据集源自法国政府环境信息公开的长期行动,旨在响应1992年里约地球峰会承诺,聚焦地下水中农药污染的监测与评估。由法国生态转型部主导,通过遍布全法(本土及海外领地)近2200个地下水监测站点的网络收集数据,时间跨度覆盖2007至2012年。核心研究问题在于量化地下水中农药残留的时空分布,揭示农业与非农业源(如园林维护、交通设施)对地下水质的综合影响。数据集包含监测站特征、农药理化属性(如除草剂、杀虫剂、代谢产物)及年均总浓度等关键变量,对法国乃至全球地下水污染治理、饮用水安全政策制定具有重要支撑作用,亦为环境科学领域的大数据分析与可视化竞赛提供了标准化基准。
当前挑战
该数据集面对的领域核心挑战在于地下水系统的复杂异质性——叠加的多层含水层相互独立且互动不明,难以通过有限采样点推断区域整体污染态势。同时,近600种农药及其代谢物的追踪需处理高维度稀疏数据,而不同物质的毒性阈值、降解途径及法规禁限状态差异进一步增加了评估难度。在构建过程中,挑战来自多源异构数据的整合:2007至2012年的年度浓度均值表需与站点元数据、农药字典键值对齐,缺失值处理与年际监测标准变化(如检测限调整)要求精细的清洗策略。此外,将法语法令定义的开放数据(License fr-lo)转化为机器学习适用的Parquet格式时,需保留原始语义并确保时空变量的可溯源性,这对标准化流程提出了严苛要求。
常用场景
经典使用场景
该数据集为地下水农药污染监测研究提供了全面的结构化数据,涵盖2008至2012年间法国境内约2200个监测站点的年度农药总浓度平均值。通过整合监测站特征、农药理化性质及不同年份的污染浓度数据,研究者可系统分析农药在地下水中的时空分布规律,评估不同类型农药(如除草剂、杀虫剂、杀菌剂及其代谢产物)的污染贡献,并追踪禁用农药的残留动态。
实际应用
在实际应用中,该数据集被用于指导法国及欧洲的地下水水质管理决策,包括识别高污染风险区域以优化饮用水源保护策略、评估农业管理措施(如替代农药推广)的减污效果,以及支持环保部门制定差异化的污染治理优先级。此外,数据可视化竞赛也基于该数据集探索了公众对农药污染认知的交互工具开发。
衍生相关工作
基于该数据集的衍生工作主要包括地下水污染时空可视化工具的构建、农药迁移转化模型的验证以及机器学习预测污染物浓度方法的研究。例如,相关学者利用数据集训练了随机森林与深度学习模型,以高精度预测未采样区域的污染水平;同时,数据驱动的水质分区方法被提出,将传统统计分析与空间聚类技术结合,提升了区域污染管控的粒度与效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务