遇见数据集

datause-ner

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

该数据集是Datause NER项目的一部分,旨在从文本段落中识别所有数据提及(DATA_MENTION),即任何与数据相关的提及。数据集基于rafmacalaba/datause-probe-v3构建,包含了29,346个候选跨度,这些跨度被组织成语段示例。每个候选跨度都被统一标记为唯一实体类型“DATA_MENTION”,没有进一步区分子类型(如命名、描述性或模糊提及),也不包含非提及标签。保留或丢弃跨度的决策由探测头(probe head)负责,而非NER标签本身。数据集提供了多种配置:gliner配置包含tokenized_text和ner字段;gliner2配置包含input和output字段;probe_splits和probe_candidates配置则镜像原始探测数据。每行记录还包含丰富的追踪信息,如corpus_id、page、chunk、split、spans(含文本、预测、luna_label、head_score、阈值、字符偏移、key和source)。数据按文档不重叠的方式划分为训练集、验证集和保留集。该数据集适用于命名实体识别(NER)、跨度提取以及数据提及检测等任务,尤其适合需要捕获所有潜在数据提及场景的模型训练与评估。

This dataset is part of the Datause NER project, aimed at identifying all data mentions (DATA_MENTION) from text paragraphs, i.e., any reference related to data. It is built upon rafmacalaba/datause-probe-v3 and contains 29,346 candidate spans organized into sentence-level examples. Each candidate span is uniformly labeled with the unique entity type DATA_MENTION, without further distinction into subtypes (such as named, descriptive, or vague mentions), and no non-mention labels are included. The decision to retain or discard a span is handled by a probe head rather than the NER tags themselves. The dataset offers multiple configurations: the gliner configuration includes tokenized_text and ner fields; the gliner2 configuration includes input and output fields; the probe_splits and probe_candidates configurations mirror the original probe data. Each record also contains rich tracking information such as corpus_id, page, chunk, split, spans (with text, prediction, luna_label, head_score, threshold, character offsets, key, and source). The data is split into training, validation, and holdout sets in a non-overlapping manner by document. This dataset is suitable for tasks like named entity recognition (NER), span extraction, and data mention detection, especially for training and evaluating models that need to capture all potential data mentions in a scenario.

创建时间:
2026-09-08
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Datause NER
  • 任务类型:Token 分类(命名实体识别)
  • 许可证:Apache 2.0
  • 实体类型:仅包含单一实体类型 DATA_MENTION

数据特点

  • 数据来源于 rafmacalaba/datause-probe-v3 语料,共包含 29,346 个跨度,按段落示例进行分组。
  • 采用**全捕获(catch-all)**标注策略:所有候选跨度均被标记为 DATA_MENTION,不区分保留(keep)与丢弃(drop)样本,也不包含 NAMED/DESCRIPTIVE/VAGUE 子类型。
  • 保留/丢弃的边界由探针头(probe head)通过阈值控制,NER 标签本身不承担该区分任务。

配置与文件结构

配置名称 数据文件 划分
gliner gliner_{train,val,holdout}.jsonl train / val / holdout
gliner2 gliner2_{train,val,holdout}.jsonl train / val / holdout
probe_splits probe_{train,val,holdout}.jsonl train / val / holdout
probe_candidates probe_candidate_pool.jsonl pool

数据列说明

gliner 配置

  • tokenized_text + ner:每个候选跨度标注为 DATA_MENTION

gliner2 配置

  • input + outputdata_mention 包含所有跨度的字符串。

通用字段

  • 每行包含可追溯性信息:corpus_idpagechunksplitspans(每个跨度的文本、预测、luna_label、head_score、阈值、字符偏移、key、source)。
  • Luna 的保留/丢弃判定结果保存在 spans[].luna_label 中,便于审计;标注结果遵循 head-threshold 操作点。

数据划分

  • 训练集 / 验证集 / 留出集采用文档不重叠划分方式。
  • 划分继承自 rafmacalaba/datause-probe-v3,因此 NER 划分与 probe 划分一致。

各来源阈值

数据来源 阈值
fcv_pads_east_africa 0.5
general_prwp 0.3
jad_paddy_docs 0.3
jdc_operational 0.5
refugee_pads 0.6
reliefweb 0.3

使用方式

python from datasets import load_dataset

gliner 配置

gliner = load_dataset("rafmacalaba/datause-ner", "gliner")

gliner2 配置

gliner2 = load_dataset("rafmacalaba/datause-ner", "gliner2")

probe 配置

splits = load_dataset("rafmacalaba/datause-ner", "probe_splits") cands = load_dataset("rafmacalaba/datause-ner", "probe_candidates")

搜集汇总
数据集介绍
datause-ner 数据集图片
构建方式
该数据集基于rafmacalaba/datause-probe-v3的篇章语料构建,将29,346个跨度按篇章示例分组,形成文档不相交的训练、验证与保留集。构建过程采用通配式命名实体识别视图,将每个候选跨度统一标注为单一实体类型DATA_MENTION,保留与丢弃的判定边界由探针头模型负责,而非依赖NER标签本身。语料来源涵盖fcv_pads_east_africa、general_prwp、jad_paddy_docs、jdc_operational、refugee_pads及reliefweb六个origin,并为每个origin设定了基于探针头最佳F1的独立阈值,以保证标注操作点的可追溯性。
使用方法
使用者可通过HuggingFace datasets库加载不同配置以适配多样化需求。加载gliner配置可获得tokenized_text与ner字段,其中每个候选跨度均标注为DATA_MENTION;加载gliner2配置则提供input与output字段,output中的data_mention包含所有跨度字符串。若需复现探针实验,可加载probe_splits与probe_candidates配置,前者与datause-probe-v3的划分完全一致,后者提供候选池数据。所有配置均支持train、val、holdout或pool划分,便于模型训练、阈值调优与泛化评估。
背景与挑战
背景概述
数据密集型领域中的实体识别长期面临数据引用边界模糊的困境,既有研究多聚焦于命名实体或描述性指称的精细化分类,却鲜有对数据提及本身的系统性标注资源。datause-ner数据集由rafmacalaba于近年构建,旨在为数据提及识别提供统一监督信号,其核心创新在于采用单一DATA_MENTION类型的catch-all标注策略,将保留与丢弃的判别边界交给下游探针头而非NER标签本身。该数据集继承自datause-probe-v3的段落级文档切分,涵盖29,346个跨度,按文档不重叠划分为训练、验证与测试集,并针对不同语料来源设定了差异化阈值,为数据引用检测与跨度抽取研究提供了可复现的基准。
当前挑战
该数据集所应对的领域挑战在于数据提及的语义边界高度依赖上下文与语料来源,同一跨度在不同语境下可能承担完全不同的引用功能,而现有NER范式难以直接建模这种保留与丢弃的连续判定。构建过程中,研究者需在保持NER标注简洁性的同时,将探针头的阈值决策与跨度级标签解耦,这要求对每一行数据保留完整的溯源信息,包括语料编号、页码、块索引、每跨度的预测值、luna标签、头部得分、阈值及字符偏移,以确保审计可行性;此外,多源语料(如fcv_pads_east_africa、general_prwp、refugee_pads等)的阈值异质性进一步增加了标注一致性与评估公平性的难度,如何在统一框架下协调不同来源的判定标准构成了该数据集的核心技术挑战。
常用场景
经典使用场景
在命名实体识别与数据引用抽取的交叉领域,datause-ner数据集构筑了一种囊括式标注范式,将文本中每一处候选片段统一标记为DATA_MENTION实体类型。此举突破了传统NER对命名实体与非命名实体的严格划界,使模型得以聚焦于数据提及的边界探测,而非实体类别的细分判别。研究者通常借助gliner与gliner2两种配置开展token分类与片段抽取实验,在文档不相交的train/val/holdout划分上评估模型对数据引用的召回能力,尤其适用于科学文献、政策文档及人道主义报告中数据出处与数值引用的系统性挖掘。
解决学术问题
该数据集直面数据引用识别中长期存在的边界模糊与标注歧义问题,通过保留每一候选片段并交由探测头判定去留,规避了传统NER中实体类别定义不一致带来的标注噪声。其文档不相交的划分策略有效缓解了数据泄露风险,为跨领域数据提及抽取提供了可复现的评测基准。在学术层面,它推动了实体识别从类别中心向边界中心的研究转向,为探究上下文语义与数据引用判别之间的关系提供了关键素材,亦为多来源文档中数据溯源任务建立了方法学参照。
实际应用
在实际应用中,datause-ner可服务于科研数据管理、政策文件审阅与人道主义信息抽取等场景。科研机构可借助该数据集训练模型自动提取论文与报告中的数据引用,支撑数据影响力追踪与引用网络构建;人道主义组织可利用其从行动报告中识别数据提及,辅助资源分配与需求评估。此外,该数据集在数据合规审查、开放数据平台的内容标注及跨语言数据溯源等工程任务中展现出广泛适用性,为自动化数据治理提供了可操作的技术路径。
数据集最近研究
最新研究方向
在数据密集型信息抽取领域,诸如人道主义救援与难民登记等场景中数据提及的识别正面临标注边界模糊与领域漂移的挑战。datause-ner数据集通过引入全量召回式命名实体识别范式,将所有候选片段统一标注为DATA_MENTION,并将保留与丢弃的决策权转移至探针头,从而实现了标注监督与操作点阈值的解耦。该数据集的最新研究方向聚焦于跨来源阈值校准与探针头可 traceability 机制,探索在保持高召回的同时如何依据不同语料来源动态调整决策边界。相关研究与人道主义数据互操作、大模型弱监督实体抽取等热点紧密关联,其意义在于为数据提及识别提供了可审计、可复现的基准,推动了信息抽取系统在真实高风险场景中的可信部署。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务