遇见数据集

datause-displacement-reviewed

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是rafmacalaba/datause-displacement的Luna-reviewed子集,仅包含经过v2.3 Luna判定(band review + drop-side rescue,source == luna_review)的跨度。每个跨度带有二元标签(DATA_MENTION / NON_MENTION),以及usage_type、drop_reason、specificity等属性,并通过key(split:row:start:end)可追溯至原始判定记录。数据集包含多个配置版本:gliner_reviewed(tokenized_text、corpus、origin、language、ner、spans)、bio_reviewed(tokens、ner_tags、spans)、readable_reviewed(text、spans)、probe_reviewed、gliner_reviewed_nm和synth_reviewed。合成配置synth_reviewed由本地gemma-4-e4b-it-qat模型生成,聚焦于holdout弱跨度,共4095行、7827个跨度,其中DATA_MENTION 4447个,NON_MENTION 3380个。整体统计:训练集16468行(19681跨度,39.5%正例),验证集1741行(2006跨度,54.9%正例),holdout集2085行(2312跨度,55.3%正例),总计20294行、23999个跨度,正例占比42.3%。NON_MENTION的drop_reason分布包括production(5037)、system_registry(2311)、bookkeeping(2151)、promissory(1774)、table_artifact(1213)、ref_list(522)、availability(465)、plays_role(105)、bare_stat(87)。判定来源为gpt-5.6-luna模型,基于v2.3 TIER_SYSTEM提示,在ambiguity band和drop-side rescue上运行。数据集适用于命名实体识别、跨度分类、文本分类等任务。

This dataset is a Luna-reviewed subset of rafacalaba/datause-displacement, containing only spans that have undergone v2.3 Luna judgment (band review + drop-side rescue, source == luna_review). Each span has a binary label (DATA_MENTION / NON_MENTION), along with attributes such as usage_type, drop_reason, specificity, and can be traced back to the original judgment record via a key (split:row:start:end). The dataset includes multiple configuration versions: gliner_reviewed (tokenized_text, corpus, origin, language, ner, spans), bio_reviewed (tokens, ner_tags, spans), readable_reviewed (text, spans), probe_reviewed, gliner_reviewed_nm, and synth_reviewed. The synthetic configuration synth_reviewed was generated by a local gemma-4-e4b-it-qat model, focusing on holdout weak spans, with a total of 4095 rows and 7827 spans, including 4447 DATA_MENTION and 3380 NON_MENTION. Overall statistics: training set 16468 rows (19681 spans, 39.5% positive), validation set 1741 rows (2006 spans, 54.9% positive), holdout set 2085 rows (2312 spans, 55.3% positive), total 20294 rows and 23999 spans, with 42.3% positive examples. The drop_reason distribution for NON_MENTION includes production (5037), system_registry (2311), bookkeeping (2151), promissory (1774), table_artifact (1213), ref_list (522), availability (465), plays_role (105), bare_stat (87). The judgment source is the gpt-5.6-luna model, based on v2.3 TIER_SYSTEM prompt, running on ambiguity band and drop-side rescue. The dataset is suitable for tasks such as named entity recognition, span classification, and text classification.

创建时间:
2026-09-03
原始信息汇总

数据集概述

datause-displacement-reviewedrafmacalaba/datause-displacement 的一个子集,仅包含经过 v2.3 Luna 审核(带宽审查 + 丢弃侧救援,source == luna_review)的文本片段。每个片段带有二元标签及 usage_typedrop_reasonspecificity 属性,并可通过 key(格式为 split:row:start:end)溯源至 extraction_analysis/band_review/ 中的审核记录。

语言:英语
许可证:MIT
任务类型:Token 分类、文本分类


配置(Configs)

配置名 主要字段
gliner_reviewed tokenized_textcorpusoriginlanguagener(仅保留)、spans(完整,含 key/reason/kind
bio_reviewed tokensner_tags(对 DATA_MENTIONNON_MENTION 使用 B-/I- 标签)、spanscorpusoriginlanguage
readable_reviewed textspans(字符偏移,含 key/reason/kind)、corpusoriginorigin_modellanguage

每个配置均包含 trainvalholdout 三个数据划分。

此外,synth_reviewed 配置为合成增强数据,仅包含 train 划分。


合成增强数据(synth_reviewed

  • 来源:由本地 gemma-4-e4b-it-qat 模型生成(training/synth_local.py,v2.3 INVENT_SYSTEM/NEG_SYSTEM 提示词)。
  • 种子:聚焦于 displacement probe 的 holdout 弱片段,包括 54 个召回漏检(FN)段落和 117 个精度泄漏(FP)段落。
  • 属性:每行带有 origin=gemmacorpus=syntheticspans[] 混合了真实的 DATA_MENTION(生成提及 + 抽取器补充)和 NON_MENTION 硬负例(含 drop_reason)。
  • 规模
配置 行数 片段数 DATA_MENTION NON_MENTION
synth_reviewed 4095 7827 4447 3380

统计信息

总体数据(不含合成集)

划分 行数 片段数 DATA_MENTION NON_MENTION 正例占比
train 16468 19681 7778 11903 39.5%
val 1741 2006 1101 905 54.9%
holdout 2085 2312 1278 1034 55.3%
总计 20294 23999 10157 13842 42.3%

丢弃原因分布(NON_MENTION)

原因 数量
production 5037
system_registry 2311
bookkeeping 2151
promissory 1774
table_artifact 1213
ref_list 522
availability 465
plays_role 105
bare_stat 87

数据溯源

审核标签由 gpt-5.6-luna 模型生成(使用 TIER_SYSTEM v2.3 系统提示词,运行于 training/audit_luna_batch.py),针对歧义带(refine_band.py,控制门通过率 0.83)和丢弃侧救援(rescue_drops.py,症状概率 < 0.5)执行。

  • 保留的审核片段被标记为 DATA_MENTIONNON_MENTION
  • usage_type(证据型/声明型)适用于提及(mentions)。
  • drop_reason(9 个类别)适用于非提及(non-mentions)。
  • specificity(命名/描述性/模糊)适用于所有片段。
搜集汇总
数据集介绍
datause-displacement-reviewed 数据集图片
构建方式
该数据集源自rafmacalaba/datause-displacement,精选了其中获得Luna v2.3审定意见的跨度,构建过程融合了带注释的评审与合成增强阶段。评审部分通过标签盲法系统对歧义区间及丢弃侧进行甄别,生成多配置数据子集;合成阶段则利用本地gemma模型,针对模型薄弱环节生成对抗性样本,以增强数据集的挑战性与覆盖度。
使用方法
数据使用方面,该数据集支持命名实体识别和文本分类模型的训练、验证与独立测试,提供了明确的划分。研究人员可直接下载对应配置进行模型微调或基准测试,并依据标签进行原因分析或误报研究。鉴于数据集接口友好,亦适用于多任务学习或跨领域泛化能力评估,尤其适合数据使用政策验证场景。
背景与挑战
背景概述
datause-displacement-reviewed数据集由研究人员于近期构建,旨在深化对研究论文中数据使用场景的细粒度理解。该数据集基于原始版本进行精细化标注,通过引入Luna v2.3版本的评审机制,对数据提及的模糊地带进行系统化重审,并辅以合成数据增强,形成多配置、多视角的数据资源。其核心研究问题聚焦于如何准确区分数据使用相关的实际提及与非提及,以支持信息抽取和文本分类任务。该数据集的发布为科学文献中数据溯源与分析提供了高价值的基准,有望推动相关领域在数据使用语义理解上的进展,对科研诚信评估和学术知识挖掘具有潜在影响力。
当前挑战
该数据集面临的挑战主要源于领域问题的复杂性与构建过程的高要求。在领域层面,从学术文本中精准识别数据使用提及,需应对模糊表述、上下文依赖及跨类型(如声明性或证据性)差异,现有模型常在高歧义区域产生混淆,导致偏差。在构建过程中,挑战包括设计鲁棒的评审协议以过滤噪声,确保标注一致性与可追溯性;克服人工评审的高成本与主观性;利用合成数据补充难以捕获的边界案例时,需保持真实性与平衡,防止引入额外噪声。此外,多配置格式(如token级与文本级)的协调,以及处理类别不平衡问题,均为提升数据集可用性与模型泛化能力的关键难点。
常用场景
经典使用场景
该数据集聚焦于学术文本中数据使用提及的识别与分类,涵盖命名实体识别(NER)及文本分类两大核心任务。其经典用途在于训练与评估模型以精准抽取文献中涉及数据使用的提及(DATA_MENTION)与非提及(NON_MENTION),并进一步划分细粒度属性,如使用类型(证据性/声明性)、丢弃原因(9类)及特定性(命名/描述/模糊)。数据提供多种配置(如gliner_reviewed、bio_reviewed等),支持从原始文本、Token级标签到字符偏移量的多粒度输入,适配序列标注及文本分类模型的多样化需求,是数据使用语义理解研究的重要基准。
解决学术问题
该数据集解决了学术文献中数据使用描述自动解析的难题,为数据引用与数据使用语义的深层次挖掘提供了高质量标注资源。通过专家评审机制(Luna v2.3)对模糊提及进行裁决,有效消除了标注歧义,并针对误报与漏报注入合成难例,显著提升了负样本的丰富性。其引入的九类丢弃原因细粒度分类体系,创新性地揭示了数据使用陈述中的隐含语义结构,助力学术研究从简单实体识别迈向更复杂的内容理解,推动了数据使用规范性与可复现性研究的发展,为科学计量学与开放科学领域提供了关键数据支持。
实际应用
在实际应用中,该数据集可直接服务于学术搜索引擎与文献管理工具,实现数据使用声明的自动抽取与索引,提升科研人员检索数据资源的效率。同时,其细粒度标签可赋能科研诚信审查系统,自动识别潜在的冗余发表或数据引用不当行为。在出版领域,可辅助编辑与审稿人快速定位数据可用性声明的完整性,推动数据共享政策的有效执行。此外,该数据集的多配置设计便于集成到现有自然语言处理流水线,为机构知识库建设、科研基金成果追踪及数据引用影响力评估提供技术支撑,具有广阔的产业化前景。
数据集最近研究
最新研究方向
datause-displacement-reviewed数据集聚焦于数据使用场景中实体提及的二元分类与细粒度归因,其最新研究动向在于利用大型语言模型(如GPT-5.6-Luna)进行标注审查与合成数据增强,以提升位移探测的鲁棒性。该数据集通过跨配置(gliner、bio、readable)提供多粒度标注,并引入合成增强子集synth_reviewed,以弱样本(召回失败与精度泄漏)为种子生成难负例,改善模型对模糊边界的判别能力。研究热点集中于解决‘数据提及’与‘非提及’的模糊地带,细化drop_reason九分类(如生产性、系统注册、簿记等),推动数据使用审计的自动化与标准化。其意义在于为数据溯源、合规监控及知识图谱构建提供高质量基线,并促进跨语料库的泛化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务