遇见数据集

data-use-sft-tiered

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

Data-use SFT 是一个基于分层提及提取的多任务指令微调数据集,专门针对数据使用相关的来源(provenance)和使用影响(usage/impact)信息。数据集包含两个子任务:来源任务(provenance)和使用影响任务(usage_impact)。来源任务包含 22,201 个样本,每个样本的助手回复包含生产者、年份、地理区域、缩写、数据类型(可选)、特异性以及 BibTeX 条目(当存在生产者和年份时)。使用影响任务包含 52,916 个样本,每个样本的助手回复包含使用行为、影响标签和使用摘要。数据集的原始语料来自 prwp 和 fcv 两个来源,并包含通过 Gemma-4-E4B 模型生成的合成样本(标记为 is_synthetic=true)。数据集划分为训练集、验证集和保留集,且文档级不重叠。所有样本都经过分层提取器判断为 T1 或 T2 提及,丢弃了 T3 和非提及样本。该数据集适用于文本生成任务,特别是数据使用场景下的信息提取与结构化生成。

Data-use SFT is a multi-task instruction fine-tuning dataset based on hierarchical mention extraction, specifically targeting provenance and usage/impact information related to data use. The dataset contains two sub-tasks: provenance task and usage_impact task. The provenance task includes 22,201 samples, each assistant response containing producer, year, geographic region, abbreviation, data type (optional), specificity, and BibTeX entry (when producer and year are present). The usage_impact task includes 52,916 samples, each assistant response containing usage behavior, impact label, and usage summary. The original corpus of the dataset comes from two sources: prwp and fcv, and includes synthetic samples generated by the Gemma-4-E4B model (marked as is_synthetic=true). The dataset is divided into training, validation, and held-out sets, with no overlap at the document level. All samples are judged by a hierarchical extractor as T1 or T2 mentions, discarding T3 and non-mention samples. This dataset is suitable for text generation tasks, especially information extraction and structured generation in data use scenarios.

创建时间:
2026-08-30
原始信息汇总

数据集概述

Data-use SFT — tiered workflow 是一个面向文本生成任务的多任务指令微调(SFT)数据集,基于分层抽取器输出的数据提及(data mentions)构建。该数据集遵循 CC-BY-4.0 许可证,包含两个任务子集,并附带完整的来源追踪(provenance)与使用/影响(usage/impact)标注信息。


任务子集

1. provenance(来源追踪)任务

  • 规模:共 22,201 行
  • 输出字段producer(生产者)、year(年份)、geography(地理范围)、acronym(缩写)、data_type(数据类型,可选)、specificity(特异性)、bibtex(BibTeX 引用条目)
  • 特点
    • 属性值保持原文(verbatim),经过过滤处理
    • data_type 从使用/影响任务的教师标签中迁移而来(覆盖 8,226 行,占 37%)
    • bibtex 为单行 BibTeX @dataset 条目(仅在同时包含生产者和年份时出现)

2. usage_impact(使用与影响)任务

  • 规模:共 52,916 行
  • 输出字段usage_action(使用行为)、impact_label(影响标签)、usage_summary(使用摘要)
  • 特点
    • data_type 归入来源任务(作为源数据的内在属性)
    • 原始教师标签原样保留
    • impact_label=none 的行被保留(此类行代表真实提及但仅有引用影响,被视为有效信号而非噪声)

数据划分(文档级不重叠划分)

划分 provenance provenance(含data_type) usage_impact
train 15,691 5,795 45,126
val 3,355 1,218 5,740
holdout 3,350 1,213 5,858
  • 所有划分均保持文档级不重叠;每个行的锚点(anchor)都能解析到分层决策结果
  • 未解析的锚点已在纯度清理中移除(详见 manifest.jsonlmanifest_usage.jsonl 审计记录)

合成数据说明

  • 合成行is_synthetic: true)仅存在于训练集中,由 Gemma-4-E4B 本地生成(基于分层锚点、虚构提及)
  • 验证集和保留集均为真实数据
  • origin_model 字段记录生成合成行的模型(真实行为空)
  • 合成行的 origin 标记为 "synth";使用/影响标签复制自已验证的种子角色(非模型生成);来源属性经过原样门控;bibtex 确定性组装
  • 过滤真实数据的代码ds.filter(lambda r: not r["is_synthetic"])

其他关键信息

  • 数据来源:原始语料来自 prwpfcv 两个来源(origin 字段标识)
  • 数据配置:提供两个配置(provenanceusage_impact),每个配置包含 train/val/holdout 三个划分文件(JSONL 格式)
  • 完整流水线、门控和质量统计:参见 synthetic-generation.md(位于 ai4data-playground 仓库)
  • 相关上游数据集rafmacalaba/data-use-mentions-tiered(分层提及抽取器的输出)
搜集汇总
数据集介绍
data-use-sft-tiered 数据集图片
构建方式
该数据集源自多任务监督微调流程,其核心锚定于分层抽取器所识别的提及(T1证据性与T2声明),并严格剔除被判定为非提及或噪声的样本。构建过程通过manifest文件记录审计轨迹,确保每一条数据的锚点均能解析至明确的分层决策。覆盖范围涵盖provenance与usage_impact两大任务子集,其中provenance任务包含22,201条记录,usage_impact任务包含52,916条记录,且各子集均按文档不重叠原则划分为训练、验证与保留集。
特点
数据集具备独特的分层结构,其特点在于精细的属性标注与严格的真实性控制。provenance任务提供生产者、年份、地理等元数据,并整合了数据类型的迁移标注与BibTeX条目;usage_impact任务则携带使用动作、影响标签及摘要,其中无影响(none)的样本被保留作为有效信号。此外,合成样本仅存在于训练集,由Gemma模型生成并附带生成模型标识,而验证与保留集均为真实数据,确保了评估的可靠性。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载两个配置(provenance与usage_impact),并依据任务字段进行区分。为过滤合成数据,可应用is_synthetic字段进行筛选,仅保留真实样本用于微调。该数据集适用于文本生成任务的指令微调,尤其关注数据溯源与使用影响的分析,研究者可基于其分层标注开展多任务学习或评估模型在证据型任务上的表现。
背景与挑战
背景概述
data-use-sft-tiered数据集构建于大规模指令微调(SFT)需求日益增长的背景下,由研究机构或个人(如rafmacalaba)开发,旨在解决数据使用与影响标注任务中的层级化信息抽取问题。该数据集围绕'出处'与'使用影响'两大子任务,整合了来自PRWP和FCV来源的真实文本,并辅以合成数据增强,形成了包含近七万条指令样本的多任务训练资源。其核心研究问题在于如何通过结构化模板(如生产者、年份、地理、数据类型等属性)以及使用行为与影响标签,实现对研究数据引用和使用的精细刻画。该数据集在推动科学数据溯源、研究影响力评估及自然语言处理领域的数据语义理解方面具有潜在影响力,为后续研究提供了高质量的基准与训练语料。
当前挑战
该数据集面临的挑战多维且复杂。在领域问题层面,其解决的核心挑战是数据提及(data mentions)的识别与属性化,这要求模型能够准确区分证据性提及(T1)、声明性提及(T2)与非提及(T3),并抽取结构化属性(如生产年份、地理范围),同时处理影响标签(影响或无影响)的区分,尤其是在仅引用而无实质影响的情况。在构建过程中,挑战包括:跨来源(PRWP、FCV)文本的异质性处理,需要统一标注规范;数据清洗中未解析锚点的剔除以确保纯度;合成数据生成需保持真实性并避免标签噪声;以及确保训练、验证和保留集文档不重叠的严格划分,以评估模型的泛化能力。这些挑战共同决定了数据集的复杂度和实用性。
常用场景
经典使用场景
该数据集作为多任务指令微调(SFT)的基准资源,专注于数据提及的溯源与使用影响两大核心任务。其设计锚定于分层提取器所识别的证据性和声明性提及,旨在教导模型从科学文献中精确抽取数据集的产生者、年份、地理范围、类型及特定性等溯源属性,并解析数据的使用行为与影响力标签。典型应用涵盖数据引用规范、学术文献知识图谱构建及数据生命周期研究,为领域模型提供高度结构化的训练语料,促进对数据引用上下文语义的深度理解。
实际应用
在实际应用中,该数据集可赋能科研管理平台、文献数据库及数据仓储系统,实现数据引用的自动提取与分类。基于其训练的模型能够辅助研究人员快速定位数据集的来源、作者及使用情况,优化数据发现与推荐流程。同时,其分层结构化输出支持科研基金机构追踪数据产出与再利用轨迹,助力开放科学政策的制定与评估。合成数据与真实数据的混合策略亦便于在隐私敏感场景下扩展模型能力,提升部署灵活性。
衍生相关工作
该数据集衍生出的经典工作包括构建数据提及的精细分层分类体系、开发跨文档的数据溯源图谱构建方法,以及基于指令微调的元数据抽取框架。其子任务分离设计启发了多任务学习中任务间信息迁移的研究,尤以溯源属性与使用影响间的互补性探索为代表。文档不重叠划分与保留集机制成为评估数据引用抽取泛化能力的新标准,推动了可复现数据引用解析器的发展。此外,合成数据生成管线及质量门控策略为低资源场景下的数据集扩充提供了范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务