遇见数据集

data-use-sft

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集名为Data-use multitask SFT v2 (real + synthetic),是一个用于指令跟随和监督微调(SFT)的多任务数据集,专注于数据提及(data-mentions)的来源、用途和影响。数据集包含两个配置:real(真实数据)和synthetic(合成数据)。real数据由Luna标注的真实提及组成,来源包括prwp和fcv;synthetic数据由LFM local和gpt-5.6-luna生成的合成提及构成。每个样本记录包含origin字段(标识来源)和ChatML格式的messages字段,其中包含system、user、assistant角色;user内容以Text:和Mention:的形式列出文本和提及。数据规模为:real配置中训练集61839条、验证集8582条、保留集9540条;synthetic配置中训练集18433条、验证集2303条、保留集2305条。该数据集适用于训练模型理解数据提及的上下文、来源及影响,可用于多任务SFT场景。

This dataset is named Data-use multitask SFT v2 (real + synthetic). It is a multi-task dataset for instruction following and supervised fine-tuning (SFT), focusing on the source, usage, and impact of data mentions. The dataset consists of two configurations: real (real data) and synthetic (synthetic data). The real data comprises real mentions annotated by Luna, with sources including prwp and fcv; the synthetic data comprises synthetic mentions generated by LFM local and gpt-5.6-luna. Each sample record contains an origin field (identifying the source) and a messages field in ChatML format, which includes system, user, and assistant roles; the user content lists text and mentions in the form of Text: and Mention:. The data scale is: for the real configuration, training set 61839, validation set 8582, holdout set 9540; for the synthetic configuration, training set 18433, validation set 2303, holdout set 2305. This dataset is suitable for training models to understand the context, source, and impact of data mentions, and can be used in multi-task SFT scenarios.

创建时间:
2026-08-16
原始信息汇总

数据集概述:Data-use multitask SFT v2 (real + synthetic)

基本信息

  • 许可证:cc-by-4.0(知识共享署名4.0国际许可)
  • 标签:指令跟随(instruction-following)、SFT(监督微调)、数据提及(data-mentions)、来源追踪(provenance)、使用(usage)、影响(impact)

数据集构成

该数据集包含两个配置(config),分别为真实数据(real)合成数据(synthetic),每个配置均划分为训练集(train)、验证集(val)和留出集(holdout)。

配置 训练集 验证集 留出集 总计
real 61,839 8,582 9,540 79,961
synthetic 18,433 2,303 2,305 23,041

数据来源与标注

  • 真实数据(real):由Luna标注的真实提及(mentions),数据来源(origin)为 prwp(可能指某真实语料库)或 fcv(可能指另一真实来源)。
  • 合成数据(synthetic):由合成系统生成,具体包括LFM本地生成及gpt-5.6-luna(是一个AI模型生成的数据),数据来源标注为 synthetic

数据格式

  • 每条记录包含 origin 字段(标记数据来源:prwpsyntheticfcv)。
  • 采用ChatML格式messages 字段,包含系统(system)、用户(user)和助手(assistant)三种角色。
  • 用户内容中先列出 Text:(文本内容),后列出 Mention:(提及内容)。

文件分布

  • 每个配置下有3个文件,均为JSONL格式:
    • train.jsonl(训练集)
    • val.jsonl(验证集)
    • holdout.jsonl(留出集,用于最终测试)
搜集汇总
数据集介绍
data-use-sft 数据集图片
构建方式
该数据集融合了真实与合成两类数据源,以构建多任务监督微调(SFT)的训练语料。真实数据源自Luna标注的实体提及,其来源标注为prwp或fcv,确保了数据的真实性与多样性。合成数据则通过LFM本地模型与gpt-5.6-luna协同生成,以扩充数据规模并增加场景覆盖。每个样本均以ChatML格式组织,包含系统、用户与助手角色,并在用户内容中明确列出文本与实体提及,确保指令跟随任务的清晰性与结构化。数据集划分为训练集、验证集和保留集,各子集比例合理,为模型评估提供了坚实基础。
特点
该数据集独具匠心地将真实与合成数据整合,既保留了真实世界的语言多样性与上下文复杂性,又通过合成数据增强了特定场景的覆盖与可扩展性。每个记录均携带来源标签(prwp、fcv或synthetic),便于追溯数据出处,研究数据质量与模型性能的关联。指令跟随格式的标准化设计,使得数据集可直接用于微调语言模型,以提升其遵循指令与识别实体提及的能力。此外,数据量的充足性与划分的合理性,为训练可靠模型提供了有力支撑。
使用方法
使用该数据集时,研究者可直接加载对应配置(real或synthetic)及其划分(train、val、holdout),用于模型的有监督微调与评估。数据处理需遵循ChatML格式,解析messages字段,并利用origin字段进行数据来源的过滤或加权分析。推荐先使用训练集进行模型微调,以验证集进行超参数调优,最终通过保留集评测模型泛化性能。该数据集特别适用于指令跟随、实体识别及数据溯源相关任务的研究,可结合多任务学习框架进一步探索模型的多维度能力。
背景与挑战
背景概述
该数据集名为data-use-sft,由Luna团队创建,旨在推动指令跟随与数据使用场景的监督微调研究。其核心研究问题是如何从文本中识别数据提及(data mentions)及其来源(provenance),并评估数据使用的影响。数据集融合真实标注(prwp和fcv来源)与合成数据(LFM local和gpt-5.6-luna),覆盖训练、验证和测试集,规模宏大,为多任务SFT提供了丰富资源。该数据集在数据溯源与使用影响领域具有开创性,为后续研究奠定了坚实基础,对推动数据治理和智能体行为建模具有重要意义。
当前挑战
领域挑战在于精准识别文本中的数据提及并区分其来源,这涉及对复杂语境和隐含语义的解析,现有模型常面临歧义和泛化能力不足的问题。构建过程中,真实标注需依赖专家人工标注,耗时费力且存在主观偏差;合成数据虽能扩大规模,但可能引入噪声和分布偏移,影响模型鲁棒性。此外,多来源数据整合需统一格式和标签体系,而holdout测试集的保密性增加了评估的难度,如何确保模型在未见数据上的表现成为持续挑战。
常用场景
经典使用场景
该数据集作为面向数据引用与使用场景的指令微调语料库,其核心应用在于训练语言模型精准识别并解析文本中的数据集提及(data mentions),进而依据用户指令执行多任务操作。典型场景涵盖从学术论文、技术报告或网络文本中抽取数据集名称、版本及来源,并生成结构化元数据或回答相关查询。借助ChatML格式的对话结构,模型可被训练以遵循复杂指令,完成从文本中定位提及到提供数据集使用建议的端到端流程,为自然语言处理在科研信息抽取领域提供了标准化训练基准。
实际应用
在实际应用中,此数据集可用于构建科研智能助手或学术搜索引擎,自动从论文全文中定位数据集引用并关联至公开仓库,提升科研效率。例如,在生物医学或社会科学领域,系统可基于该数据集训练的模型,自动解析文献中的数据集使用声明,辅助研究人员快速获取可用数据资源。同时,其适用于数据治理平台,帮助机构监控自身数据的引用与复用情况,从而优化数据发布策略。此外,该数据集亦支持开发用于学术写作辅助的工具,自动校验稿件中数据集引用的规范性,促进科研诚信。
衍生相关工作
围绕该数据集,衍生出一系列相关研究工作。基于其真实与合成数据混合的特性,研究者可探索域适应与数据增强技术,以提升模型在特定学科术语上的鲁棒性。其任务格式亦催生了针对指令遵循能力的评估基准,用于度量模型在信息抽取与问答中的综合表现。此外,数据集中包含的来源标记(origin)为研究数据溯源与知识蒸馏提供了素材,可能推动开发更高效的模型压缩方法。最终,这些工作共同促进了对科研数据引用行为的自动理解,为未来构建自更新学术知识库奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务