遇见数据集

sob-ft-json-training

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

SOB-FT-JSON-Training 是一个从 ChristianAzinn/json-training 映射而来的合成、无来源文档的 JSON 提取指令微调数据集。原始数据集中包含 query、schema 和 response 三个字段,本数据集将其转换为 SOB 微调格式(移除所有空列),具体对应关系为:question 取自 query,json_schema 取自 schema,ground_truth 取自 response。由于原始数据为合成生成且无来源文档,context 字段被设为 null 并已删除。数据规模方面,原始 20,644 条经过 JSON 语法验证和字符长度不超过 12,000 的过滤后,最终保留 19,981 条有效样本。每条样本还包含 question_type(固定为 synthetic_ungrounded)和 source_dataset(标识来源)两个标签。该数据集主要用于增强模型根据给定 JSON Schema 生成正确 JSON 输出的能力,而非提升基于文档的精确提取性能。训练时建议对该数据集采用较低的采样权重。

SOB-FT-JSON-Training is a synthetic, source-free document JSON extraction instruction fine-tuning dataset mapped from ChristianAzinn/json-training. The original dataset contains three fields: query, schema, and response. This dataset converts them into the SOB fine-tuning format (removing all empty columns), with the specific mapping: question is taken from query, json_schema from schema, and ground_truth from response. Since the original data is synthetically generated without source documents, the context field is set to null and removed. In terms of data scale, after filtering the original 20,644 entries through JSON syntax validation and character length not exceeding 12,000, 19,981 valid samples are retained. Each sample also includes two labels: question_type (fixed as synthetic_ungrounded) and source_dataset (indicating source). This dataset is mainly used to enhance the models ability to generate correct JSON output based on a given JSON Schema, rather than improving document-based precise extraction performance. It is recommended to use a lower sampling weight for this dataset during training.

创建时间:
2026-08-07
原始信息汇总

SOB-FT-JSON-Training 数据集概述

基本信息

  • 许可证: MIT
  • 语言: 英语 (en)
  • 标签: json-extraction、synthetic、sob、fine-tuning

数据来源

该数据集是基于 ChristianAzinn/json-training 映射生成的独立语料库,属于合成数据,主要用于 JSON 提取任务的微调。

与源数据的差异

维度 源数据集 本数据集
格式 queryschemaresponse SOB FT 格式(已移除空列)
基础依据 合成 / 无依据 context=null(无源文档)
问题字段 query question=query
模式字段 schema json_schema(其中 481 行存在无效源架构)
目标字段 response ground_truth
行数 20,644 条源数据 → 19,981 条映射后数据 经 JSON 验证及字符数 ≤12k 过滤
标签 question_type=synthetic_ungrounded
来源标注 source_dataset=ChristianAzinn/json-training

数据特点

  • 所有全空列(包括 context)已被删除
  • 训练建议:应保持较低的采样权重——该数据适用于架构增强,而非基于文档的抽取准确性提升

复现与合并命令

  • 复现:python3 merge_json_training.py --dry-runpython3 merge_json_training.py
  • 合并到提取流程:python3 merge_ft_corpus.py --corpus mariem123kfg/sob-ft-json-training --source-prefix ChristianAzinn/json-training
搜集汇总
数据集介绍
sob-ft-json-training 数据集图片
构建方式
该数据集源自ChristianAzinn/json-training,经过系统性映射与清洗,转化为SOB微调格式。原始数据包含20,644条记录,经JSON有效性验证及字符长度不超过12k的过滤后,保留19,981条有效样本。所有空列(包括context)被剔除,并将schema字段中的无效模式(481行)保留但标注。每条数据被赋予question_type为synthetic_ungrounded的标签,同时记录来源数据集,确保可追溯性。数据构建过程中,通过脚本merge_json_training.py实现可复现的流水线处理。
特点
该数据集的核心特征在于其纯合成与无文档锚定的性质。所有样本的context均为null,意味着问题与回答不依附于具体源文档,这使得数据在训练中主要贡献于模式(schema)增强,而非提升基于上下文的信息抽取精度。数据格式统一为SOB微调范式,包含question、json_schema、ground_truth字段,并去除冗余空列,结构紧凑。此外,数据集通过标签和来源字段明确了样本的合成属性,为训练时的采样权重调整提供了依据,建议保持低采样权重,以避免对模型产生误导性影响。
使用方法
使用时,此数据集可作为微调过程中的辅助数据源,尤其适用于增强模型对JSON结构的理解能力。用户可通过运行merge_ft_corpus.py脚本将其整合进更大的抽取训练语料,并利用source-prefix参数指定原始数据集路径,实现无缝融合。训练时需谨慎控制采样权重,因其非接地特性,应避免高权重导致模型偏向于生成脱离上下文的响应。数据以JSON格式存储,便于加载与预处理,适合使用标准HuggingFace数据集接口进行读取和批次处理。
背景与挑战
背景概述
该数据集源于ChristianAzinn/json-training,由研究者于近期构建,旨在为基于模式的JSON抽取任务提供微调语料。其核心研究问题在于如何通过合成数据增强模型对JSON Schema的理解与生成能力,从而提升结构化信息抽取的鲁棒性。通过对原始语料进行格式映射、无效条目过滤及字符长度约束,最终形成了包含19,981条样本的独立数据集,并明确标注了‘合成非接地’属性,以区分于基于文档的抽取场景。该数据集在社区中主要用于模型微调中的结构增强,对提升LLM在未见Schema上的泛化性能具有潜在价值。
当前挑战
数据集面临的核心挑战包括:其一,领域问题层面,JSON抽取任务本身对模型的结构理解与推理能力要求极高,尤其在处理复杂嵌套Schema和跨领域格式时,模型易产生格式错乱或内容误判,而现有合成数据的分布偏差可能加剧这一现象;其二,构建过程中,原始数据存在481行无效Schema,需经JSON验证与字符过滤(≤12k)后方可使用,这一清洗步骤虽提升了数据质量,但也引入了信息损失,且部分样本的Schema解析失败可能影响训练的有效性;此外,数据集的‘非接地’特性限制了其在需要上下文推理的抽取任务中的直接适用性,使用者需谨慎权衡采样权重,以避免对真实场景精度造成负面影响。
常用场景
经典使用场景
该数据集是面向JSON结构提取任务的大型微调语料,其核心用途在于增强大语言模型对结构化数据模式的认知与遵循能力。研究者可将其用于训练模型从自然语言查询中生成符合给定JSON Schema的响应,尤其适用于合成场景下的零样本或少样本学习。由于数据源于合成未接地(ungrounded)的查询-模式-响应三元组,其典型应用包括模型对JSON语法规则的内化、复杂嵌套结构的生成以及跨Schema泛化能力的提升。在微调阶段,该数据集常被用作辅助增强语料,以低采样权重融入训练混合,避免对基于真实文档的抽取精度造成干扰。
衍生相关工作
该数据集派生了多个方向的后续研究,包括基于其映射逻辑构建的合并工具(如merge_ft_corpus.py),用于将多源合成语料统一微调格式;以及针对Schema增强的专门训练策略,如调整采样权重以平衡合成与真实数据。这些工作促进了‘合成数据-模型微调-迁移评估’的闭环研究范式,并催生了关于JSON Schema合法性校验与过滤方法的技术报告。其影响还延伸至生成式模型的结构化输出评测体系,为后续研究提供了可复用的数据预处理与转换标准。
数据集最近研究
最新研究方向
该数据集聚焦于面向语义对象绑定(SOB)的JSON提取任务,通过将合成查询与JSON模式映射至统一指令微调格式,支撑模型在无上下文条件下完成结构化信息抽取的泛化能力研究。近期前沿方向包括:利用高多样性的合成语料增强模型对复杂嵌套JSON模式的解析鲁棒性,探索低采样权重策略以平衡模式增强与基础抽取精度,并推动跨数据集迁移学习中数据溯源与质量过滤机制的发展,为构建更可靠、可追溯的指令微调数据集提供了实践范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务