遇见数据集

sob-ft-text-json

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集是一个基于suneeldk/text-json源数据集映射得到的独立微调语料库,专为JSON提取任务设计,采用SOB(Schema-Oriented Benchmark)格式。原始数据包含2000个样本,每个样本经过转换后,将原本打包在单个文本字段中的输入、模式、输出拆分为四个独立字段:context(输入文本)、question(固定的提取指令)、json_schema(转换为JSON Schema Draft 7的模式)、ground_truth(验证后的JSON输出)。此外,还根据SOB论文规则计算了schema_complexity(简单/中等/困难),并保留了source_dataset字段以记录来源。所有空列(如candidate_response、validated_output等)已被移除。数据集适用于微调语言模型以执行基于模式的JSON提取任务。

SOB-FT-Text-JSON is an independent fine-tuning corpus mapped from the suneeldk/text-json source dataset. This dataset is specifically designed for JSON extraction tasks, using the SOB (Schema-Oriented Benchmark) format. The original data contains 2000 samples. After transformation, each sample splits the input, schema, and output originally packed in a single text field into four independent fields: context (input text), question (fixed extraction instruction), json_schema (schema converted to JSON Schema Draft 7), and ground_truth (validated JSON output). In addition, schema_complexity (simple/medium/hard) is calculated according to the SOB paper rules, and the source_dataset field is retained to record the source. All empty columns (such as candidate_response, validated_output, etc.) have been removed. The dataset is suitable for fine-tuning language models to perform schema-based JSON extraction tasks.

创建时间:
2026-08-07
原始信息汇总

SOB-FT-Text-JSON 数据集概述

基本信息

  • 许可证:Apache-2.0
  • 语言:英语(en)
  • 标签:json-extraction、sob、fine-tuning
  • 来源数据集suneeldk/text-json

数据集说明

该数据集是从 suneeldk/text-json 映射而来的独立语料库,专门用于 SOB(Schema-Oriented Benchmark)格式的 JSON 抽取任务微调。

与源数据集的差异

格式转换

维度 源数据集 本数据集
格式 单一打包的 text 字段 16 列 SOB 架构(移除空列)
结构 ### Input: / ### Schema: / ### Output: 混合在单个字符串 拆分为 contextquestionjson_schemaground_truth
Schema 紧凑伪架构(如 `"field": "string null"`)
问题 嵌入在打包文本中 标准 SOB 抽取提示词
行数 2,000 2,000(字符过滤默认 ≤16k)
来源信息 source_dataset=suneeldk/text-jsonrecord_id=text-json-{idx}

列映射关系

SOB 列名 来源
context ### Input: 的正文
question 固定的抽取指令
json_schema ### Schema: 转换后的 Draft 7 格式
ground_truth ### Output: 中验证过的 JSON
schema_complexity 根据 SOB 论文规则评定(easy/medium/hard)
source_dataset suneeldk/text-json

全空保留列(如 candidate_responsevalidated_output 等)已被删除。

数据重建与合并命令

重新生成数据集

bash python3 merge_text_json.py --dry-run python3 merge_text_json.py

合并到抽取语料库

bash python3 merge_ft_corpus.py --corpus mariem123kfg/sob-ft-text-json --source-prefix suneeldk/text-json

搜集汇总
数据集介绍
sob-ft-text-json 数据集图片
构建方式
该数据集源自于Hugging Face上的suneeldk/text-json原始语料,经过精细的映射与重构,转化为符合SOB(Schema-Oriented Benchmark)标准的微调格式。原始数据中紧密排列的文本字段被拆分并映射至16列SOB模式,剔除空值列后,明确划分为上下文、问题、JSON模式及地面真值四个核心组件。紧凑的伪模式已升级为JSON Schema Draft 7,并固化了标准化的提取指令。每一行记录均保留溯源信息,标识其来源数据集及唯一记录编号,确保了数据的可追溯性与完整性。
特点
此数据集具备高度的结构化与标准化特性,其核心优势在于将非结构化的文本-模式对转化为严格的SOB提取任务格式。通过将紧凑模式转换为JSON Schema Draft 7,增强了模式的可读性与机器可解析性。每个样本均附带模式复杂度分级,便于分层评估模型能力。此外,数据规模适中(2000条),字符过滤保证了样本质量,且所有保留字段均具有明确的语义,为微调过程提供了清晰的目标与监督信号。
使用方法
该数据集专为大规模语言模型的指令微调而设计,尤其是针对基于模式的JSON信息提取任务。使用者可直接将上下文、问题与JSON模式输入模型,以生成与地面真值对齐的结构化输出。数据集亦可并入更广泛的SOB微调语料库,通过提供的合并脚本实现与其他来源数据的无缝整合,从而扩充训练集的多样性与覆盖面。验证时,可采用标准JSON相似度或精确匹配指标评估提取效果。
背景与挑战
背景概述
SOB-FT-Text-JSON数据集于近期由研究者基于suneeldk/text-json源数据构建,旨在为结构化对象抽取(Structured Object Benchmark, SOB)任务提供高质量的微调语料。该数据集由HuggingFace平台维护,采用Apache-2.0许可,核心研究问题在于将非结构化的文本输入与JSON Schema映射为可验证的抽取目标,以提升模型对复杂语义结构的理解与生成能力。其影响力体现在为信息抽取领域提供了一个标准化、可复现的基准,促进了模型在细粒度结构化输出上的性能评估与优化。
当前挑战
该数据集所解决的领域挑战主要包括:其一,非结构化文本到结构化数据转换中的语义歧义与格式规范化问题,要求模型精准把握上下文、遵循Schema约束并生成合法JSON;其二,构建过程中面临的数据清洗与格式转换难题,需将原始混合字段拆解为SOB规定的16列模式,并处理空值移除、Schema版本升级(从紧凑伪模式转为Draft 7)以及大文本截断(≤16k字符)以控制噪声;此外,确保ground_truth的准确性与一致性亦为关键,需通过人工核查与自动化验证相结合的方式保障数据质量。
常用场景
经典使用场景
该数据集在结构化信息抽取领域具有典范意义,其经典使用场景聚焦于基于自然语言输入与JSON Schema双驱动下的语义解析任务。研究者常将其作为微调基线,用于训练模型从非结构化文本中精准提取字段并映射至预定义架构,尤其适用于评估模型对复杂嵌套JSON结构的生成能力与模式遵循能力。
实际应用
在实际产业应用中,该数据集可作为构建企业级知识图谱、自动化报表生成及智能客服系统的核心训练资源。其列式架构与明确的提示词设计,便于企业快速适配内部数据管道,实现合同条款解析、产品信息抽取等场景的自动化,从而降低人工标注成本并提升信息处理效率。
衍生相关工作
该数据集衍生出一系列关于指令微调与模式遵循的后续研究,如针对低资源语言的跨域迁移、基于复杂Schema的少样本学习,以及将抽取结果用于下游推理任务的集成框架。这些工作进一步验证了SOB格式的可扩展性,并催生了更鲁棒的端到端抽取模型,推动了结构化生成技术的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务