遇见数据集

sob-ft-deepjsoneval

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

SOB-FT-DeepJSONEval 是一个从 GTSAIInfraLabSOTAS/DeepJSONEval 转换而来的微调数据集,专注于嵌套 JSON 提取任务。该数据集包含 2,100 个样本,每个样本由原始文本、标准提取指令、JSON Schema、真实 JSON 输出、类别(作为问题类型)以及真实嵌套深度(作为问题难度)组成,所有样本的 schema 复杂度均标记为“hard”。数据集旨在提供硬嵌套 JSON 的压力测试场景,适用于微调模型以处理复杂嵌套结构的 JSON 提取。语言支持英文和中文,采用 MIT 许可证。

SOB-FT-DeepJSONEval is a fine-tuning dataset converted from GTSAIInfraLabSOTAS/DeepJSONEval, focusing on nested JSON extraction tasks. The dataset contains 2,100 samples, each consisting of original text, standard extraction instructions, JSON Schema, ground truth JSON output, category (as question type), and ground truth nesting depth (as question difficulty). All samples have a schema complexity marked as "hard". The dataset aims to provide stress-test scenarios for hard nested JSON extraction, suitable for fine-tuning models to handle complex nested JSON structures. It supports both English and Chinese and is licensed under MIT.

创建时间:
2026-08-07
原始信息汇总

SOB-FT-DeepJSONEval 数据集概述

基本信息

  • 许可证: MIT
  • 语言: 英语、中文
  • 标签: json-extraction, nested-schema, sob, fine-tuning
  • 来源数据集: GTSAIInfraLabSOTAS/DeepJSONEval
  • 行数: 2,100

数据集描述

该数据集是从 GTSAIInfraLabSOTAS/DeepJSONEval 映射生成的独立语料库,采用 SOB FT(Standalone Object Builder Fine-tuning)格式,专为微调任务设计。

与源数据集的主要变化

方面 源数据集 本数据集
格式 扁平列:text, schema, json, category, true_depth SOB FT 格式(删除空列)
提示词 仅隐含在 text 使用 context=text 和标准提取 question
元数据 category, true_depth question_type=category, question_difficulty=true_depth
行数 2,100 2,100
角色 硬嵌套 JSON 压力测试 同样用途——作为硬切片使用,而非批量数据

列映射关系

SOB 列 源数据集列
context text
question 标准 SOB 提取指令
json_schema schema(Draft 7 有效)
ground_truth json
question_type category
question_difficulty true_depth(字符串)
schema_complexity SOB 分类器——全部为困难

所有全为空的保留列已被删除。

搜集汇总
数据集介绍
sob-ft-deepjsoneval 数据集图片
构建方式
本数据集源自GTSAIInfraLabSOTAS/DeepJSONEval,通过精细的映射与重构,将原始平铺结构转换为符合SOB-FT规范的格式。在构建过程中,剔除了空值保留列,将文本字段映射为上下文,并注入标准化的提取指令作为问题,同时将元数据如类别与真实深度分别映射至问题类型与难度,确保每一数据条目均携带完整的模式信息,形成2,100条高质量的训练样本。
使用方法
使用时,可通过提供的合并脚本将该语料集成至SOB-FT提取混料中,作为高难度补充样本。推荐在微调阶段将其作为独立评估集,以检验模型对深层嵌套JSON的解析能力。同时,可依据question_type与question_difficulty字段进行分层采样,以便进行细粒度的性能分析。
背景与挑战
背景概述
sob-ft-deepjsoneval数据集由GTSAIInfraLabSOTAS团队于近期构建,源自DeepJSONEval基准,旨在评估和提升大型语言模型在复杂嵌套JSON结构下的信息抽取能力。该数据集以SOB(Schema-Oriented Benchmark)格式重新组织,将原始文本、模式、目标JSON及元数据(如类别、真实深度)标准化为统一训练语料,解决了现有抽取任务中模式复杂度单一、深度标注缺失的问题。其核心研究问题聚焦于模型对高度嵌套、多层级JSON Schema的遵循能力与抽取准确性,为信息抽取领域提供了更具挑战性的细粒度评估基准,尤其适用于微调场景下的鲁棒性测试。该数据集的出现填补了深度嵌套JSON结构在开源训练语料中的空白,对推动结构化数据抽取技术的发展具有重要意义。
当前挑战
该数据集所面临的挑战主要源于两方面。在领域问题层面,深层嵌套JSON抽取要求模型同时理解复杂模式约束、处理跨层级依赖并保持输出结构完整,而现有模型常在高深度场景下出现结构崩溃或字段遗漏,这成为限制其实际应用的关键瓶颈。在构建过程中,需将原始的2,100条扁平化数据映射为SOB标准格式,涉及列重命名、空值剔除及元数据迁移,同时确保JSON Schema的Draft 7兼容性,这一过程对数据一致性维护提出极高要求。此外,如何平衡语料的难度分布以避免模型过拟合于特定深度模式,以及如何与其他语料库无缝合并以扩展训练覆盖面,亦是构建中的主要挑战。
常用场景
经典使用场景
该数据集作为深度嵌套JSON提取任务的专项评测基准,聚焦于高复杂度、多层嵌套结构的JSON数据抽取场景。其设计初衷在于模拟真实世界中非结构化文本向结构化数据转化的极致挑战,例如从法律文书、科研论文或财务报表中抽取深层次嵌套字段。数据集中每个样本均配备了标准化的Schema定义和对应的真值JSON,辅助模型在严格约束下进行精确抽取。此场景下,模型需具备对复杂层级关系的解析能力,以及对语义歧义的消解能力,从而衡量其在结构化信息抽取任务上的鲁棒性与精确度。
解决学术问题
该数据集直指当前大语言模型在处理深度嵌套JSON结构时存在的性能瓶颈,填补了现有评测集在极端深度与复杂度维度上的空白。学术上,它为解决诸如层级结构理解、长距离依赖编码、以及模式约束下的生成一致性等核心研究问题提供了标准化的测试平台。通过引入不同深度的真值标注,研究者可定量分析模型性能随嵌套层数递增的衰减规律,进而推动算法在结构感知、注意力机制优化及解码策略创新等方面的理论发展。该数据集的发布对于构建更具泛化能力的结构理解模型具有里程碑式的意义。
实际应用
在工业界,该数据集所涵盖的深层JSON抽取能力是构建高精度自动化信息处理流水线的基石。实际应用中,它可用于金融领域内的财报细项解析、医疗健康领域的病历结构化、以及电商平台的商品属性多层次提取。通过在此类高难度数据上微调模型,企业能够显著提升其内部系统的数据清洗效率与准确性,降低人工审核成本。具体而言,将原始非结构化文档转化为符合复杂商业逻辑的嵌套数据格式,是实现知识库构建、智能问答系统及自动化报告生成等下游应用的先决条件,该数据集的实用价值因而弥足珍贵。
数据集最近研究
最新研究方向
该数据集聚焦于大型语言模型在嵌套JSON抽取任务上的能力边界探究,其核心研究前沿在于利用高难度结构化信息提取样本(如深层嵌套、复杂schema)对模型进行微调,以提升其对复杂数据结构的语义理解和精确抽取性能。当前热点事件包括多模态与逻辑推理模型在结构化数据解析中的竞争,以及基于细粒度难度分级(如true_depth)的评测基准构建。该数据集通过标准化为SOB格式(含context、question、json_schema等列),为跨模型对比和训练-评测一致性提供了便利,其影响在于推动模型在真实世界复杂数据抽取场景中的鲁棒性与泛化能力,并为构建更高阶的指令微调语料库奠定基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务