遇见数据集

Benchson

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

Benchson JSON Benchmark是一个用于JSON生成的内容接地基准数据集。它包含三个核心任务配置:create(根据模式描述生成JSON)、fix(修复违反模式的JSON对象)和modify(根据自由文本指令修改JSON对象)。每个实例基于具体对象并包含真实值,评估侧重于输出的语义正确性,而不仅仅是模式有效性。数据集总规模为每个配置包含1000个训练样本和150个测试样本,训练集和测试集采用不相交的模式池设计,以确保模型在未见过的模式上进行评估。数据字段因任务而异,主要包括模式(schema)、描述(description)、参考/真实JSON(reference_json/valid_json/ground_truth)等,所有JSON值均以字符串形式存储。评估指标包括JSON有效性、模式合规性、语义保真度、严格完全匹配(exact_match)以及针对修改任务的变更保真度。该数据集适用于文本生成,特别是结构化输出和代码生成任务的研究与评估。数据来源于开源JSON模式存储库(MIT许可),真实值由开源大模型生成并经过验证,整体以MIT许可证发布。

创建时间:
2026-06-16
原始信息汇总

数据集概述:Benchson JSON Benchmark

Benchson 是一个基于内容的 JSON 生成基准测试数据集。每个实例都基于具体的对象,并带有真实标注,输出结果根据正确性评分,而非仅仅依据模式有效性。

任务配置

数据集包含三个任务族,每个任务对应一个配置:

  • create:给定一个 JSON Schema 和一段描述,生成匹配的 JSON 对象。
  • fix:给定一个违反 Schema 的 JSON 对象,修复它使其符合 Schema。
  • modify:给定一个 JSON 对象和一段自然语言指令,返回修改后的 JSON 对象。

评估指标

每个实例根据以下指标评分:

  • json_validity(JSON 有效性)
  • schema_compliance(Schema 合规性)
  • semantic_fidelity(语义忠实度):字段值与真实标注的匹配程度。
  • exact_match(精确匹配):一个严格的、完全正确的标志(有效 + 符合 Schema + 所有真实标注字段均已恢复)。
  • change_fidelity(修改忠实度):仅针对 fix 和 modify 任务,评估任务所改变字段的忠实度。

首选指标exact_match 及其按难度划分的细分结果,用于模型排名。json_validitysemantic_fidelity 在接近满分时容易饱和,且提供部分得分,区分能力较弱。

数据划分

训练集和测试集来自不重叠的 Schema 池,确保在训练集上微调的模型不会在已见过的 Schema 上进行评估。仅应使用 test 分割进行评分。

配置 训练集 测试集
create 1000 150
fix 1000 150
modify 1000 150

数据字段

JSON 类型的字段以字符串形式存储,需要使用 json.loads 进行解析。

  • createschema, description, reference_json, name, source, subset
  • fixschema, erroneous_json, valid_json, description, name, source, subset
  • modifyschema, data, instructions, ground_truth, modification, name, source, subset

评估方法

该数据集的官方评估代码位于 Benchson 仓库(https://github.com/aviv1ron1/benchson),提供两种使用方式:

  • Option A — lm-evaluation-harness:通过 EleutherAI 的 lm-evaluation-harness 运行,仓库中提供了预设的任务定义文件。
  • Option B — standalone:使用 lm_eval_tasks/utils.py 中的独立评分器,该评分器可直接对数据行进行评估。

lm-evaluation-harness 中,建议报告 benchson_hard 任务的 exact_match

数据来源与许可证

  • 数据生成:由 openai/gpt-oss-120b 生成真实标注,并由 Qwen/Qwen3.5-397B-A17B-FP8 进行循环验证。
  • Schema 来源:来自 JSONSchemaStore (MIT) 和 JSONSchemaBench (epfl-dlab/JSONSchemaBench, MIT, arXiv:2501.10868)。数据集中每行的 source/subset 字段记录了其来源。
  • 发布日期:2026-06-29。
  • 许可证:MIT。
搜集汇总
数据集介绍
Benchson 数据集图片
构建方式
Benchson基准数据集专为评估大语言模型对JSON结构化输出的生成能力而设计,其构建根植于内容锚定(content-grounded)原则。数据集包含三类任务配置:生成(create)、修复(fix)和修改(modify)。每一条数据实例均绑定一个具体对象并携带真实标注(ground truth),确保模型输出不仅符合JSON Schema的语法规范,更在语义层面与客观实体保持一致。训练集与测试集源自互不交叠的schema池,即模型在训练期间所见schema绝不会出现在测试集中,从而严格规避数据泄露风险。
特点
Benchson的显著特色在于其多维度的评分体系,包括JSON合法性(json_validity)、Schema合规性(schema_compliance)、语义忠实度(semantic_fidelity)和精确匹配(exact_match)。其中精确匹配作为一项严格的全正确标志,要求输出同时满足合法、合规且完全还原所有真实字段,最适合用于模型排名。修复与修改任务还额外引入变化忠实度(change_fidelity),专注于衡量模型对被改动字段的复原能力。凭借这些指标,Benchson可精细区分模型的结构化输出能力层次。
使用方法
使用Benchson评估模型时,应调用其测试集并通过官方评分工具进行打分。用户可选择集成EleutherAI的lm-evaluation-harness流水线,直接运行预定义的任务,报告以精确匹配为首要指标。亦可通过datasets库加载数据后,使用utils.py中的独立评分器对模型逐条评估。数据集中JSON字段均以字符串形式存储,需以json.loads解析。建议将数据版本锁定为固定的git tag(如v1.0),以保证评估结果的可复现性。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的浪潮中,结构化输出生成能力成为衡量模型实用性的关键指标,尤其在需要与数据库、API或配置系统交互的场景中。然而,现有基准多聚焦于自然语言文本或代码生成,缺乏对JSON这一通用数据交换格式的细致评估。为此,研究者于2025年6月发布了Benchson基准,由Aviv Ron等研究人员及其团队构建,旨在系统评测LLM生成符合模式(schema)的JSON内容的能力。该基准涵盖创建、修复和修改三大任务族,分别对应从描述与模式生成JSON、纠正违反模式的错误对象、以及依据指令修改已有JSON,每个任务均细分为不同难度层级。Benchson通过精确匹配(exact_match)等指标量化正确性,而非仅验证模式合规性,填补了结构化输出评测领域的重要空白,为LLM在工程自动化、数据清洗等领域的应用提供了可靠的评估尺度。
当前挑战
当前Benchson面临的核心挑战之一在于领域问题的复杂性:LLM生成JSON时需同时保证语法有效(json_validity)、模式合规(schema_compliance)和语义忠实(semantic_fidelity),而这三者在复杂嵌套模式下往往难以兼顾,传统自动评估容易饱和,无法有效区分顶尖模型间的性能差异。此外,基准构建过程中面临显著挑战,为确保测试集反映模型的真实泛化能力,训练与测试采用了不相交的模式池(disjoint schema pools),这要求数据生成需从不同来源(如JSONSchemaStore、JSONSchemaBench)精心筛选并人工验证。地面真相由GPT-oss-120b生成并经Qwen3.5-397B反向验证,但长尾模式、罕见结构或领域特定约束的覆盖仍可能存在偏差,同时大规模多轮修复和修改任务中的时序依赖(如上下文一致性)也增加了评估设计的难度,使Benchson需持续迭代以保持对模型能力边界的敏感度。
常用场景
经典使用场景
在自然语言处理与结构化数据生成的交汇领域,Benchson数据集以其精准的内容锚定设计,成为评估大语言模型JSON生成能力的经典标杆。该数据集通过“创建(create)”、“修复(fix)”与“修改(modify)”三种任务形态,全面考察模型从自然语言描述和JSON Schema出发,生成合规、语义精确的JSON对象的能力。尤其值得关注的是,其测试集与训练集源自不同的Schema池,确保了评估的泛化性与公平性,使得Benchson在模型结构化输出能力的对比研究中占据核心地位。研究者常借助该数据集,以“精确匹配(exact_match)”为核心指标,衡量模型在复杂Schema约束下的生成准确度。
衍生相关工作
围绕Benchson数据集,衍生了一系列具有代表性的研究工作,它们共同推动了结构化生成方向的发展。该数据集本身基于JSONSchemaStore与JSONSchemaBench构建,后者来自EPFL团队的学术成果(arXiv:2501.10868),提供了丰富的Schema多样性。EleutherAI的lm-evaluation-harness将Benchson集成作为标准评估任务,使得社区可以便捷地在统一框架下对比不同语言模型的JSON生成性能。此外,Benchson采用的精确匹配与语义忠实度联合评估范式,启发了后续工作在数据到文本生成、代码合成与结构化预测等领域的评估指标设计,成为该细分领域基准化建设的重要参照系。
数据集最近研究
最新研究方向
Benchson数据集的问世标志着结构化文本生成评估迈入内容锚定与细粒度语义校验的新阶段。其核心创新在于打破传统仅依赖模式验证的局限,通过构建基于真实对象上下文与精确地面真值的基准,对模型的JSON生成质量进行多维度量化——涵盖语法正确性、模式合规性、语义忠实度及严格精确匹配。该基准特别区分了创建、修正与修改三大任务族,并引入按难度分层(hard/tier)的评测体系,有效规避了模型在高分饱和指标上的性能趋同困境。当前前沿研究热点聚焦于利用Benchson推动大型语言模型在代码智能、结构化API生成及语义修复等关键领域的可控性与可靠性突破,尤其在纠正推理与指令遵循能力上提供了极具区分度的检验标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务