遇见数据集

grounded-behavior-framework-v1_5

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

Grounded Behavior Framework N1 v1.5 是一个用于训练和评估基于给定上下文生成基础答案的欧洲葡萄牙语合成数据集。每个示例包含一个上下文、一个问题以及一个在上下文中字面出现的简短答案。该数据集旨在支持模型在葡萄牙语环境下进行基于上下文的问答任务,并评估其事实检索能力和抗干扰能力。数据集包含三个划分:训练集(4,840个示例)、验证集(250个示例)和测试集(240个示例),总计5,330个示例。每个示例包含丰富的字段:核心字段包括唯一标识符(id)、上下文文本(context)、问题(question)和答案(answer);元数据字段包括课程级别、能力代码、子技能(curriculum_level, capability_code, subskill)以及内容特征如领域、文档风格、事实类型、实体类型(domain, document_style, fact_type, entity_type);生成控制字段包括上下文长度、事实位置、干扰项、问题类型(context_length, fact_position, distractor, question_type);此外还有语言变体、生成提供方、批次和块标识符、示例索引、提示版本以及数据集版本等用于追溯的字段(language, provider, batch_id, chunk_id, example_index, prompt_version, dataset_version)。数据通过多个提供方生成,并经过了严格的结构化和确定性验证,确保答案在上下文中字面存在、符合课程分布等。版本v1.5在基础版本上增加了400个经过验证的示例到训练集,并进行了多次质量审查和修正,包括修正了141个Opening_Hours类型的答案以补充营业日信息,移除了170个不当引入上下文的问题,处理了24个元文本前缀案例,以及移除了659个上下文中的1,271个疑问句片段,确保上下文不含问题。所有修正均未引入新信息或删除示例,并保持了答案的字面存在性。数据集专门针对课程级别N1设计,内容为合成生成,实体和事实可能为虚构,不应用于高影响力决策或作为事实来源,也不替代人工审查。数据集采用MIT许可证。

Grounded Behavior Framework N1 v1.5 is a synthetic dataset in European Portuguese for training and evaluating the generation of grounded answers based on given contexts. Each example includes a context, a question, and a short answer that appears literally in the context. The dataset is designed to support context-based question answering tasks in Portuguese and evaluate models fact retrieval and anti-interference capabilities. It contains three splits: training set (4,840 examples), validation set (250 examples), and test set (240 examples), totaling 5,330 examples. Each example includes rich fields: core fields such as unique identifier (id), context text (context), question (question), and answer (answer); metadata fields including curriculum level, capability code, subskill (curriculum_level, capability_code, subskill) and content features like domain, document style, fact type, entity type (domain, document_style, fact_type, entity_type); generation control fields including context length, fact position, distractor, question type (context_length, fact_position, distractor, question_type); and additional traceability fields such as language variant, provider, batch and chunk identifiers, example index, prompt version, and dataset version (language, provider, batch_id, chunk_id, example_index, prompt_version, dataset_version). The data is generated by multiple providers and undergoes rigorous structural and deterministic validation to ensure answers are literally present in the context and conform to curriculum distribution. Version v1.5 adds 400 validated examples to the training set and includes multiple quality reviews and corrections, such as fixing 141 Opening_Hours-type answers to supplement business day information, removing 170 questions improperly introduced into contexts, handling 24 meta-text prefix cases, and removing 1,271 interrogative fragments from 659 contexts to ensure contexts are free of questions. All corrections do not introduce new information or delete examples and maintain the literal presence of answers. The dataset is specifically designed for curriculum level N1, with synthetically generated content where entities and facts may be fictional, and should not be used for high-impact decisions or as a source of facts, nor as a substitute for human review. The dataset is licensed under MIT.

创建时间:
2026-07-25
原始信息汇总

数据集概述

Grounded Behavior Framework N1 v1.5 是一个面向欧洲葡萄牙语的合成数据集,用于训练和评估基于给定上下文的问答能力。每个样本包含一个上下文、一个问题以及一个在上下文中逐字出现的简短答案。

加载方式

python from datasets import load_dataset dataset = load_dataset("empgces/grounded-behavior-framework-v1_5")

数据划分

数据划分 样本数 用途
train 4,840 训练
validation 250 验证与调优
test 240 最终评估

v1.5 版本在基础版本训练集上新增了 400 个验证过的样本。后续质量审查保留了三个划分的规模和分布。

字段说明

每条 JSONL 数据包含以下字段:

  • id:样本的唯一确定性标识符。
  • context:包含相关事实的文本。
  • question:可基于上下文回答的问题。
  • answer:在上下文中逐字出现的答案。
  • curriculum_level, capability_code, subskill:课程元数据。
  • domain, document_style, fact_type, entity_type:内容特征。
  • context_length, fact_position, distractor, question_type:生成控制参数。
  • language:语言变体。
  • provider, batch_id, chunk_id, example_index, prompt_version:生成溯源信息。
  • dataset_version:样本的原始版本号。

创建过程

样本由多个提供者生成,并经过结构化和确定性验证。验证内容包括:

  • JSON 格式和结构有效性。
  • 每个 chunk 的预期样本数量。
  • 答案在上下文中逐字出现。
  • v1.5 扩展中课程分布的强制性要求。
  • 营业时间答案中包含日期和完整时间区间。

v1.5 新增的 400 个样本来自 40 个已验证的 chunk,未发现与基础版本或扩展内部存在精确重复。

质量审查

  • 2026年7月26日:针对 Opening_Hours 类型答案进行了审查,补全了 141 条仅包含时间区间但缺少营业日期的答案(训练集101条、验证集30条、测试集10条)。未虚构任何日期或时间,也未删除任何样本。11个上下文未声明日期的案例被保留并记录。完整的修改记录位于 quality/dataset_quality_corrections.jsonl,保留案例位于 quality/dataset_quality_unresolved.jsonl
  • 同日结构性审查:对所有 5,330 个样本进行了全面审计,删除了 170 条在 FAQ 类型文档的 context 中被误引入的冗余或无关问题。共分析 24 个元文本案例,移除 17 个前缀(不影响目标事实),保留 7 个案例以避免破坏接地性或改变受保护的歧义。v1.5 版本累积对 328 个唯一样本进行了可审计的修正:141 条营业时间修正、170 条结构性修正、17 条元文本修正。所有 5,330 条答案仍逐字出现在对应上下文中,无重复 ID 或精确重复。592 个答案出现多次的案例作为统计指标保留。完整时间线报告位于 QUALITY_CORRECTIONS.md
  • 2026年7月27日:再次审计所有 5,330 个上下文,确保提供给模型的事实文档不包含任何问题。修正了 659 个上下文(训练集562、验证集50、测试集47),移除了 1,271 个疑问句片段。未修改 questionanswer 字段,未新增信息,未删除任何样本。修正后:所有上下文不含 ?;所有 5,330 条答案仍逐字出现;无重复 ID 或精确重复。累积有 959 个唯一样本包含可审计的修正。修改记录位于 quality/context_question_corrections.jsonl

预期用途

  • 针对基于上下文的问答任务进行模型微调。
  • 评估模型对欧洲葡萄牙语上下文的理解能力。
  • 研究显式事实检索与抗干扰能力。

非预期用途

  • 不可作为事实来源、用于高影响决策或替代人工审查。
  • 数据中的实体和事实可能为虚构。

局限性

  • 内容为合成数据,可能包含生成模型的风格化模式。
  • 自动验证不等同于全面的人工语言学审查。
  • 覆盖范围集中在 N1 课程级别,不衡量通用推理能力。

个人信息

数据集仅包含合成的实体和事实,不意图代表真实人物或包含个人数据。

许可协议

MIT,详见 LICENSE 文件。

版本

v1.5

搜集汇总
数据集介绍
grounded-behavior-framework-v1_5 数据集图片
构建方式
该数据集为欧洲葡萄牙语的合成数据集,专为基于给定上下文的问答与文本生成任务而设计。其构建方式涉及由多个提供者生成示例,并经过结构性与确定性验证,确保JSON格式正确、每个数据块示例数量符合预期、答案在上下文中逐字出现。v1.5版本在基础版本基础上新增400个经过验证的示例,总计包含5,330个样本,划分为训练集(4,840)、验证集(250)和测试集(240)。后构建阶段进行了多轮质量审核,包括修正缺失营业日期的回答、移除上下文中的冗余问题以及清理元文本,累计对959个唯一示例实施了可审计的校正,最终所有答案仍严格源于上下文。
特点
数据集的核心特点在于其高度结构化的字段设计,涵盖标识符、上下文、问题、答案以及丰富的元数据,如课程级别、技能编码、领域、事实类型、干扰项设置等,便于多维度筛选与分析。数据经过严格的去重处理,确保无重复ID或精确重复项。质量保障机制完善,记录了每项修正的完整前后对比,并保留了未解决案例的文档。语料集中于欧洲葡萄牙语,旨在评估模型在给定上下文中的显式事实检索能力与抗干扰性能,其合成属性有效避免了真实隐私风险,但亦提示用户注意生成内容可能存在的风格模式与局限。
使用方法
用户可通过HuggingFace Datasets库便捷加载,命令为`load_dataset('empgces/grounded-behavior-framework-v1_5')`,即可获取包含训练、验证和测试三个分区的数据集。每个样本为JSONL格式,可直接用于监督微调或评估,特别适用于构建欧洲葡萄牙语的有依据问答系统。数据集的元数据字段允许按课程级别、事实类型或干扰项等条件进行筛选,从而设计定制化的评估实验。使用时需注意其合成性质,不宜作为真实事实来源或用于高风险决策,推荐结合人工审核以补充自动验证的不足。
背景与挑战
背景概述
在自然语言处理领域,基于上下文的问答系统是评估模型语言理解与信息检索能力的关键任务。Grounded Behavior Framework N1 v1.5数据集由empgces机构于2026年创建,专注于欧洲葡萄牙语的指令微调与受控生成,旨在训练和评估模型在给定上下文中准确提取事实并回答问题的能力。该数据集包含5330个合成样本,划分为训练、验证和测试集,并经过多轮严格的结构化验证与质量审计,包括对回答内容、上下文干扰物以及元文本的精细修正。其严格的设计流程为葡萄牙语问答研究提供了高质量基准,推动了低资源语言在受控生成任务上的发展。
当前挑战
该数据集面临的核心挑战在于领域问题与构建过程两个层面。领域问题方面,基于上下文的问答要求模型能够识别并抵抗上下文中的干扰信息,同时正确提取与问题相关的事实,这对模型的注意力机制和鲁棒性提出高要求。构建过程中,数据集依赖于合成数据生成,需确保答案在上下文中以字面形式出现,并维持课程分布与元数据结构的完整性。质量审计中大量修正(如移除上下文中的无关问题、补全缺失的营业时间信息)凸显了自动生成与人工校验之间的平衡难题,同时需避免因修正破坏语义grounding或引入新偏差。
常用场景
经典使用场景
在自然语言处理领域,基于上下文的问答系统是衡量模型语义理解与信息检索能力的核心任务。grounded-behavior-framework-v1_5数据集专为训练和评估模型在给定上下文中生成精准回答而设计,其每个样本均由上下文、问题及答案三元组构成,且答案严格以字面形式出现在上下文中。该数据集最经典的用途是作为微调与评估的基准,用于开发能够忠实依据外部事实文本进行推理的问答模型,尤其适用于那些要求模型不得凭空捏造信息、必须从给定语境中提取事实片段的应用场景。通过该数据集,研究者可以系统性地检验模型在限定上下文条件下的信息定位能力与回答准确性。
衍生相关工作
该数据集的发布催生了一系列围绕上下文忠实性与抗干扰能力的研究工作。研究者们首先基于该数据集开展了细粒度的错误分析,揭示了模型在定位长距离事实、处理时间区间信息以及面对同义表述干扰时的薄弱环节。随后,出现了多项针对性的改进方法,包括基于注意力机制的事实定位增强、上下文编码器的结构化剪枝训练,以及多轮自一致性校验策略。此外,该数据集还被用作评估大语言模型在葡萄牙语欧洲变体上微调效果的标杆,推动了多语言问答系统的公平性比较研究。其在语种与内容层面的精细元数据设计,也启发了后续类似上下文校验数据集的构建方法论。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲葡萄牙语语境下的基础问答能力评估与微调,其前沿研究方向体现在对生成内容质量控制的精细化迭代上。尤其是针对‘营业时间’(Opening Hours)类型回答的完整性修复,以及系统性清除上下文中的冗余疑问句与元文本噪声,展现了当前NLP领域对合成数据集可靠性、可审计性与事实忠实度的高度追求。这些严谨的质量管理流程,结合课程学习元数据的分层设计,为构建更鲁棒、更少幻觉的指令微调模型提供了基准,并推动葡萄牙语资源在结构化问答任务中的实证研究迈向新高度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务