grounded-behavior-framework-v1_5
收藏资源简介:
Grounded Behavior Framework N1 v1.5 是一个用于训练和评估基于给定上下文生成基础答案的欧洲葡萄牙语合成数据集。每个示例包含一个上下文、一个问题以及一个在上下文中字面出现的简短答案。该数据集旨在支持模型在葡萄牙语环境下进行基于上下文的问答任务,并评估其事实检索能力和抗干扰能力。数据集包含三个划分:训练集(4,840个示例)、验证集(250个示例)和测试集(240个示例),总计5,330个示例。每个示例包含丰富的字段:核心字段包括唯一标识符(id)、上下文文本(context)、问题(question)和答案(answer);元数据字段包括课程级别、能力代码、子技能(curriculum_level, capability_code, subskill)以及内容特征如领域、文档风格、事实类型、实体类型(domain, document_style, fact_type, entity_type);生成控制字段包括上下文长度、事实位置、干扰项、问题类型(context_length, fact_position, distractor, question_type);此外还有语言变体、生成提供方、批次和块标识符、示例索引、提示版本以及数据集版本等用于追溯的字段(language, provider, batch_id, chunk_id, example_index, prompt_version, dataset_version)。数据通过多个提供方生成,并经过了严格的结构化和确定性验证,确保答案在上下文中字面存在、符合课程分布等。版本v1.5在基础版本上增加了400个经过验证的示例到训练集,并进行了多次质量审查和修正,包括修正了141个Opening_Hours类型的答案以补充营业日信息,移除了170个不当引入上下文的问题,处理了24个元文本前缀案例,以及移除了659个上下文中的1,271个疑问句片段,确保上下文不含问题。所有修正均未引入新信息或删除示例,并保持了答案的字面存在性。数据集专门针对课程级别N1设计,内容为合成生成,实体和事实可能为虚构,不应用于高影响力决策或作为事实来源,也不替代人工审查。数据集采用MIT许可证。
Grounded Behavior Framework N1 v1.5 is a synthetic dataset in European Portuguese for training and evaluating the generation of grounded answers based on given contexts. Each example includes a context, a question, and a short answer that appears literally in the context. The dataset is designed to support context-based question answering tasks in Portuguese and evaluate models fact retrieval and anti-interference capabilities. It contains three splits: training set (4,840 examples), validation set (250 examples), and test set (240 examples), totaling 5,330 examples. Each example includes rich fields: core fields such as unique identifier (id), context text (context), question (question), and answer (answer); metadata fields including curriculum level, capability code, subskill (curriculum_level, capability_code, subskill) and content features like domain, document style, fact type, entity type (domain, document_style, fact_type, entity_type); generation control fields including context length, fact position, distractor, question type (context_length, fact_position, distractor, question_type); and additional traceability fields such as language variant, provider, batch and chunk identifiers, example index, prompt version, and dataset version (language, provider, batch_id, chunk_id, example_index, prompt_version, dataset_version). The data is generated by multiple providers and undergoes rigorous structural and deterministic validation to ensure answers are literally present in the context and conform to curriculum distribution. Version v1.5 adds 400 validated examples to the training set and includes multiple quality reviews and corrections, such as fixing 141 Opening_Hours-type answers to supplement business day information, removing 170 questions improperly introduced into contexts, handling 24 meta-text prefix cases, and removing 1,271 interrogative fragments from 659 contexts to ensure contexts are free of questions. All corrections do not introduce new information or delete examples and maintain the literal presence of answers. The dataset is specifically designed for curriculum level N1, with synthetically generated content where entities and facts may be fictional, and should not be used for high-impact decisions or as a source of facts, nor as a substitute for human review. The dataset is licensed under MIT.
数据集概述
Grounded Behavior Framework N1 v1.5 是一个面向欧洲葡萄牙语的合成数据集,用于训练和评估基于给定上下文的问答能力。每个样本包含一个上下文、一个问题以及一个在上下文中逐字出现的简短答案。
加载方式
python from datasets import load_dataset dataset = load_dataset("empgces/grounded-behavior-framework-v1_5")
数据划分
| 数据划分 | 样本数 | 用途 |
|---|---|---|
train |
4,840 | 训练 |
validation |
250 | 验证与调优 |
test |
240 | 最终评估 |
v1.5 版本在基础版本训练集上新增了 400 个验证过的样本。后续质量审查保留了三个划分的规模和分布。
字段说明
每条 JSONL 数据包含以下字段:
id:样本的唯一确定性标识符。context:包含相关事实的文本。question:可基于上下文回答的问题。answer:在上下文中逐字出现的答案。curriculum_level,capability_code,subskill:课程元数据。domain,document_style,fact_type,entity_type:内容特征。context_length,fact_position,distractor,question_type:生成控制参数。language:语言变体。provider,batch_id,chunk_id,example_index,prompt_version:生成溯源信息。dataset_version:样本的原始版本号。
创建过程
样本由多个提供者生成,并经过结构化和确定性验证。验证内容包括:
- JSON 格式和结构有效性。
- 每个 chunk 的预期样本数量。
- 答案在上下文中逐字出现。
- v1.5 扩展中课程分布的强制性要求。
- 营业时间答案中包含日期和完整时间区间。
v1.5 新增的 400 个样本来自 40 个已验证的 chunk,未发现与基础版本或扩展内部存在精确重复。
质量审查
- 2026年7月26日:针对
Opening_Hours类型答案进行了审查,补全了 141 条仅包含时间区间但缺少营业日期的答案(训练集101条、验证集30条、测试集10条)。未虚构任何日期或时间,也未删除任何样本。11个上下文未声明日期的案例被保留并记录。完整的修改记录位于quality/dataset_quality_corrections.jsonl,保留案例位于quality/dataset_quality_unresolved.jsonl。 - 同日结构性审查:对所有 5,330 个样本进行了全面审计,删除了 170 条在
FAQ类型文档的context中被误引入的冗余或无关问题。共分析 24 个元文本案例,移除 17 个前缀(不影响目标事实),保留 7 个案例以避免破坏接地性或改变受保护的歧义。v1.5 版本累积对 328 个唯一样本进行了可审计的修正:141 条营业时间修正、170 条结构性修正、17 条元文本修正。所有 5,330 条答案仍逐字出现在对应上下文中,无重复 ID 或精确重复。592 个答案出现多次的案例作为统计指标保留。完整时间线报告位于QUALITY_CORRECTIONS.md。 - 2026年7月27日:再次审计所有 5,330 个上下文,确保提供给模型的事实文档不包含任何问题。修正了 659 个上下文(训练集562、验证集50、测试集47),移除了 1,271 个疑问句片段。未修改
question或answer字段,未新增信息,未删除任何样本。修正后:所有上下文不含?;所有 5,330 条答案仍逐字出现;无重复 ID 或精确重复。累积有 959 个唯一样本包含可审计的修正。修改记录位于quality/context_question_corrections.jsonl。
预期用途
- 针对基于上下文的问答任务进行模型微调。
- 评估模型对欧洲葡萄牙语上下文的理解能力。
- 研究显式事实检索与抗干扰能力。
非预期用途
- 不可作为事实来源、用于高影响决策或替代人工审查。
- 数据中的实体和事实可能为虚构。
局限性
- 内容为合成数据,可能包含生成模型的风格化模式。
- 自动验证不等同于全面的人工语言学审查。
- 覆盖范围集中在 N1 课程级别,不衡量通用推理能力。
个人信息
数据集仅包含合成的实体和事实,不意图代表真实人物或包含个人数据。
许可协议
MIT,详见 LICENSE 文件。
版本
v1.5




