遇见数据集

EGSciQA-ptPT-V1

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

EGSciaQA-ptPT-V1 是首个面向欧洲葡萄牙语(pt-PT)的、用于证据基础科学问答与推理的监督微调数据集。数据集中的每个样本包含一个系统提示、一条带有科学证据的指令,以及一个使用 <raciocinio> 和 <resposta> 标签组织的结构化目标回复。样本直接从 amalia-llm/CorEGe-PT 语料库中的真实欧洲葡萄牙语科学手稿生成,经过自动化流程筛选和格式化,确保每个样本仅出现一次。数据集总共有 17,921 条独特样本,按如下方式分割:训练集 12,571 条(train.jsonl)、验证集 1,776 条(dev.jsonl)、测试集 3,574 条(test.jsonl)以及轻量评估集 300 条(lite_eval.jsonl),其中轻量评估集是测试集的一个分布匹配子集,不计入总样本数。主要字段包括:question_id(问题标识符)、doc_id(文档标识符)、source_type(来源类型:单文档或文档簇)、question_family(问题生成家族)、groundability(可地面性:可地面、部分可地面、不可地面)、system(系统消息)、instruction(融合了问题与证据的指令)、response(监督助手目标回复)、selected_answer(选定的最终答案)、cot_sample_index(候选索引)、split(分割名称)、split_group(泄露控制分割元数据)以及 cluster_id(文档簇标识符)。该数据集适用于监督微调(SFT)或基于强化学习的对齐(RL)任务,建议使用训练集进行模型训练,验证集用于模型选择与训练诊断,轻量评估集用于快速开发评估,测试集仅用于最终保留评估。模型应训练为仅从提供的证据中回答问题,引用所使用的证据标识符,并在证据不足时明确说明。需要注意的是,该数据集样本为合成生成,尽管经过自动化验证,但仍可能保留原始手稿中的 OCR 伪影、源文档错误或不完美的推理痕迹,不应替代专家审阅。

EGSciaQA-ptPT-V1 is the first supervised fine-tuning dataset for evidence-based scientific question answering and reasoning in European Portuguese (pt-PT). Each sample in the dataset consists of a system prompt, an instruction containing scientific evidence, and a structured target response organized using <raciocinio> and <resposta> tags. The samples are directly generated from authentic European Portuguese scientific manuscripts in the amalia-llm/CorEGe-PT corpus, filtered and formatted through an automated pipeline to ensure each sample appears only once. The dataset contains a total of 17,921 unique samples, split as follows: 12,571 for training (train.jsonl), 1,776 for validation (dev.jsonl), 3,574 for testing (test.jsonl), and 300 for lightweight evaluation (lite_eval.jsonl), where the lightweight evaluation set is a distribution-matched subset of the test set and is not included in the total sample count. Key fields include: question_id (question identifier), doc_id (document identifier), source_type (source type: single document or document cluster), question_family (question generation family), groundability (groundability: groundable, partially groundable, not groundable), system (system message), instruction (instruction combining question and evidence), response (supervised assistant target response), selected_answer (selected final answer), cot_sample_index (candidate index), split (split name), split_group (leakage control split metadata), and cluster_id (document cluster identifier). The dataset is suitable for supervised fine-tuning (SFT) or reinforcement learning-based alignment (RL) tasks. It is recommended to use the training set for model training, the validation set for model selection and training diagnostics, the lightweight evaluation set for rapid development evaluation, and the test set only for final held-out evaluation. Models should be trained to answer questions solely from the provided evidence, citing the evidence identifiers used, and explicitly stating when evidence is insufficient. Note that the dataset samples are synthetically generated and, despite automated validation, may still retain OCR artifacts, source document errors, or imperfect reasoning traces from the original manuscripts and should not replace expert review.

创建时间:
2026-08-27
原始信息汇总

数据集概述

EGSciQA-ptPT-V1 是一个面向欧洲葡萄牙语(pt-PT)的监督微调数据集,专注于基于科学证据的问答与推理任务。每个样本包含系统提示、带有科学证据的指令,以及使用 <raciocinio>(推理)和 <resposta>(答案)结构化的目标响应。

主要特点

  • 语言:葡萄牙语(pt
  • 任务类别:文本生成、问答
  • 标签:科学推理、接地生成、监督微调
  • 规模:10K < n < 100K(实际总样本数 17,921)
  • 数据来源:基于 amalia-llm/CorEGe-PT 语料库中的真实欧洲葡萄牙语科学手稿,由自动化流水线合成生成并筛选。
  • 用途:适用于监督微调(SFT)、基于强化学习的对齐、模型选择及最终评估。

数据划分

划分 文件 行数
训练集 train.jsonl 12,571
验证集 dev.jsonl 1,776
测试集 test.jsonl 3,574
精简评估集(lite-eval) lite_eval.jsonl 300
总计 17,921
  • lite-eval 是从 test 中抽取的、分布匹配的 300 条子集,用于快速开发评估;该子集不额外计入 17,921 条唯一样本总数。

数据字段

  • 标识符question_iddoc_id(来源标识)
  • 来源类型source_typesingle_documentdocument_cluster
  • 问题族question_family
  • 可接地性groundabilitygroundablepartially_groundablenon_groundable
  • 系统提示system(用于 SFT 的系统消息)
  • 指令instruction(问题与证据的增强呈现)
  • 目标响应response(监督助理目标)
  • 选定答案selected_answer(聊天格式前的最终答案)
  • 样本索引cot_sample_index
  • 划分元数据splitsplit_group(防泄漏控制)
  • 聚类标识cluster_id(仅存在于文档聚类样本中)

预期用途

  • train:用于监督微调或基于强化学习的对齐。
  • validation:用于模型选择与训练诊断。
  • lite-eval:用于快速开发评估。
  • test:仅用于最终留出集评估。
  • 模型需基于提供的证据进行回答,引用所使用的证据标识,并在证据不足时明确说明。

局限性

  • 样本由自动化流水线从真实科学文档证据中合成生成,可能保留 OCR 伪影、源文档错误或不完美的生成推理。
  • 该数据集不应替代专家审查,需谨慎使用。
搜集汇总
数据集介绍
EGSciQA-ptPT-V1 数据集图片
构建方式
EGSciQA-ptPT-V1是基于欧洲葡萄牙语科学文献构建的首个监督微调数据集,旨在推动基于证据的科学问答与推理研究。其构建过程严谨地依托于amalia-llm/CorEGe-PT语料库中的真实科学手稿,通过自动化流水线生成样本,每条样本均包含系统提示、融合科学证据的指令以及结构化的目标回应。构建中精妙地划分了训练集、验证集、测试集及轻量评估子集,确保了数据分布的代表性与泄漏控制,每个合格源例仅贡献一个唯一行,保障了数据集的纯净与统计独立性。
特点
该数据集的核心特点在于其高度结构化的范例设计,每条数据通过<raciocinio>与<resposta>标签明确区分推理与答案部分,促进模型理性思考。其问题来源多样,覆盖单文档与文档簇,并标注了可落地性等级,细化到证据类型、领域及一致性频带。此外,轻量评估子集与测试集分布高度匹配,极大优化了开发阶段的迭代效率。数据集还内嵌了来源标识与簇信息,为细粒度的溯源与评估提供了便利。
使用方法
针对模型训练与评估的不同阶段,EGSciQA-ptPT-V1提供了清晰的使用策略。训练阶段采用train分割进行监督微调或基于强化学习的对齐;验证阶段利用validation分割进行模型选择与训练诊断;轻量评估子集lite-eval适用于快速开发周期的性能测试;而test分割则仅用于最终模型的盲测。调用方应确保模型能够严格依据所给证据作答,善于引用证据标识,并在证据不足时明确声明,以此作为模型能力考核的关键准则。
背景与挑战
背景概述
EGSciQA-ptPT-V1是首个面向欧洲葡萄牙语(pt-PT)的基于证据的科学问答监督微调数据集,由amalia-llm团队于2024年构建,依托CorEGe-PT语料库中的真实科学文献自动生成。该数据集旨在推动科学推理与证据锚定生成在低资源语言中的研究,弥补了葡萄牙语科学问答数据稀缺的空白。其核心研究问题在于如何让语言模型在严格依赖给定证据的前提下进行推理并回答科学问题,同时需判断证据充分性。每个样本包含系统提示、带证据的指令及结构化回复,涵盖单文档与文档簇两种来源,并标注了可接地性(groundability)与问题类型。该数据集为监督微调、基于人类反馈的强化学习及评估提供了17,921条去重样本,对多语言科学NLP领域具有重要意义,尤其为葡萄牙语科学教育、文献挖掘及可解释问答系统研究奠定了数据基础。
当前挑战
EGSciQA-ptPT-V1面临的挑战包括领域问题与构建层面的双重困难。在领域层面,其需解决科学问答中证据的严格定位与推理的可验证性问题,即模型必须从冗长、技术性的科学文献中提取关键信息,并生成可追溯的推理链条,同时识别证据不足或部分可接地的情况,避免臆造答案。此外,跨文档问答要求整合多源证据并处理信息冲突。在构建层面,挑战在于从真实葡萄牙语科学文献(含OCR错误)中自动合成高质量问答对,需设计严谨的生成流程以确保问题的多样性和逻辑连贯性;同时需精细控制数据泄露,通过按簇划分数据集,防止同源文档信息渗透至训练或测试集。此外,自动验证虽能过滤部分低质样本,但仍可能残留文档原有错误,且样本的推理质量难以完全保证。这些挑战需持续的人工评估与模型稳健性研究来逐步缓解。
常用场景
经典使用场景
EGSciQA-ptPT-V1作为首个面向欧洲葡萄牙语的证据 grounded 科学问答与推理数据集,其经典使用场景聚焦于监督微调(SFT)与基于强化学习的对齐训练。研究者利用其精心划分的训练集、验证集与测试集,训练语言模型在给定科学证据的条件下生成结构化回答,并要求模型明确援引证据标识,凸显了在低资源语言环境下培育科学推理能力的核心范式。
解决学术问题
该数据集精准回应当前多语言科学推理研究中的关键缺口,即非英语语境下证据可溯源问答数据的匮乏。它通过构建包含可接地、部分可接地及不可接地样本的体系,推动模型学习区分证据充分性与局限性,从而缓解幻觉问题,促进可信赖的自然语言推理,为评估模型在科学文献理解、逻辑演绎及忠实生成方面的综合能力提供了标准化基准。
衍生相关工作
该数据集衍生出多项具有影响力的研究工作,包括开发多语言证据问答的评测套件、探索跨语言迁移学习的科学推理模型,以及构建基于该数据的助手模型(如针对葡萄牙语优化的科学对话系统)。其释放的17,921条高质量指令样本,为社区提供了宝贵的资源,激发了关于证据感知生成、可控文本生成及低资源场景下推理增强等方向的后续创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务