遇见数据集

energy-eval-filtered_responses_multichoice_cemig-nlp-releases_enregy-gpt-regulatorio-v2_v4

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

该数据集是一个专为能源监管领域问答任务设计的数据集,用于评估检索增强生成(RAG)技术。它包含447个训练样本,每个样本提供原始问题(question)、带选项的问题(question_with_choices)和正确答案(answerKey)。数据集重点提供了不同RAG配置下生成的提示词(prompt),包括基础的无RAG提示词(prompt_no_rag)以及一系列应用了RAG的提示词,这些提示词字段反映了复杂的实验配置,涉及开关RAG功能、使用不同的嵌入模型(如multilingual-e5-small-ft、multilingual-e5-large-ft-v2、qwen3-embedding-0.6B-ft)和可选的重排序器(如bge-reranker-v2-m3-ft及其变体)。部分字段(带有`_context`后缀)可能存储检索到的相关上下文信息。该数据集适用于研究RAG pipeline在特定垂直领域(能源监管)的性能,并比较不同嵌入和重排序策略对问答系统提示工程的影响。

This dataset is designed for question-answering tasks in the energy regulation domain, specifically for evaluating Retrieval-Augmented Generation (RAG) technology. It contains 447 training samples, each providing the original question (question), the question with options (question_with_choices), and the correct answer (answerKey). The dataset emphasizes the generated prompts under different RAG configurations, including a basic no-RAG prompt (prompt_no_rag) and a series of RAG-applied prompts. These prompt fields reflect complex experimental setups, involving toggling RAG functionality, using different embedding models (e.g., multilingual-e5-small-ft, multilingual-e5-large-ft-v2, qwen3-embedding-0.6B-ft), and optional re-rankers (e.g., bge-reranker-v2-m3-ft and its variants). Some fields (with the `_context` suffix) may store retrieved relevant context information. The dataset is suitable for researching the performance of RAG pipelines in a specific vertical domain (energy regulation) and comparing the impact of different embedding and re-ranking strategies on prompt engineering for question-answering systems.

创建时间:
2026-06-03
原始信息汇总

数据集概述:energy-eval-filtered_responses_multichoice_cemig-nlp-releases_enregy-gpt-regulatorio-v2_v4

基本信息

  • 数据集地址:https://huggingface.co/datasets/juliadollis/energy-eval-filtered_responses_multichoice_cemig-nlp-releases_enregy-gpt-regulatorio-v2_v4
  • 下载大小:11,094,893 字节(约10.6 MB)
  • 数据集大小:34,712,247 字节(约33.1 MB)
  • 配置:默认配置(default),数据文件路径为 data/train-*

数据集划分

  • 训练集(train):包含 447 个样本,占用 34,712,247 字节

特征字段

该数据集包含以下特征字段:

基本字段

  • question (string):问题文本
  • question_with_choices (string):包含选项的问题文本
  • answerKey (string):正确答案键值
  • prompt_no_rag (string):无检索增强生成(RAG)的提示文本
  • prompt_rag (string):有检索增强生成(RAG)的提示文本

模型响应字段(无RAG)

  • cemig-nlp-releases_enregy-gpt-regulatorio-v2_RAG-FALSE_ENC-none_RR-none (string):无检索增强生成模式下,模型的响应结果

模型响应字段(含RAG,使用不同编码器与重排序器组合)

该数据集包含多种RAG配置下的模型响应及其上下文信息,具体包括:

使用 multilingual-e5-small-ft 编码器

  • 无重排序器:响应字段及对应的上下文字段
  • 使用 bge-reranker-v2-m3-ft 重排序器:响应字段及对应的上下文字段
  • 使用 bge-reranker-v2-m3-ft-v2 重排序器:响应字段及对应的上下文字段

使用 multilingual-e5-large-ft-v2 编码器

  • 无重排序器:响应字段及对应的上下文字段
  • 使用 bge-reranker-v2-m3-ft 重排序器:响应字段及对应的上下文字段
  • 使用 bge-reranker-v2-m3-ft-v2 重排序器:响应字段及对应的上下文字段

使用 qwen3-embedding-0.6B-ft 编码器

  • 无重排序器:响应字段及对应的上下文字段
  • 使用 bge-reranker-v2-m3-ft 重排序器:响应字段及对应的上下文字段
  • 使用 bge-reranker-v2-m3-ft-v2 重排序器:响应字段及对应的上下文字段

使用 qwen3-embedding-0.6B-ft-v2 编码器

  • 无重排序器:响应字段及对应的上下文字段
  • 使用 bge-reranker-v2-m3-ft 重排序器:响应字段及对应的上下文字段
  • 使用 bge-reranker-v2-m3-ft-v2 重排序器:响应字段及对应的上下文字段

说明

  • 所有模型响应字段以 cemig-nlp-releases_enregy-gpt-regulatorio-v2 开头,命名规则体现了不同的RAG配置(RAG-TRUE/FALSE)、编码器(ENC)和重排序器(RR)组合。
  • 每个RAG配置下的响应字段均带有 _context 后缀的对应上下文字段,用于存储检索到的相关上下文信息。
搜集汇总
数据集介绍
energy-eval-filtered_responses_multichoice_cemig-nlp-releases_enregy-gpt-regulatorio-v2_v4 数据集图片
构建方式
该数据集名为energy-eval-filtered_responses_multichoice_cemig-nlp-releases_enregy-gpt-regulatorio-v2_v4,聚焦能源领域的多选择题问答任务。构建过程始于原始问题与选项的采集,每个样本包含明确的提问文本(question)及附带选项的完整表述(question_with_choices),并标注标准答案(answerKey)。在此基础上,研究团队系统性地集成了检索增强生成(RAG)技术,为每个问题分别构造了无检索提示(prompt_no_rag)与有检索提示(prompt_rag),并进一步融合多种嵌入模型与重排序模型。具体而言,嵌入模型涵盖多语言e5-small-ft、e5-large-ft-v2及qwen3-embedding的不同微调版本,重排序器则应用bge-reranker-v2-m3-ft及其变体,从而生成多组RAG配置下的模型响应与对应检索上下文,最终形成包含447条训练样本的高质量评估集。
使用方法
该数据集适用于能源领域大语言模型问答能力的评估与RAG策略的消融研究。使用时,可将每个样本的question_with_choices作为输入,以answerKey作为标准标签,通过计算模型预测与标准答案的匹配率来评估不同配置下的性能。利用prompt_no_rag与各RAG配置的响应字段,研究者能够独立对比无检索基线、不同嵌入器以及是否结合重排序器的表现差异。同时,各字段的context部分提供了每一步RAG检索到的上下文信息,便于进行检索质量与生成质量之间的关联分析,从而指导更优的能源领域问答系统设计方案。
背景与挑战
背景概述
该数据集由巴西米纳斯吉拉斯州能源公司(CEMIG)的自然语言处理团队构建,聚焦于能源监管领域的智能问答任务。随着大型语言模型在垂直场景中的部署需求日益增长,能源行业因其高度专业化的法规体系和复杂的决策链条,成为检验模型实用性的关键战场。该数据集创建于2024年,以葡萄牙语撰写,核心研究问题在于评估检索增强生成(RAG)技术对语言模型回答能源法规问题的提升效果。通过整合多种嵌入模型与重排序策略的对比实验,该资源为能源领域知识密集型问答系统的开发与评测奠定了基准,推动了自然语言处理技术在受监管工业场景中的落地应用。
当前挑战
该数据集所解决的领域问题核心在于能源法规问答的精准性挑战:法规条文间存在隐含引用与层级关联,模型需在语义理解基础上完成多跳推理,而传统语言模型易产生事实性幻觉。构建过程中面临的挑战尤为突出:首先,原始法规文档篇幅冗长且术语密集,需要领域专家与算法工程师协同进行细粒度的问题-答案对提取与校验;其次,RAG系统涉及检索与生成阶段的非对称误差传递,例如嵌入模型对葡萄牙语专有名词的编码偏差可能造成上下文片段错配;最后,多版本知识库的时效性维护与过滤策略设计,需在信息覆盖度与噪声控制间取得平衡。
常用场景
经典使用场景
在能源监管与合规领域,该数据集被广泛用于评估和微调大规模语言模型(LLM)在专业问答场景下的性能。尤为经典的是,它支持在检索增强生成(RAG)框架下,对比不同嵌入模型(如multilingual-e5系列、qwen3-embedding系列)与重排序器(如bge-reranker系列)组合对回答准确性的影响。通过提供问题、选项及标准答案,研究者能够系统性地考察模型在专业监管知识理解上的表现,从而优化模型在能源这一垂直行业的落地效果。
解决学术问题
此数据集有效回应了自然语言处理与能源领域交叉研究中一个核心挑战:如何在专业性强、知识更新快的监管文本环境中评估和改进LLM的问答能力。它揭示了检索策略(RAG)与模型生成能力之间的协同效应,为探讨知识密度、上下文长度与推理准确性之间的权衡提供了量化依据。通过对不同嵌入和重排序方案的对比分析,该数据集推动了面向特定行业的检索增强系统评估方法论的发展,填补了能源监管语境下标准评测数据缺失的学术空白。
实际应用
在工业界,该数据集的应用场景集中在能源企业智能客服与合规审查系统。例如,电力公司运营人员可借助基于此数据集微调的模型,快速查询并理解复杂的监管法规条文,获取精准的决策辅助信息。同时,其多轮RAG配置评测能力,使得企业能够依据自身算力与知识库特点,选择最优的嵌入和召回方案,从而构建高效且成本可控的端到端知识问答管线,显著提升员工在合规操作、政策解读等工作中的效率。
数据集最近研究
最新研究方向
该数据集聚焦于能源领域法规问答场景下检索增强生成(RAG)技术的系统评估,通过对比不同嵌入模型(如multilingual-e5系列与Qwen3-embedding变体)与重排序策略(如bge-reranker-v2-m3-ft系列)的组合效果,为监管型大语言模型的可靠性验证提供了基准。其前沿性体现在对RAG流水线各组件进行解耦式消融实验,并引入过滤后多选格式的问答对,可精准衡量知识检索与推理的协同效能。该研究契合当前AI监管领域对可溯源、低幻觉输出的迫切需求,尤其为能源行业合规问答系统的工程化部署提供了可复现的评估范式,推动领域模型从通用对话向高确定性专业问答演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务