遇见数据集

energy-eval-filtered_responses_multichoice_cemig-rl-releases_energy-gp_459ced03_v3

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集是一个结构化问答数据集,专为检索增强生成(RAG)系统设计,包含447个训练样本。数据集中包含6个主要字段:问题原文(question)、带选项的问题(question_with_choices)、答案键(answerKey)、基于特定RAG系统的生成答案(cemig-rl-releases_energy-gpt-regulatorio-32b-safe-v2_RAG-TRUE_ENC-cemig-nlp-releases_multilingual-e5-large-ft-v2_RR-cemig-nlp-releases_bge-reranker-v2-m3-ft-v2)、RAG提示词(prompt_rag)以及RAG上下文(cemig-rl-releases_energy-gpt-regulatorio-32b-safe-v2_RAG-TRUE_ENC-cemig-nlp-releases_multilingual-e5-large-ft-v2_RR-cemig-nlp-releases_bge-reranker-v2-m3-ft-v2_context)。从字段命名和结构推断,该数据集可能用于评估或训练问答模型,特别是涉及多语言嵌入(如multilingual-e5-large-ft-v2)和重排序模型(如bge-reranker-v2-m3-ft-v2)的RAG流水线。数据集仅提供训练分割,总大小约5.8MB。

This dataset is a structured question-answering dataset designed for Retrieval-Augmented Generation (RAG) systems, containing 447 training samples. It includes six main fields: original question (question), question with options (question_with_choices), answer key (answerKey), generated answer based on a specific RAG system (cemig-rl-releases_energy-gpt-regulatorio-32b-safe-v2_RAG-TRUE_ENC-cemig-nlp-releases_multilingual-e5-large-ft-v2_RR-cemig-nlp-releases_bge-reranker-v2-m3-ft-v2), RAG prompt (prompt_rag), and RAG context (cemig-rl-releases_energy-gpt-regulatorio-32b-safe-v2_RAG-TRUE_ENC-cemig-nlp-releases_multilingual-e5-large-ft-v2_RR-cemig-nlp-releases_bge-reranker-v2-m3-ft-v2_context). Based on the field naming and structure, the dataset is likely intended for evaluating or training question-answering models, particularly in RAG pipelines involving multilingual embeddings (e.g., multilingual-e5-large-ft-v2) and reranking models (e.g., bge-reranker-v2-m3-ft-v2). The dataset only provides a training split, with a total size of approximately 5.8MB.

创建时间:
2026-07-22
原始信息汇总

数据集概述:energy-eval-filtered_responses_multichoice_cemig-rl-releases_energy-gp_459ced03_v3

基本信息

  • 数据集名称: energy-eval-filtered_responses_multichoice_cemig-rl-releases_energy-gp_459ced03_v3
  • 数据集地址: https://huggingface.co/datasets/cemig-ceia-v2/energy-eval-filtered_responses_multichoice_cemig-rl-releases_energy-gp_459ced03_v3

数据特征

该数据集包含以下列:

  1. question: 问题文本(大字符串类型)
  2. question_with_choices: 带有选项的问题文本(大字符串类型)
  3. answerKey: 答案键(大字符串类型)
  4. cemig-rl-releases_energy-gpt-regulatorio-32b-safe-v2_RAG-TRUE_ENC-cemig-nlp-releases_multilingual-e5-large-ft-v2_RR-cemig-nlp-releases_bge-reranker-v2-m3-ft-v2: 模型输出(大字符串类型)
  5. prompt_rag: RAG提示(大字符串类型)
  6. cemig-rl-releases_energy-gpt-regulatorio-32b-safe-v2_RAG-TRUE_ENC-cemig-nlp-releases_multilingual-e5-large-ft-v2_RR-cemig-nlp-releases_bge-reranker-v2-m3-ft-v2_context: 模型输出使用的上下文(大字符串类型)

数据集划分

  • 训练集 (train):
    • 样本数量: 447
    • 数据大小: 5,844,757 字节

文件配置

  • 配置名称: default
  • 数据文件路径: data/train-*
  • 下载大小: 2,152,535 字节

数据用途

该数据集主要用于评估多选问答场景下的模型性能,特别是使用RAG(检索增强生成)方法,结合特定嵌入模型(multilingual-e5-large-ft-v2)和重排序模型(bge-reranker-v2-m3-ft-v2)的能源领域GPT(energy-gpt-regulatorio-32b-safe-v2)模型。

搜集汇总
数据集介绍
energy-eval-filtered_responses_multichoice_cemig-rl-releases_energy-gp_459ced03_v3 数据集图片
构建方式
该数据集基于巴西Cemig能源公司的监管领域知识构建,旨在评估大型语言模型在多选题场景下的回答质量。构建过程首先收集与能源监管相关的原始问题,并为每个问题提供多个选项答案。随后,利用rag(检索增强生成)技术,结合嵌入模型与重排序模型,从专业知识库中检索相关上下文信息,以增强模型回答的准确性与可靠性。最终,数据经过过滤与筛选,保留了447条高质量样本,形成训练集。
特点
数据集的核心特点在于其聚焦于能源监管领域的多选问答任务,且每条样本均包含原始问题、带选项的问题、正确答案、基于rag检索增强生成的模型回答及对应的上下文信息。这种结构不仅支持对模型直接回答的评估,还能分析检索与推理过程的影响。此外,数据集较小规模(447条)使其适合用于快速微调与领域适配实验。
使用方法
使用该数据集时,用户可将问题与选项输入至语言模型,并利用提供的answerKey字段评估模型输出的准确性。同时,prompt_rag与context字段可用于复现基于检索增强生成的回答流程,从而对比纯生成与增强生成的效果。数据以JSON格式存储,通过HuggingFace Datasets库加载,支持直接用于训练或评估任务。
背景与挑战
背景概述
该数据集由巴西米纳斯吉拉斯州能源公司(CEMIG)与相关研究团队联合创建,旨在推动大型语言模型在能源监管领域的应用。核心研究问题聚焦于如何通过检索增强生成(RAG)技术,将多语言嵌入模型(如multilingual-e5-large)与重排序模型(如bge-reranker-v2-m3)相结合,提升模型对电力行业复杂监管问题的回答准确性。数据集包含447个训练样本,每个样本由问题、选项及答案构成,并标注了采用不同RAG配置生成的模型响应及检索上下文。该数据集的提出为能源领域专用对话系统的开发提供了评价基准,对推动人工智能在公共事业监管中的落地具有重要示范意义。
当前挑战
领域层面,能源监管问题涉及大量专业术语与动态政策,常规语言模型难以在缺乏上下文的情况下精准作答,亟需构建能够融合领域知识的高效推理框架。构建过程中,团队面临多源异构数据的整合难题,需从海量监管文档中筛选相关片段并设计检索策略,同时平衡检索效率与生成质量。此外,由于训练样本规模有限(仅447条),如何有效利用小样本数据训练模型以避免过拟合,并确保模型在不同监管场景中的泛化能力,构成了另一关键挑战。
常用场景
经典使用场景
在能源领域的智能问答系统构建中,该数据集专为评估和筛选大语言模型在多重选择问题上的表现而设计。其经典使用场景聚焦于对生成式模型输出的反应进行过滤与质量评判,尤其适用于涉及电力监管、能源政策等专业知识的复杂场景。通过question_with_choices字段提供结构化选项,结合answerKey标注的标准答案,研究者可借助该数据集验证模型在信息检索增强生成(RAG)框架下的推理准确性与上下文理解能力,从而推动能源领域专用语言模型从实验走向实用化。
实际应用
在实际产业部署中,该数据集被直接用于训练和校验能源智能助手,例如电力公司面向客户服务的自动问答系统或内部监管合规辅助平台。基于该数据集的评估结果,开发者能够筛选出表现最优的模型版本,并优化其检索-生成流水线中的关键参数,如嵌入模型和重排序器的选择。它帮助减少模型在涉及能源法案、计费规则等敏感话题上的事实性错误,提升了系统在真实业务场景中的可靠性。随着能源行业数字化转型加速,该数据集的应用范围正逐步扩展至需求侧管理、电网调度建议等高级决策支持场景。
衍生相关工作
围绕该数据集已衍生出多项前沿探索,例如针对能源领域大模型的主动学习策略研究,通过分析该数据集中高错误率样本的特征来引导更高效的领域微调。另一项重要工作是开发专用的鲁棒性评估框架,利用该数据集的多样本结构来测试模型在面对具有细微差别的政策选项时的区分能力。此外,研究者基于该数据集还提出了多任务融合评价指标,将答案正确性与检索上下文的相关性进行联合建模,从而更全面地反映RAG系统的综合效能。这些衍生工作不仅深化了对能源大模型行为特性的理解,也为其他垂直领域(如法律、医疗)的类似数据集构建提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务