cemig-ceia-v2/energy_D_eval_responses_multichoice_cemig-temp_qwen3-4b-dw-lr_v3
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: question dtype: large_string - name: question_with_choices dtype: large_string - name: answerKey dtype: large_string - name: cemig-temp_qwen3-4b-dw-lr_RAG-FALSE_ENC-none_RR-none dtype: large_string - name: prompt_no_rag dtype: large_string splits: - name: train num_bytes: 4536560 num_examples: 103 download_size: 1940751 dataset_size: 4536560 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
cemig-ceia-v2搜集汇总
数据集介绍

构建方式
该数据集立足于能源领域知识评估的迫切需求,以多选问答形式构建,旨在系统考察语言模型对能源相关专业知识的掌握程度。构建过程中,研究者首先汇集了涵盖能源基础理论、技术应用与政策法规等维度的原始问题,并为每道题目配备完整的选项文本与标准答案键。随后利用特定模型配置(cemig-temp_qwen3-4b-dw-lr_v3)在封闭与检索增强两种条件下生成模型应答,最终形成包含原始问题、带选项问题、答案键及模型回答的统一结构化记录,共计103条训练样本。
特点
数据集在结构与内容上体现出鲜明的领域针对性。其问题覆盖能源科学核心主题,兼具专业深度与知识广度,能够有效检验模型在专门学科上的理解与推理能力。数据字段设计精巧,除标准问答要素外,还保留了区分提示策略的应答文本,便于对比模型在有无外部知识支持时的表现差异。样本规模适中而信息密度较高,所有条目均以长文本形式存储,确保题干与选项的完整语义得以保留,为细粒度分析模型行为提供了可靠基础。
使用方法
该数据集主要服务于能源领域语言模型的评估与诊断。使用者可将question与question_with_choices字段作为输入,调用模型生成预测答案,并与answerKey进行精确匹配以计算准确率。针对cemig-temp_qwen3-4b-dw-lr_RAG-FALSE_ENC-none_RR-none字段,可直接分析特定模型配置下的既有输出,或以此为基线比较不同模型与提示策略的效果。数据以单一train划分提供,加载后即可用于批量推理或逐题分析,亦适合作为构建更广泛能源知识评测基准的组成单元。
背景与挑战
背景概述
随着能源领域智能化转型的加速,面向电力系统决策支持的自然语言处理需求日益凸显。该数据集由CEMIG(巴西米纳斯吉拉斯州能源公司)相关研究团队构建,依托Qwen3-4B模型并引入知识蒸馏与低秩适配技术,旨在评估大语言模型在能源领域多项选择题上的推理能力。数据集包含103个训练样本,每个样本涵盖问题、选项、答案键及模型生成响应,聚焦于检索增强生成(RAG)关闭条件下的模型表现。其核心研究问题在于探索领域自适应微调对能源专业问答的增益效果,为后续能源垂直领域模型评测提供了基准,对推动电力行业智能问答系统的发展具有参考价值。
当前挑战
该数据集所应对的领域问题在于能源专业多项选择题的自动推理与精准作答,要求模型不仅理解电力系统术语,还需在无外部知识检索条件下完成复杂逻辑判断。构建过程中面临多重挑战:能源领域标注数据稀缺,高质量问题与选项设计需兼顾专业准确性与语言多样性;模型响应涉及RAG关闭与开放生成两种模式,如何公平比较不同配置下的表现成为难点;此外,样本量有限(仅103例)可能导致评测结果方差较大,难以充分反映模型泛化能力;知识蒸馏与低秩适配的联合训练策略亦需平衡计算效率与领域适应效果,避免过拟合或灾难性遗忘。
常用场景
经典使用场景
在能源领域知识评测与生成式语言模型评估的交叉地带,该数据集呈现出一种典型的多选题问答评测范式。其经典使用场景聚焦于对微调后的大规模语言模型进行领域知识掌握程度的量化诊断,具体借助包含问题题干、带选项形式、标准答案以及模型在无检索增强条件下生成的响应等多维字段,构成一套结构化的评测基准。研究者通过比对模型输出与标准答案,能够系统性地衡量模型在能源电力专业情境中的语义理解与选项判别能力,从而为模型迭代提供可复现的参照标尺。
衍生相关工作
围绕该数据集,衍生工作主要沿着领域评测基准构建与微调策略分析两条脉络展开。一方面,后续研究可基于其字段结构扩展更多电力子领域题目,形成规模更大的专业评测集合;另一方面,模型响应字段为分析特定微调方法在领域问答中的行为模式提供了素材,可能催生关于提示工程、知识注入与答案校准的对比实验。这些工作共同丰富了能源领域语言模型评测的方法论积累,并为构建更完善的领域评估生态提供了可借鉴的样本组织方式。
数据集最近研究
最新研究方向
能源领域多选题评估数据集的研究正朝着检索增强生成(RAG)与领域大模型微调的深度融合方向演进。该数据集通过对比有无RAG及不同编码策略下Qwen3-4B模型的回答质量,为量化RAG在电力知识问答中的增益提供了基准。前沿工作聚焦于利用此类评估数据优化检索器与生成器的协同训练,探索多选场景下模型对能源术语和复杂推理链的鲁棒性。伴随全球能源数字化转型与智能电网建设热潮,该方向对提升电力系统决策支持的可靠性具有关键意义,推动了领域专用评估基准的标准化进程。
以上内容由遇见数据集搜集并总结生成



