遇见数据集

TIGER-Lab/MetricInstruct

收藏
Hugging Face2023-12-03 更新2024-03-04 收录
官方服务:

资源简介:

MetricInstruct数据集包含44K个四元组,形式为(指令、输入、系统输出、错误分析),涵盖了6种文本生成任务和22个文本生成数据集。该数据集用于微调TIGERScore模型,这是一个遵循指令指导的、可解释且无需参考的文本生成任务评估模型。数据集的构建基于三个标准:数据集多样性、错误覆盖率和质量保证。数据来源包括真实世界的系统输出和合成输出,确保了错误分布与实际情况一致。数据格式为(instruction, input, system output, error analysis),并提供了格式化数据的代码示例。

The MetricInstruct dataset contains 44K quadruples in the form of (instruction, input, system output, error analysis), covering 6 text generation tasks and 22 text generation datasets. This dataset is used for fine-tuning the TIGERScore model, an instruction-following, interpretable and reference-free text generation evaluation model. The dataset is constructed based on three criteria: dataset diversity, error coverage and quality assurance. Its data sources include real-world system outputs and synthetic outputs, ensuring that the error distribution is consistent with real-world scenarios. The data is formatted as (instruction, input, system output, error analysis), and code examples for formatting the data are provided.

提供机构:
TIGER-Lab
原始信息汇总

MetricInstruct 数据集概述

数据集描述

MetricInstruct 数据集包含 44K 个四元组,形式为 (instruction, input, system output, error analysis),用于 6 种文本生成任务和 22 个文本生成数据集。该数据集用于微调 TIGERScore,这是一种遵循指令指导的训练指标,用于对广泛的文本生成任务进行可解释和无参考的评估。

数据集构建标准

  1. 数据集多样性:选择 22 个独特的数据集作为源上下文,以覆盖足够的生成任务。
  2. 错误覆盖:采用 50 多个文本生成系统的输出,以覆盖所有类型的错误并保证平衡分布。
  3. 质量保证:为了确保 MetricInstruct 适合收集深入的错误分析,通过提示 OpenAI GPT 模型并使用不同的启发式方法过滤,以消除低质量的错误分析。

数据来源

系统输出来自两个渠道:真实世界系统输出和合成输出。真实世界系统输出来自真实系统,确保错误分布与真实世界一致。

任务 真实世界数据集 输出来源 合成数据集 输出来源
摘要 SummEval, XSum, Newsroom, SAMSum 27 系统 CNN/DM, XSum, Gigaword, SAMSum GPT-4
翻译 WMT 18 系统 WMT GPT-4
数据到文本 WebNLG-2020, WikiTableText, ToTTo 17 系统 WikiTableText, Dart, ToTTo GPT-4
长篇问答 ASQA, FeTaQA, CosmosQA, ELI5 5 系统 ASQA, FeTaQA, Cosmos QA, ELI5 GPT-4
数学问答 GSM8K 5 系统 N/A N/A
指令 MixInstruct 11 系统 AlpacaFarm, OASST1, Guanaco, Dolly GPT-4

数据格式

数据集包含 44K 个四元组,形式为 (instruction, input, system output, error analysis)。每个条目包括任务指令、输入源、生成的输出和由 ChatGPT 或 GPT-4 给出的错误分析。

格式化

为了将数据字段格式化为单个提示以进行微调或测试,提供了以下代码供用户参考: python FINETUNE_INST = "You are evaluating errors in a model-generated output for a given instruction." FINETUNE_INPUT = """ Instruction: ${generation_instruction} ${input_context}

Model-generated Output: ${hypothesis_output}

For each error you give in the response, please also elaborate the following information:

  • error location (the words that are wrong in the output)
  • error aspect it belongs to.
  • explanation why its an error, and the correction suggestions.
  • severity of the error ("Major" or "Minor").
  • reduction of score (between 0.5 and 5 given the severity of the error)

Your evaluation output: """ inst_part = Template(FINETUNE_INST) inst_part = inst_part.substitute() input_part = Template(FINETUNE_INPUT) input_part = input_part.substitute( generation_instruction=instruction, input_context=input_context, hypothesis_output=hypo_output ) prompt = (inst_part + " " + input_part).strip(" ") + " " encodings = tigerscore_tokenizer(prompt, return_tensors="pt") input_ids = encodings["input_ids"].to(tigerscore_model.device) attention_mask = encodings["attention_mask"].to(tigerscore_model.device)

示例格式化提示

txt You are evaluating errors in a model-generated output for a given instruction. Instruction: Translate the following text from German to English. Der künftige EM-Cheforganisator Philipp Lahm soll laut Grindel im DFB-Präsidium mitarbeiten.

Model-generated Output: According to Grindel, the future head of the European Championships, Philipp Lahm, is to participate in the DFB Presidency.

For each error you give in the response, please also elaborate the following information:

  • error location (the words that are wrong in the output)
  • error aspect it belongs to.
  • explanation why its an error, and the correction suggestions.
  • severity of the error ("Major" or "Minor").
  • reduction of score (between 0.5 and 5 given the severity of the error)

Your evaluation output:

搜集汇总
数据集介绍
TIGER-Lab/MetricInstruct 数据集图片
构建方式
在自然语言处理领域,文本生成任务的自动评估长期面临可解释性不足与参考依赖的挑战。TIGER-Lab/MetricInstruct数据集应运而生,旨在为可解释且免参考的评估指标TIGERScore提供微调训练数据。该数据集构建遵循三大核心原则:首先,通过精选22个具有代表性的文本生成数据集作为源语境,确保任务类型的多样性覆盖;其次,从50余个文本生成系统中采集系统输出,以囊括各类错误类型并维持均衡分布;最后,借助OpenAI GPT模型生成错误分析后,采用多重启发式规则进行过滤,剔除低质量分析,从而保障数据深度与可靠性。最终形成了包含44K条四元组(指令、输入、系统输出、错误分析)的高质量数据集,横跨摘要、翻译、数据到文本、长格式问答、数学问答和指令遵循六大文本生成任务。
使用方法
使用MetricInstruct数据集进行模型微调或测试时,需按照特定模板格式化数据字段以构建提示。具体而言,将任务指令、输入上下文和模型生成输出嵌入预设的评估指令模板中,该模板要求模型逐条分析输出中的错误,涵盖错误位置、所属方面、解释与修正建议、严重程度(主要或次要)及对应分数扣减(0.5至5分)。例如,对于翻译任务,提示会要求模型评估德语到英语的译文错误。格式化后的提示可直接输入TIGERScore模型进行编码与推理。研究人员可参考官方提供的Python代码示例,利用jinja2模板库动态生成提示,并通过tokenizer与模型进行交互,从而复现或扩展TIGERScore的评估能力。
背景与挑战
背景概述
在自然语言处理领域,文本生成任务的评估长期依赖传统自动指标(如BLEU、ROUGE),这些指标难以捕捉语义细微差异且缺乏可解释性。为解决这一困境,TIGER-Lab研究团队于2023年提出了MetricInstruct数据集,该数据集由44K条四元组(指令、输入、系统输出、错误分析)构成,覆盖摘要、翻译、数据到文本、长文本问答、数学推理与指令遵循六大文本生成任务,整合了22个代表性数据集。其核心研究问题在于构建一种可解释且无需参考的评估框架——TIGERScore,通过指令微调使模型具备对生成文本进行细粒度错误定位与评分的能力。该数据集的创建标志着文本生成评估从单一数值指标向可解释性分析的范式转变,为提升生成系统的鲁棒性与可信度提供了关键资源。
当前挑战
MetricInstruct数据集所解决的领域挑战在于传统评估指标无法提供错误成因的深度解析,而构建过程本身亦面临多重困难。其一,需确保数据多样性以覆盖多种生成任务,因此研究者从50余个真实与合成系统中收集输出,但不同任务间错误类型分布差异显著,平衡各类错误比例成为难点。其二,错误分析的质量保障至关重要,尽管采用GPT模型生成分析,但需通过启发式过滤剔除低质量样本,避免噪声误导模型。其三,真实系统输出的获取受限于可用性,部分任务需依赖合成数据补充,而合成数据与真实场景的偏差可能影响评估泛化能力。此外,数据标注缺乏统一标准,错误定位与严重性分级的主观性增加了构建一致性数据集的复杂性。
常用场景
经典使用场景
MetricInstruct数据集最经典的使用场景在于微调TIGERScore模型,使其能够对多种文本生成任务进行可解释、无参考的自动评估。该数据集精心构建了44K条四元组,涵盖摘要、翻译、数据到文本、长问答、数学推理和指令遵循六大生成任务,并整合了来自50余个真实与合成系统的输出。通过这种丰富的错误覆盖与任务多样性,研究者得以训练出一个能够精准定位错误位置、分类错误类型、提供修正建议并量化严重程度的评估指标,从而替代传统依赖人工或参考文本的评估范式。
解决学术问题
该数据集核心解决了文本生成评估中长期存在的两大难题:一是缺乏可解释性,传统自动指标如BLEU或ROUGE仅给出分数,无法揭示错误根源;二是过度依赖参考文本,在开放生成场景中参考文本往往缺失或不唯一。MetricInstruct通过引入GPT-4生成的高质量错误分析,使TIGERScore模型得以学习细粒度的错误诊断能力。这一突破推动了评估指标从黑盒打分向透明诊断的范式转变,为自然语言处理领域提供了更可靠、更深入的评估工具,显著提升了生成系统改进的针对性。
实际应用
在实际应用中,MetricInstruct驱动的TIGERScore模型可无缝嵌入文本生成系统的开发与迭代流程。例如,在机器翻译产品中,该模型能自动检测译文中的漏译、过度意译或术语错误,并给出具体定位与修正建议;在对话系统或摘要生成工具中,它可实时评估输出质量,帮助开发者快速定位逻辑矛盾或信息缺失。此外,该评估框架无需参考文本,使其特别适用于开放域问答、创意写作等难以获取标准答案的场景,大幅降低了人工评估成本,加速了生成模型的落地部署。
数据集最近研究
最新研究方向
随着大规模语言模型在文本生成任务中的广泛应用,如何准确、可解释地评估生成质量成为前沿焦点。MetricInstruct数据集应运而生,它汇聚了来自22个数据集和50余个生成系统的44K条四元组,覆盖摘要、翻译、数学推理等六大任务,系统性地捕获了真实与合成场景中的各类错误类型。该数据集驱动了TIGERScore这一遵循指令引导、无需参考的可解释评估指标的研发,突破了传统自动评估指标在可解释性和任务泛化性上的瓶颈。通过与GPT模型协同构建并经过严格质量筛选,MetricInstruct不仅为无参考评估提供了高质量训练资源,还推动了文本生成评估从单一分数迈向细粒度错误分析的前沿范式,对提升生成系统的可靠性与透明度具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务