declare-lab/InstructEvalImpact
收藏资源简介:
IMPACT数据集包含200个由人类创建的提示,分为四个类别:信息性写作、专业性写作、论证性写作和创造性写作。这些提示用于测试大型语言模型(LLMs)的写作能力。信息性写作包括自我帮助建议或各种概念的解释;专业性写作涉及商业环境中的演示文稿或电子邮件建议;论证性写作涉及伦理和社会问题的辩论立场;创造性写作包括故事、诗歌和歌曲等多种写作形式。该数据集包含在我们的InstructEval基准套件中。
The IMPACT dataset contains 200 human-created prompts divided into four categories: informative writing, professional writing, argumentative writing, and creative writing. These prompts are designed to evaluate the writing capabilities of large language models (LLMs). Informative writing encompasses self-help advice or explanations of diverse concepts; professional writing covers presentation or email drafting guidance for business scenarios; argumentative writing centers on debating stances regarding ethical and social issues; creative writing includes various literary forms such as stories, poems, and songs. This dataset is included in our InstructEval benchmark suite.
数据集概述
数据集名称
IMPACT
数据集内容
IMPACT数据集包含200个人类创建的提示,用于测试大型语言模型(LLMs)的一般写作能力。这些提示分布在四个不同的使用场景中:
- Informative Writing: 包括自我帮助建议或各种概念解释的用户查询。
- Professional Writing: 涉及商业环境中的建议演示或电子邮件格式。
- Argumentative Writing: 关于伦理和社会问题的辩论立场。
- Creative Writing: 包括故事、诗歌和歌曲等多种写作格式。
数据集用途
该数据集用于评估LLMs在写作任务中的表现,如撰写信件或伦理辩论。
数据集评估方法
使用ChatGPT评估LLMs生成的答案质量,评估标准包括:
- Relevance: 答案与给定提示的相关性。
- Coherence: 文本质量,如组织和逻辑流。 每个答案根据Likert量表从1到5进行评分。
数据集评估结果
评估结果显示了不同模型在各个写作场景下的相关性和一致性得分。例如,ChatGPT在所有场景中的平均相关性得分为3.78,一致性得分为3.93。
数据集引用
若使用此数据集,请引用以下文章: bibtex @article{chia2023instructeval, title={INSTRUCTEVAL: Towards Holistic Evaluation of Instruction-Tuned Large Language Models}, author={Yew Ken Chia and Pengfei Hong and Lidong Bing and Soujanya Poria}, journal={arXiv preprint arXiv:2306.04757}, year={2023} }




