遇见数据集

launch/reddit_qg

收藏
Hugging Face2022-11-09 更新2024-03-04 收录
官方服务:

资源简介:

该数据集名为RedditQG,主要包含来自Reddit问答社区的问答对。每个数据实例包含id、qid、answer、question和score字段,其中score表示点赞数减去点踩数。数据集分为训练集、验证集和测试集,分别包含647763、36023和36202个样本。数据集的语言为英语,许可证为CC BY 4.0。

This dataset, named RedditQG, primarily consists of question-answer pairs collected from the Reddit Q&A community. Each data instance includes fields such as id, qid, answer, question, and score, where score refers to the number of upvotes minus downvotes. The dataset is divided into training, validation, and test sets, which contain 647,763, 36,023, and 36,202 samples respectively. The dataset is in English and licensed under CC BY 4.0.

提供机构:
launch
原始信息汇总

数据集概述

数据集名称

  • RedditQG

数据集摘要

  • 该数据集包含来自Reddit问答社区的问答对。

支持的任务和排行榜

  • 信息待补充

语言

  • 英语

数据集结构

数据实例

  • 示例结构如下:

    { "id": "askscience/123", "qid": "2323", "answer": "A test answer.", "question": "A test question?", "score": 20 }

数据字段

  • id: 字符串类型
  • qid: 字符串类型,同一问题可能有多个答案
  • answer: 字符串类型
  • question: 字符串类型
  • score: 整数类型,表示upvotes - downvotes的值

数据分割

  • 训练集: 647763
  • 验证集: 36023
  • 测试集: 36202

数据集创建

源数据

  • 源语言生产者: Reddit用户

个人和敏感信息

  • 含有辱骂性语言的样本被丢弃,但可能存在包含个人信息的样本

许可证信息

  • CC BY 4.0
搜集汇总
数据集介绍
launch/reddit_qg 数据集图片
构建方式
RedditQG数据集源自Reddit平台上的问答社区,通过采集用户生成的回答-问题对构建而成。数据收集过程中,研究团队从多个子版块中提取自然涌现的问答交互,并依据专家制定的标注规范进行筛选与清洗,剔除包含辱骂性词汇的样本。每条数据实例包含唯一标识符、问题ID、回答文本、问题文本及由点赞数与点踩数差值构成的得分字段。数据集划分为训练集、验证集和测试集,分别包含约64.8万、3.6万和3.6万个样本,为开放域问题生成任务提供了大规模、高质量的语料基础。
使用方法
研究人员可利用该数据集进行开放域问题生成模型的训练与评估,特别是结合问题类型本体论来探索可控生成策略。使用时,可直接加载HuggingFace上的预划分数据分割,通过字段提取答案与问题对作为输入输出序列。数据集适配序列到序列的生成框架,也可用于问题类型分类或问答质量分析等下游任务。鉴于数据来源于公共社区,需注意其中可能隐含的个人信息,并在应用时遵循CC BY 4.0许可协议进行引用与分发。
背景与挑战
背景概述
在自然语言处理领域,自动问题生成(Question Generation, QG)是一项旨在从给定文本中自动生成有意义问题的关键任务,其对于提升问答系统、对话代理及教育辅助工具的交互能力具有重要意义。RedditQG数据集由Shuyang Cao与Lu Wang于2021年在ACL会议上提出,依托于Reddit这一大型在线社区中丰富的问答对资源构建而成。该数据集的核心研究问题在于探索可控的开放式问题生成,区别于传统仅依赖疑问词分类的浅层方法,研究者引入了一种新颖的问题类型本体(Question Type Ontology),以更精细地刻画问题的语义差异。通过收集来自Reddit各子版块的高质量问答对,并辅以专家标注,RedditQG为可控问题生成研究提供了规模达数十万实例的基准资源,推动了该领域从简单句型生成向语义可控、多样性增强的方向演进。
当前挑战
RedditQG数据集所面临的挑战首先体现在其解决的领域问题上:开放式问题生成任务要求模型不仅理解文本中的事实信息,还需把握其语义范围与逻辑结构,以生成涵盖多句回答的复杂问题,这显著增加了模型对上下文理解与推理的难度。在数据集构建过程中,挑战则更加多元:其一,从Reddit海量用户生成内容中筛选出符合学术质量的问答对,需剔除包含辱骂或不当信息的样本,同时处理用户隐私泄露的潜在风险;其二,问题类型本体的定义需要专家对开放式问题的细微语义差异进行精确分类,这一标注过程既耗时又依赖深厚的语言学知识;其三,数据集来源的社区语言风格多样,存在大量非正式表达与语法偏差,对模型的鲁棒性提出了额外考验。
常用场景
经典使用场景
RedditQG数据集收录了来自Reddit问答社区的海量答案-问题对,其经典使用场景集中于可控开放性问题生成(Controllable Open-ended Question Generation)研究。该数据集为模型提供了丰富的问答实例,使研究者能够基于答案反向生成高质量、多样化的开放性问题,尤其适用于需要捕捉问题细微语义差异的场景。通过利用其标注的问题类型本体(Question Type Ontology),研究人员可以训练模型理解不同问题类别(如解释型、因果型、对比型)的内在结构,从而生成更具针对性和语义准确性的问题。这一场景在自然语言处理领域具有重要地位,为提升机器对复杂语言交互的理解能力提供了坚实的数据基础。
解决学术问题
该数据集有效解决了开放性问题生成领域中缺乏细粒度标注和可控性差的核心学术难题。传统问题生成研究多聚焦于事实性、单句可答的封闭式问题,而RedditQG通过引入新定义的问题类型本体,使得模型能够区分并生成通常需要多句回答的开放性问题。它攻克了如何联合预测问题焦点(question focus)与生成问题文本的挑战,并借助语义图表示增强对问题结构的建模。这一贡献显著提升了生成问题的可回答性、范围覆盖度和整体质量,推动了问答系统、教育评估和对话智能等方向的理论发展,为后续研究树立了重要的基准。
实际应用
在实际应用层面,RedditQG数据集赋能了多个领域的智能化升级。在教育科技中,它可驱动自动出题系统,根据教材或文章内容生成多样化的思考题与讨论题,辅助教师进行个性化教学和评估。在智能客服与对话机器人领域,该数据集训练出的模型能够根据用户历史表述自发提出澄清性或引导性问题,从而提升交互的深度与用户满意度。此外,它还可用于内容创作辅助工具,帮助作者从给定文本中提炼出富有启发性的问题,激发读者思考。这些应用场景均受益于数据集对开放性问题多样性和可控性的强化,展现出广泛的社会与经济价值。
数据集最近研究
最新研究方向
RedditQG数据集聚焦于开放域问题生成这一前沿课题,其核心贡献在于提出了一种细粒度的问题类型本体论,突破了传统基于疑问词分类的局限。该数据集从Reddit问答社区中提取了大规模、高质量的答案-问题对,为可控且多样化的开放域问题生成任务提供了关键支撑。结合语义图表示与模板增强技术,研究者能够同时预测问题焦点并生成逻辑连贯的疑问句,显著提升了生成问题的可回答性与覆盖面。这一方向与自然语言处理中对话系统、智能教育及知识图谱构建等热点应用紧密相连,推动了模型从简单事实询问向复杂语境推理的跃迁,对提升人机交互的深度与自然性具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务