遇见数据集

human_study

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

该数据集名为Human Study,是一个用于文本生成任务的小型英语数据集。其内容源自snap-stanford/user_study_annotations数据集,由Reddit上的自由形式人类回复构成,原始Reddit帖子文本来自HumanLM作者提供的reddit_post_dict_testset.json文件。每条数据样本包含两个核心字段:prompt字段存储原始的Reddit帖子文本,target字段存储由人类研究参与者针对该帖子撰写的自由形式回复。数据集明确排除了模型生成的回复、生成的人物设定、比较判断以及工作者标识符等信息。在数据处理上,基于特定的源注释修订版本和随机种子,对数据进行了去重处理,确保每个唯一的post_id仅随机保留一条注释,且post_id在整个数据集中具有唯一性。数据集被划分为两个部分:少样本训练集(train)和测试集(test)。训练集由5条最紧凑(旨在适应小模型上下文窗口)的选定数据行组成;测试集则包含其余所有唯一的帖子,共59条数据。数据集的提示格式经过特殊设计:以Post:开头展示原始帖子,后接Response:提示词(该词末尾精确包含一个ASCII空格,以便与lm-eval等评估工具兼容,实现在自然令牌边界开始生成),target即为紧接其后的参与者原始回复文本。

The dataset named Human Study is a small English dataset for text generation tasks. Its content is derived from the snap-stanford/user_study_annotations dataset, consisting of free-form human responses from Reddit. The original Reddit post text comes from the reddit_post_dict_testset.json file provided by the HumanLM authors. Each data sample includes two core fields: the prompt field stores the original Reddit post text, and the target field stores the free-form responses written by human study participants for that post. The dataset explicitly excludes model-generated responses, generated personas, comparative judgments, and worker identifiers. In data processing, deduplication is performed based on specific source annotation revision versions and random seeds, ensuring that only one annotation is randomly retained for each unique post_id, and post_id is unique throughout the dataset. The dataset is divided into two parts: a few-shot training set (train) and a test set (test). The training set consists of 5 selected data rows that are most compact (aimed at fitting small model context windows); the test set contains all other unique posts, totaling 59 data points. The prompt format of the dataset is specially designed: it starts with Post: to display the original post, followed by the Response: prompt (which ends with exactly one ASCII space to ensure compatibility with evaluation tools like lm-eval, enabling generation at natural token boundaries), and the target is the participants original response text immediately following.

创建时间:
2026-07-26
原始信息汇总

数据集概述:human_study

数据内容

  • 每一行包含:
    • prompt:原始Reddit帖子的文本。
    • target:由人类研究参与者撰写的回复。
  • 排除了模型生成的回复、生成的人物画像、比较判断以及工作人员标识符。

去重与数据划分

  • 源标注修订版本b19978763f7a1e4fcf71c2facfa65af0136cc425
  • 随机种子42
  • 去重规则:每个唯一的 post_id 随机选择一条标注。
  • post_id 在整个派生数据集中唯一。
  • 划分方式
    • 训练集 (train):选取最紧凑的5行作为少样本训练集,以适应当小模型上下文窗口。
    • 测试集 (test):所有剩余的唯一条目构成评分测试集。
  • 数据量
    • 训练集:5行
    • 测试集:59行

提示词格式

  • 固定提示模板:

    Post: <原始Reddit帖子>

    Response:<SPACE>

  • 说明Response: 提示以恰好一个ASCII空格结尾,以便lm-eval可以附加少样本目标,并在自然token边界开始生成。

  • 目标:参与者的原始自由形式回复。

搜集汇总
数据集介绍
human_study 数据集图片
构建方式
人类研究数据集源于对Reddit平台自由文本回复的系统性整理,其原始数据来自snap-stanford/user_study_annotations语料库及HumanLM作者提供的reddit_post_dict_testset.json文件。在构建过程中,研究者以固定随机种子42对标注数据进行严格去重,确保每篇原始Reddit帖子仅保留一条随机选取的标注结果,且post_id在数据集中具有唯一性。最终选取5条最精简的标注样本构成训练集,以适配小规模模型对上下文窗口的严苛要求,其余59条样本则归入测试集。
特点
该数据集聚焦于保留人类受试者生成的原始自由文本回复,刻意排除了模型生成的回复、人格画像、对比判断及工作者标识等附属信息,从而构建出纯净的人机语言对比基准。每个数据条目均包含原始Reddit帖文及其对应的人类受试者回复,以简洁的键值结构呈现,避免了冗余标注对语言分析产生的干扰。数据集规模精巧,仅包含64条样本,却同时具备了训练与评估的双重功能,为小样本学习和模型泛化能力测试提供了理想实验平台。
使用方法
数据集的使用需遵循预设的提示词协议,即以"Post:\n<原始帖文>\n\nResponse: "的格式构造输入,其中Response:后紧随一个ASCII空格,便于lm-eval工具追加小样本目标并确保生成起始于自然词边界。训练集中5条样本可直接用于少样本学习场景,测试集则用于评估模型对人类自由文本回复的生成能力。目标文本即为受试者提供的原始回复,研究者可借此量化模型输出与人类语言习惯的契合程度,或作为语言生成任务的对照基准。
背景与挑战
背景概述
在自然语言生成领域,如何让模型生成更具人性化、语境贴切的回复一直是核心挑战之一。human_study数据集由斯坦福大学SNAP实验室于近年创建,基于Reddit平台用户自发的自由形态回复构建,旨在为文本生成任务提供真实的人类对话样本。该数据集源自HumanLM项目的研究工作,原始数据来源于用户研究注释,经过精心清洗与去重,最终保留了64条高质量的人机对比样本。通过保留原始Reddit帖文及参与者撰写的回复,而排除模型生成内容、人格化标签及比较评判,数据集聚焦于捕捉人类回复的自然性与多样性,为少样本学习与模型评估提供了可量化的基准。其发布推动了对话系统在真实场景中理解人类交流模式的研究进展。
当前挑战
human_study数据集所解决的领域问题在于弥合机器生成文本与人类自然表达之间的鸿沟。传统文本生成模型常受限于模板化与机械性回复,难以模拟人类在语境理解、情感共鸣和语用灵活性方面的表现。该数据集通过提供有限但高质的少样本示例(5条训练样本),探索了在小规模数据条件下如何激发模型对人类回复模式的迁移学习能力。构建过程中面临的主要挑战包括:从原始Reddit帖子中筛选具有代表性且无偏见的回复样本,确保标注一致性;精心设计提示格式以适配小模型上下文窗口,避免长文本截断导致语义丢失;同时排除工人标识符和比较判断,以维护数据纯净性和研究可复现性,从而在紧凑数据量下兼顾泛化能力与评估可靠性。
常用场景
经典使用场景
在自然语言生成与人类对齐的研究中,human_study数据集为评估模型生成的文本是否贴近人类表达习惯提供了珍贵的基准。该数据集精选自Reddit平台上的真实用户帖文与自由创作回应,保留了人类自然交流的语境与风格。研究者可利用其精心划分的极少量训练样本(5条)与测试集(59条),在有限的模型上下文窗口内开展小样本学习实验,或借助标准化的prompt格式无缝集成至lm-eval等评估框架中,从而系统性地度量生成文本在语义连贯性、情感适配性及风格一致性上与人类回答的偏差。这一设计使得它尤其适合用于验证对话系统、文本续写及社交网络内容生成等任务的生成质量。
衍生相关工作
围绕human_study数据集的独特结构,研究者已衍生出多项富有启发性的工作。一方面,其随机种子划分与去重策略被借鉴用于构建更为鲁棒的小样本评估集合,从而降低了数据噪声对模型排名的干扰;另一方面,该数据集激发了对“人类与模型回答的差异性来源”的深入探讨,催生了诸如基于层次化风格特征的生成质量探测方法、以及利用人机对比进行对抗训练以增强模型抗幻觉能力等方向。这些后续研究共同拓展了人机文本对齐的测量空间,使得human_study不仅是一个静态基准,更成为推动文本生成评估方法迭代创新的重要灵感来源。
数据集最近研究
最新研究方向
该数据集聚焦于人类自由文本回复的生成与评估,在自然语言处理前沿领域,正被用于探究大语言模型在模拟人类对话风格时的对齐程度。结合Reddit社区的真实交互场景,研究者基于此数据集开展人机对比研究,旨在量化模型生成文本与人类原生回复在语义、风格及隐含意图上的差异。这一方向与当前AI伦理与可解释性热点紧密关联,其意义在于为模型训练提供更精细的行为参考标尺,推动生成式语言技术向更自然、更可信的方向演进,同时避免过度拟人化带来的误导风险。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务