遇见数据集

distilbert-learning-feedback

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集是一个对话交互数据集,主要包含用户与智能体之间的对话轮次。每条记录包含以下字段:唯一标识符(id)、对话主题(topic)、语域(register)、智能体回复(agent_turn)、用户消息(user_message)、用户状态标签(label,分为四类:Challenged(受到挑战)、Unchallenged(未受挑战)、Frustrated(沮丧)、Lost Focus(失去焦点))、硬负样本标识(hard_negative)以及备注(note)。数据集划分为训练集(604 条样本)和测试集(152 条样本),可用于分类任务,例如分析用户情绪或对话质量。

This dataset is a dialogue interaction dataset that primarily contains conversation turns between users and agents. Each record includes the following fields: unique identifier (id), conversation topic (topic), register (register), agent turn (agent_turn), user message (user_message), user state label (label, with four categories: Challenged, Unchallenged, Frustrated, Lost Focus), hard negative indicator (hard_negative), and note (note). The dataset is split into a training set (604 samples) and a test set (152 samples), and can be used for classification tasks such as analyzing user sentiment or dialogue quality.

创建时间:
2026-08-19
原始信息汇总

数据集概述:distilbert-learning-feedback

基本信息

该数据集名为 distilbert-learning-feedback,托管在 Hugging Face 平台上,主要用于学习反馈相关的分类任务,可支持基于 DistilBERT 模型的训练与评估。

数据特征

数据集包含以下字段:

字段名 类型 说明
id int64 样本唯一标识符
topic large_string 主题信息
register large_string 语域信息
agent_turn large_string 智能体交互内容
user_message large_string 用户消息内容
label class_label 类别标签(4类)
hard_negative int64 困难负样本标记
note large_string 备注信息

标签类别

label 字段为多分类标签,共包含 4 个类别

  • 0:Challenged(受到挑战)
  • 1:Unchallenged(未受挑战)
  • 2:Frustrated(感到沮丧)
  • 3:Lost Focus(失去专注)

数据划分

数据集包含 训练集测试集 两个划分:

划分 样本数量 字节大小
train 604 310,185 字节
test 152 74,053 字节
  • 总样本数:756
  • 下载大小:226,717 字节
  • 数据集总大小:384,238 字节

配置说明

默认配置文件为 default,数据文件路径如下:

  • 训练集:data/train-*
  • 测试集:data/test-*

适用场景

该数据集适用于自然语言处理中的文本分类任务,具体可用于学习反馈场景下的情感或状态识别,帮助模型区分用户在学习交互中是否受到挑战、感到沮丧或失去专注等状态,适合用于训练和评估 DistilBERT 等预训练语言模型的下游微调任务。

搜集汇总
数据集介绍
distilbert-learning-feedback 数据集图片
构建方式
在对话式人工智能与教育反馈分析领域,该数据集通过收集多轮教学交互中的用户反馈信号,构建了具有细粒度情感与参与度标注的资源。其构建过程以主题、语域、代理轮次和用户消息作为输入特征,并由人工或半自动方式对每条用户消息赋予四种标签之一,包括受挑战、未受挑战、沮丧和失去焦点,同时引入困难负样本标志及注释字段,最终划分出604条训练样本与152条测试样本,形成结构化且平衡的反馈分类语料。
特点
该数据集的核心特质在于其标签体系紧密贴合学习过程中的认知与情感状态,涵盖挑战感、挫败感及注意力涣散等维度,超越了传统情感极性的简单二分。数据包含主题与语域元信息,支持跨领域与跨语体的泛化分析,困难负样本的标注有助于评估模型对易混淆样本的区分能力,整体规模适中且划分清晰,适用于细粒度学习反馈识别与对话系统自适应策略研究。
使用方法
使用该数据集时,可将其加载为HuggingFace数据集对象,直接访问训练与测试划分,并以用户消息及上下文特征作为模型输入,标签作为监督目标。典型流程包括文本预处理、特征编码、分类模型微调与评估,借助困难负样本字段可设计对比学习或难例挖掘实验,注释字段则为错误分析与标签可靠性验证提供辅助信息,适用于情感计算、教育数据挖掘及对话系统等任务。
背景与挑战
背景概述
近年来,对话系统与智能教育辅助工具蓬勃发展,对学习者实时反馈的精准识别成为提升教学交互质量的关键。在此背景下,distilbert-learning-feedback数据集应运而生,其创建旨在捕捉学习者在人机对话中表现出的认知与情感状态。该数据集由研究者构建并发布于HuggingFace平台,包含604条训练样本与152条测试样本,涵盖主题、对话轮次、用户消息及四类标签(Challenged、Unchallenged、Frustrated、Lost Focus)。其核心研究问题在于利用轻量级预训练模型DistilBERT对学习反馈进行细粒度分类,从而为智能导学系统提供即时、可解释的状态感知能力。该数据集为教育数据挖掘与情感计算领域提供了宝贵的标注资源,推动了学习反馈自动识别研究的发展。
当前挑战
该数据集所应对的领域问题在于学习反馈的多类别细粒度识别,这要求模型不仅能区分认知挑战与无挑战状态,还需捕捉挫折与注意力流失等复杂情感,其挑战在于类别边界模糊且样本分布可能不均衡。构建过程中,研究团队需确保对话语料的真实性与代表性,同时设计严格的标注规范以降低主观偏差,并引入硬负样本(hard_negative)以增强模型判别力。此外,仅604条训练样本的有限规模对模型泛化能力构成严峻考验,如何在数据稀缺条件下保持对四类反馈的稳健分类,成为该数据集应用与推广的核心挑战。
常用场景
经典使用场景
在智能教育系统与对话式学习平台中,该数据集主要服务于学习反馈的细粒度情感与状态识别任务。研究者通常将其用于训练轻量级文本分类模型,以判别学习者在人机交互过程中所流露的认知与情感状态。数据集涵盖的Challenged、Unchallenged、Frustrated与Lost Focus四类标签,精准刻画了学习反馈中的关键状态维度,使得模型能够在有限的上下文信息下完成多类别判别。此外,数据集中设置的hard_negative字段为对比学习与难例挖掘提供了便利,常被用于评估模型在易混淆样本上的鲁棒性。
衍生相关工作
围绕该数据集,后续研究多沿两条路径展开:其一为模型轻量化与蒸馏方法的探索,借助DistilBERT等紧凑架构验证小规模数据下的分类性能边界;其二为教育对话系统中的状态感知增强,将反馈识别结果作为辅助信号融入辅导策略生成或情感支持对话框架。部分工作亦将其作为难例挖掘与对比学习的评测集,用以检验表征学习在细粒度教育文本上的泛化能力。这些衍生研究共同推动了教育场景下学习者状态建模的规范化与实用化进程。
数据集最近研究
最新研究方向
在对话式人工智能与教育技术交叉领域,基于学习者反馈的情感与认知状态识别正成为前沿方向。distilbert-learning-feedback数据集以轻量级预训练模型DistilBERT为基底,聚焦于学习者在对话交互中的四类状态——受挑战、未受挑战、挫败感与注意力涣散,为细粒度学习情感计算提供标注资源。当前研究趋势倾向于利用此类数据微调模型以实时监测学习体验,并探索硬负样本挖掘对分类鲁棒性的影响。该数据集推动了自适应学习系统与智能辅导的发展,尤其在在线教育场景中,有助于实现及时的教学干预与个性化支持,对提升学习留存率与参与度具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务