SarcasmExplain-5K
收藏资源简介:
SarcasmExplain-5K是一个包含5,000个Reddit讽刺实例的平衡数据集,标注了五种互补的自然语言解释类型,通过系统的GPT-4流程生成并通过众包人类评估验证。与仅提供二进制标签的现有讽刺数据集不同,该数据集提供了丰富的多视角解释,支持可解释AI、实用语言理解和人机交互研究。
SarcasmExplain-5K is a balanced dataset containing 5,000 Reddit sarcasm instances, annotated with five complementary natural language explanation types generated via a systematic GPT-4 pipeline and validated through crowdsourced human evaluation. Unlike existing sarcasm datasets that only provide binary labels, this dataset offers rich multi-perspective explanations to support research in explainable AI, practical language understanding, and human-computer interaction.
SarcasmExplain-5K 数据集概述
基本信息
- 数据集名称:SarcasmExplain-5K: Multi-Perspective Sarcasm Explanation Dataset
- 创建者:Maliha Binte Mamun
- 创建年份:2025
- 数据集规模:5,000 个实例
- 数据平衡:2,500 个讽刺实例,2,500 个非讽刺实例
- 数据来源:Reddit 对话
- 生成模型:OpenAI GPT-4
- 代码许可证:MIT License
- 数据集许可证:CC BY 4.0
数据集内容与特点
- 核心特点:为每个讽刺实例提供了五种互补的自然语言解释类型。
- 解释类型:
- 认知解释:解释心智为何识别出讽刺——说话者所调用的信念或知识。
- 基于意图的解释:解释说话者的交际目标——他们在社交或情感上试图实现什么。
- 对比解释:讽刺与真诚版本的比较——真实的版本会是什么样子。
- 文本解释:识别表明讽刺的语言特征——措辞、语气、夸张。
- 基于规则的解释:识别形式语言标记——标点、语域转换、夸张。
- 数据列:
label:0 = 非讽刺,1 = 讽刺label_name:"sarcastic" 或 "non_sarcastic"comment:原始 Reddit 评论parent_comment:对话上下文rephrased_comment:评论的非讽刺释义cognitive_explanation:心智推理视角的解释intent_based_explanation:说话者交际目标的解释contrastive_explanation:讽刺与真诚对比的解释textual_explanation:语言分析视角的解释rule_based_explanation:识别出的语言标记的解释
数据获取方式
- 完整数据集:托管在 HuggingFace,采用门控访问。
- 访问条件:免费,但需贡献少量标注工作以换取访问权限。
- 获取步骤:
- 访问 https://maliha-usui.github.io/sarcasm-explain-5k/annotate.html,选择任一开放的认知或基于意图的评估表单进行标注。
- 为 10 个讽刺解释的清晰度评分(1-5 分),并可选择提出改进建议(约 8 分钟)。
- 提交后,在标注页面输入您的表单 ID 以获取唯一的完成代码。
- 访问 https://maliha-usui.github.io/sarcasm-explain-5k/access.html,验证您的代码,然后将其粘贴到 HuggingFace 访问请求表单中。
- 审批时间:提交后 24-48 小时内批准。
- 数据预览:提供包含 8 个实例的样本文件
data/sample_data.csv供免费访问。
人工评估框架
- 评估重点:认知解释和基于意图的解释。
- 评估规模:每种解释类型有 50 个评估表单,每个表单包含 10 个实例。
- 评估任务:
- 为每个解释的清晰度评分(1-5 李克特量表)。
- 同意或不同意生成的解释。
- 如果解释不清楚或不准确,可编写修正(可选)。
- 评估表单池:
- 认知解释:表单 ID COG001 – COG050,共 50 个表单,500 个实例。
- 基于意图的解释:表单 ID INT001 – INT050,共 50 个表单,500 个实例。
- 完成代码格式:
SE5K-[表单ID]-[哈希值]。
应用领域
- 可解释人工智能
- 讽刺检测
- 语用自然语言处理
- 认知建模
- 人机交互
引用格式
bibtex @misc{mamun2025sarcasmexplain, author = {Mamun, Maliha Binte}, title = {SarcasmExplain-5K: A Multi-Perspective Sarcasm Explanation Dataset}, year = {2025}, publisher = {GitHub / HuggingFace}, url = {https://huggingface.co/datasets/maliha/sarcasm-explain-5k}, note = {Independent research. Contact: bintemaliha19@gmail.com} }




