遇见数据集

Chumor

收藏
arXiv2025-09-30 收录
数据链接:
官方服务:

资源简介:

该数据集名为Chumor,来源于类似中国Reddit的平台——糗事百科,包含了带有解释的笑话,旨在帮助评估大型语言模型对幽默理解的能力。Chumor是首个中文幽默解释数据集,为最先进的语言模型提供了一个具有挑战性的基准。该数据集规模涵盖了1951个笑话,总计超过151,730个中文字符的解释内容,其任务是对幽默理解和解释进行评估。

This dataset, named Chumor, is derived from QiuShi BaiKe, a Chinese Reddit-like platform. It collects jokes paired with their corresponding explanations, with the goal of assisting in evaluating large language models' (LLMs') capacity for humor understanding. As the first Chinese humorous explanation dataset, Chumor offers a challenging benchmark for state-of-the-art language models. The dataset encompasses 1,951 jokes, with a total of over 151,730 Chinese characters in their accompanying explanatory content, and its core task focuses on evaluating humor comprehension and explanation.

提供机构:
Ruo Zhi Ba
搜集汇总
数据集介绍
Chumor 数据集图片
构建方式
Chumor数据集的构建源于中文网络社区“弱智吧”,该平台以分享富有智力挑战与文化特质的笑话著称。研究者首先从2018至2021年的“年度最佳帖子”及“版主推荐”板块中爬取原始语料,每条帖子包含标题、内容及跟帖。随后,通过自动清洗流程剔除无意义占位符与重复条目,并修正因平台字数限制导致的标题截断问题。最终,由一位作者对所有笑话进行手工标注,逐一撰写幽默解析,同时筛除不具趣味性、涉及论坛管理、过度冒犯或偏向哲学思辨的内容,确保数据集质量与一致性。
特点
Chumor作为首个中文幽默解释数据集,收录了1,951条精心筛选的笑话,每条均附有平均78字的手工解析,总字数达151,730字,堪比一部中篇小说。其独特之处在于笑话深度融合中国文化背景与网络流行语,例如谐音双关、字形戏谑及典故误用,对语言模型的跨文化理解能力构成严峻挑战。实验表明,即便是GPT-4o与文心一言等顶尖模型,在幽默解释任务中仍显著逊于人类,尤其在文化典故与多义词解析上错误频发,凸显了数据集的高难度与学术价值。
使用方法
Chumor适用于评估大语言模型的中文幽默理解与文化感知能力。研究者可采用零样本提示方式,要求模型用两句话解释笑话的幽默之处,并与人工解析进行对比。通过A/B测试,由母语为中文的标注者评判解释优劣,可量化模型在文化典故、谐音谜题及语境歧义等维度的表现。此外,数据集还可用于训练模型的多语言推理与跨文化认知,或作为幽默生成任务的基准,推动非英语幽默研究的发展。
背景与挑战
背景概述
幽默是人类社交与情感生活的核心特质,长期以来在心理学、语言学及计算科学中备受关注。然而,现有幽默数据集与评估体系几乎完全以英语为中心,非英语语言(如中文)中蕴含文化细微差异的幽默理解资源严重匮乏。为填补这一空白,密歇根大学、卡内基梅隆大学与上海交通大学的研究团队于2024年联合发布了Chumor 1.0数据集。该数据集源自中国类似Reddit的社区“弱智吧”(Ruo Zhi Ba),聚焦于智力挑战性强且文化特异性鲜明的中文笑话。研究团队手动标注了1951条笑话的幽默解释,并通过A/B测试对比了人类与GPT-4o、文心一言两大顶尖大语言模型的解释质量。结果表明,人类解释显著优于模型,揭示了当前大语言模型在非英语文化幽默理解上的深层局限,为跨语言幽默研究与多模态文化认知提供了重要基准。
当前挑战
Chumor数据集所解决的领域问题在于:现有幽默理解研究集中于英语,缺乏对中文文化语境下幽默的深度建模,而中文幽默常依赖双关、谐音、文字视觉歧义及特定文化典故(如“正月理发克舅舅”的迷信),这对模型的文化感知与跨模态推理提出严峻挑战。构建过程中,团队面临多重困难:首先,数据源自社区帖子,需清洗大量无意义占位符、重复内容及不完整标题;其次,手动过滤非幽默、冒犯性或哲学性帖子,确保语料质量;最后,需为每条笑话撰写精确解释,总字数达15万汉字,工作量堪比中篇小说。评估揭示模型在文化无知、谐音误解、字形双关及跨语言幽默(如中文与日语发音关联)上频繁出错,凸显了当前大语言模型在非英语文化幽默理解上的系统性短板。
常用场景
经典使用场景
Chumor数据集的核心经典使用场景在于评估和提升大语言模型(LLMs)对中文幽默的理解能力。该数据集源自中文平台“弱智吧”,收录了兼具文化深度与智力挑战的幽默笑话,并配有详尽的人工解释。研究者常利用Chumor进行零样本幽默解释生成任务,通过对比模型输出与人类标注的优劣,系统性地检验LLMs在跨文化语境下的语义推理、双关识别及文化隐喻解析能力。这一场景不仅填补了非英语幽默理解基准的空白,更成为衡量模型在复杂语言游戏中表现的关键试金石。
解决学术问题
Chumor数据集着力解决了现有幽默理解研究高度集中于英语、缺乏对中文文化特异性幽默系统评估的学术困境。它揭示了当前最先进的大语言模型在解析中文文化典故、谐音双关、字形视觉幽默及跨语言谐音等方面存在的显著短板。通过细致的错误类型分析(如文化无知、同音误解、视觉文字游戏失败等),Chumor为理解模型在非英语语境下的推理局限提供了实证基础,推动了跨文化自然语言处理与幽默认知科学交叉领域的理论发展。
衍生相关工作
Chumor数据集的发布催生了一系列后续研究工作。一方面,它激励了研究者构建更大规模的中文幽默偏好标注数据集,以深化对模型主观幽默理解能力的量化评估。另一方面,受“弱智吧”数据在中文推理任务中表现优异的启发,学界开始探索将Chumor中的幽默解释链(Chain-of-Humor)融入模型训练,以提升LLMs在逻辑推理与创造性思维上的表现。此外,Chumor的错误分析框架被借鉴用于设计多模态幽默理解基准,推动了从单纯文本向图文结合的文化幽默评估范式的拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务