遇见数据集

Oogiri-Master, Oogiri-Corpus, user_preference

收藏
github2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

Oogiri-Master是一个用于幽默理解基准测试的多选任务数据集,包含600行数据,列包括任务类型、提示、候选响应和标签;Oogiri-Corpus是一个包含提示-响应对和投票计数的语料库数据集,包含82,536行数据,列包括提示、响应和投票计数;user_preference是用户偏好数据集,包含用户投票记录,用于分析用户聚类和幽默偏好,包含57,751行数据,列包括用户名、响应ID和投票计数。

Oogiri-Master is a multiple-choice task dataset for humor understanding benchmarking, containing 600 rows with columns including task type, prompt, candidate responses, and label; Oogiri-Corpus is a corpus dataset consisting of prompt-response pairs and vote counts, with 82,536 rows and columns including prompt, response, and vote counts; user_preference is a user preference dataset that includes user voting records for analyzing user clustering and humor preferences, with 57,751 rows and columns including username, response ID, and vote counts.

创建时间:
2026-06-01
原始信息汇总

数据集概述

该仓库提供了一个可复现的数据集构建工具,用于生成两个与“大喜利”(Oogiri)幽默理解相关的研究论文中所使用的数据集。数据来源为Chinsuko Study大喜利页面。

核心数据集

该工具可构建以下三个公开数据集,输出为CSV文件:

  1. Oogiri-Master

    • 文件路径: 03_public_dataset/oogiri_master/Oogiri-Master.csv
    • 内容: 用于评估幽默理解能力的多项选择基准测试任务。
    • 规模: 600行。
    • 任务类型: 包括 binary_diffbinary_sametriplequadbinary_classification 五种。
    • 关键字段: idprompt (提示文本), response_A/B/C/D (候选回答), label (正确答案标签或二分类标签)。
  2. Oogiri-Corpus

    • 文件路径: 03_public_dataset/oogiri_corpus/Oogiri-Corpus.csv
    • 内容: 包含投票数的提示-回答对应语料库。
    • 规模: 82,536行。
    • 关键字段: idprompt (提示文本), response (回答文本), vote_count (获得的票数)。
  3. User Preference Data

    • 文件路径: 03_public_dataset/user_preference/
    • 内容: 用于分析用户幽默偏好和用户聚类的过滤后数据。
    • 包含文件与规模:
      • votes.csv: 57,751行,记录用户对回答的投票。
      • responses.csv: 14,389行,记录活跃用户的回答。
      • prompts.csv: 908行,记录问题提示。
      • users.csv: 276行,记录活跃用户信息。
      • user_clusters.csv: 276行,记录用户所属聚类(共7个聚类)。
      • filter_config.json: 记录生成该偏好数据所使用的过滤参数和元数据。

数据构建流程

构建流程由一系列命令驱动,分为以下阶段:

  1. 爬取: 从目标网站下载指定话题的HTML文件。
  2. 解析: 将HTML文件转换为结构化的JSONL数据。
  3. 构建数据集: 基于解析后的JSONL数据,生成上述所有公开的CSV格式数据集。
  4. 验证: 验证生成的数据集文件是否与仓库中固定的基线版本匹配。

构建参数

数据集的构建过程使用了默认参数,这些参数定义在defaults.py文件中,用于过滤和基准测试。

  • 过滤参数 (用于user_preference):
    • 每个提示的最小参与者: 30
    • 每个提示的最小投票数: 100
    • 每个回答的最小投票数: 3
    • 活跃用户最少投票数: 100
    • 启用重复用户移除
  • 聚类参数 (用于user_preference):
    • 用户聚类数量: 7
  • 基准测试参数 (用于Oogiri-Master):
    • 随机种子: 42
    • 每种任务类型的样本数: binary_diffbinary_sametriplequad 各100个,binary_classification 200个。

法律与使用注意

  • 该仓库仅包含构建代码,不包含任何生成的数据集文件。
  • 用户在执行爬取或发布派生数据前,需自行检查目标网站的robots.txt和服务条款。
  • 爬虫的默认设置限制了请求间隔(约1.0-1.5秒)和并行度(3个工作进程)。

引用

如果您使用了本软件或相关数据集,请引用以下两篇论文:

  • Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User Clusters and LLMs (arXiv:2601.03103)
  • Oogiri-Master: Benchmarking Humor Understanding via Oogiri (arXiv:2512.21494)
搜集汇总
数据集介绍
Oogiri-Master, Oogiri-Corpus, user_preference 数据集图片
构建方式
幽默理解与偏好研究是自然语言处理领域兼具挑战与趣味的前沿方向。Oogiri数据集以日本经典的即兴喜剧问答游戏“大喜利”为灵感源泉,通过精心设计的自动化流水线构建而成。该流水线首先从Chinsuko Study网站爬取原始话题页面,随后解析HTML文件,提取出包含用户响应与投票信息的结构化数据。在构建阶段,系统依据严格的过滤准则对数据进行筛选,包括设定每个话题的最低参与人数、最低投票总数以及每条响应的最低得票数。最终,系统将清洗后的数据组装成三种核心产物:用于基准测试的多选题集Oogiri-Master、包含逾八万条响应文本的语料库Oogiri-Corpus,以及用于探究用户幽默偏好差异的偏好数据集user_preference。整个构建过程具有完全的可重复性,并提供了内置的校验机制以确保输出结果的稳定与一致。
使用方法
研究人员可以通过简洁的命令行工具快速复现整个数据集。首先需确保系统中已安装uv和Python 3.11,随后执行uv sync安装依赖。运行uv run python -m oogiri_dataset_builder pipeline --output-dir ./out即可自动化完成爬取、解析与数据集构建的全流程,输出结果将整齐地存放在指定的输出目录中。数据使用者可以直接从03_public_dataset文件夹下获取CSV格式的成品数据,每个文件都配有清晰的字段说明,方便直接导入pandas等数据分析工具进行实验探索。对于有定制化需求的研究者,可通过修改defaults.py中的默认参数来调整过滤阈值与采样数量,从而生成符合特定研究目标的数据版本。
背景与挑战
背景概述
幽默理解是自然语言处理领域中一项极具挑战性的任务,其核心在于捕捉语言中的歧义、文化背景与情感共鸣。Oogiri-Master与Oogiri-Corpus数据集由CyberAgent AI Lab的Soichiro Murakami、Hidetaka Kamigaito、Hiroya Takamura及Manabu Okumura于2025年至2026年间构建,源自日本Chinsuko Study平台的Oogiri(大喜利)板块,旨在为幽默生成与理解提供系统化基准。其中,Oogiri-Master包含600个多选任务,涵盖二元比较、三元和四元推理及分类,以评测模型对幽默优劣的判别力;Oogiri-Corpus则提供超过8.2万条提示-回答对及投票数据,支撑语料驱动的幽默生成研究。此外,用户偏好数据集记录了276名活跃用户的投票行为与聚类信息,为探究幽默感知的个体差异与群组特征开辟新视角。该系列数据集填补了幽默计算领域缺乏结构化、规模化基准的空白,显著推动了大语言模型在幽默理解与生成能力评估上的发展。
当前挑战
幽默理解领域面临的核心挑战在于其极度依赖上下文、文化隐喻及人际认知差异,难以通过常规的语义或逻辑规则量化。Oogiri-Master与Oogiri-Corpus数据集的构建需解决以下难题:首先,从非结构化网页中提取高质量数据,需设计爬虫策略避免对源站造成过度负担,并在解析HTML时准确保留提示、回答及投票元数据,应对格式变体与噪声。其次,数据过滤与去重标准需谨慎设定,例如设定每提示参与人数不低于30、总投票数不低于100、每位活跃用户投票不少于100次等阈值,以剔除冷门或非代表性样本,同时通过高相似度阈值(0.9999)自动识别并移除重复内容,平衡数据纯净度与规模。最后,用户偏好聚类依赖奇异值分解(SVD)与K均值算法,将277名用户分为7簇,需在低维空间保留投票模式的关键特征,确保聚类结果反映真实的幽默感知倾向,而非数据噪声或采样偏差。这些挑战共同考验着数据构建的稳定性、可复现性与领域适配性。
常用场景
经典使用场景
在幽默计算与认知语言学交叉领域,Oogiri数据集最经典的使用场景是作为多模态幽默理解能力的标准化评测基准。具体而言,研究者通过Oogiri-Master中精心设计的二元判别、三选一、四选一及二分类任务,系统评估语言模型在面对源自日本传统Oogiri游戏'大喜利'的诙谐情境时,能否准确识别出最具幽默效果的应答文本。这些任务要求模型超越浅层的语义匹配,深入理解语境中蕴含的讽刺、双关及文化梗,从而为幽默生成与理解这一长期困扰自然语言处理领域的难题提供可量化的实验平台。
解决学术问题
该数据集核心解决了幽默理解研究中长期缺乏大规模、高质量、跨用户群体的标注语料这一关键瓶颈。Oogiri-Corpus提供了超过八万条带有投票信息的开放域幽默应答对,而user_preference模块则创新性地引入用户聚类分析,将幽默偏好从单一的文本属性拓展为融合个体认知差异的复杂社会信号。这使得学术界得以首次系统探究'谁因何而笑'——即幽默感知如何受用户背景、群体归属及语言模型内在机制的多重影响,从而将幽默计算从简单的文本分类推向更贴近人类认知本质的个性化建模层次。
实际应用
在实际产业应用中,Oogiri数据集为构建具备情感共鸣能力的智能对话系统提供了关键训练与评估资源。基于用户偏好聚类分析的结果,可以指导个性化虚拟助手、社交机器人及娱乐内容推荐引擎在生成幽默回应时,能够自适应地匹配不同用户群体的笑点分布,避免'尬聊'或冒犯。此外,Oogiri-Corpus中丰富的幽默应答对可直接用于微调大型语言模型的风格化生成能力,使其在创意写作、游戏NPC对话及短视频文案辅助等场景中输出更具亲和力与感染力的语言内容。
数据集最近研究
最新研究方向
幽默计算与个性化偏好建模的交叉探索正成为自然语言处理领域的前沿热点。Oogiri-Master与Oogiri-Corpus通过构建基于日本传统文字游戏“大喜利”的多选基准和提示-回复语料库,为机器幽默理解能力的系统评估提供了标准化平台。尤其值得注意的是,配套的用户偏好数据集通过细粒度投票记录与聚类分析,揭示了不同用户群体及大语言模型在幽默感知上的差异性,这一方向巧妙地将认知科学与大模型对齐问题相融合,催生了关于“谁因何而笑”这一深层机制的研究路径。该工作不仅推动了非英语语境下幽默计算的发展,还为理解模型与人类在情感认知上的趋同与分歧提供了新的实验范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务