Oogiri-Master, Oogiri-Corpus, user_preference
收藏资源简介:
Oogiri-Master是一个用于幽默理解基准测试的多选任务数据集,包含600行数据,列包括任务类型、提示、候选响应和标签;Oogiri-Corpus是一个包含提示-响应对和投票计数的语料库数据集,包含82,536行数据,列包括提示、响应和投票计数;user_preference是用户偏好数据集,包含用户投票记录,用于分析用户聚类和幽默偏好,包含57,751行数据,列包括用户名、响应ID和投票计数。
Oogiri-Master is a multiple-choice task dataset for humor understanding benchmarking, containing 600 rows with columns including task type, prompt, candidate responses, and label; Oogiri-Corpus is a corpus dataset consisting of prompt-response pairs and vote counts, with 82,536 rows and columns including prompt, response, and vote counts; user_preference is a user preference dataset that includes user voting records for analyzing user clustering and humor preferences, with 57,751 rows and columns including username, response ID, and vote counts.
数据集概述
该仓库提供了一个可复现的数据集构建工具,用于生成两个与“大喜利”(Oogiri)幽默理解相关的研究论文中所使用的数据集。数据来源为Chinsuko Study大喜利页面。
核心数据集
该工具可构建以下三个公开数据集,输出为CSV文件:
-
Oogiri-Master- 文件路径:
03_public_dataset/oogiri_master/Oogiri-Master.csv - 内容: 用于评估幽默理解能力的多项选择基准测试任务。
- 规模: 600行。
- 任务类型: 包括
binary_diff,binary_same,triple,quad,binary_classification五种。 - 关键字段:
id,prompt(提示文本),response_A/B/C/D(候选回答),label(正确答案标签或二分类标签)。
- 文件路径:
-
Oogiri-Corpus- 文件路径:
03_public_dataset/oogiri_corpus/Oogiri-Corpus.csv - 内容: 包含投票数的提示-回答对应语料库。
- 规模: 82,536行。
- 关键字段:
id,prompt(提示文本),response(回答文本),vote_count(获得的票数)。
- 文件路径:
-
User Preference Data- 文件路径:
03_public_dataset/user_preference/ - 内容: 用于分析用户幽默偏好和用户聚类的过滤后数据。
- 包含文件与规模:
votes.csv: 57,751行,记录用户对回答的投票。responses.csv: 14,389行,记录活跃用户的回答。prompts.csv: 908行,记录问题提示。users.csv: 276行,记录活跃用户信息。user_clusters.csv: 276行,记录用户所属聚类(共7个聚类)。filter_config.json: 记录生成该偏好数据所使用的过滤参数和元数据。
- 文件路径:
数据构建流程
构建流程由一系列命令驱动,分为以下阶段:
- 爬取: 从目标网站下载指定话题的HTML文件。
- 解析: 将HTML文件转换为结构化的JSONL数据。
- 构建数据集: 基于解析后的JSONL数据,生成上述所有公开的CSV格式数据集。
- 验证: 验证生成的数据集文件是否与仓库中固定的基线版本匹配。
构建参数
数据集的构建过程使用了默认参数,这些参数定义在defaults.py文件中,用于过滤和基准测试。
- 过滤参数 (用于
user_preference):- 每个提示的最小参与者: 30
- 每个提示的最小投票数: 100
- 每个回答的最小投票数: 3
- 活跃用户最少投票数: 100
- 启用重复用户移除
- 聚类参数 (用于
user_preference):- 用户聚类数量: 7
- 基准测试参数 (用于
Oogiri-Master):- 随机种子: 42
- 每种任务类型的样本数:
binary_diff,binary_same,triple,quad各100个,binary_classification200个。
法律与使用注意
- 该仓库仅包含构建代码,不包含任何生成的数据集文件。
- 用户在执行爬取或发布派生数据前,需自行检查目标网站的
robots.txt和服务条款。 - 爬虫的默认设置限制了请求间隔(约1.0-1.5秒)和并行度(3个工作进程)。
引用
如果您使用了本软件或相关数据集,请引用以下两篇论文:
- Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User Clusters and LLMs (arXiv:2601.03103)
- Oogiri-Master: Benchmarking Humor Understanding via Oogiri (arXiv:2512.21494)




