遇见数据集

reddit-animal-discourse-2020-present

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

Reddit动物相关讨论语料库(2020年至今)是一个从Reddit平台动物相关子版块收集的文本数据集,涵盖提交(帖子)和评论。该数据集是研究AI介导的价值锁定在人类动物福利话语中的一部分而构建的。数据通过PullPush.io收集,时间范围从2020年1月持续至今(截至2025年5月19日)。数据集总规模为889,110条记录,覆盖了六个子版块:r/AnimalRights、r/AntiVegan、r/AskVegans、r/PlantBasedDiet、r/vegan和r/vegetarian,各版块的提交数和评论数均有详细统计。数据按子版块和内容类型(提交或评论)组织为Parquet文件。提交字段包括id、标题、正文、作者、创建时间、分数、评论数等;评论字段包括id、正文、作者、父ID、链接ID等。子版块的选择旨在覆盖动物伦理立场的频谱:支持动物(如r/vegan、r/AnimalRights)、辩论/混合(如r/DebateAVegan、r/AskVegans)、怀疑/反对(如r/exvegan、r/AntiVegan)以及相关主题(如r/wildlife)。原始文本内容公开,但为保护隐私,用户名已通过SHA-256加盐哈希处理(截断为12位十六进制字符,前缀为user_),以移除个人身份信息,同时保留同一用户跨记录的分析能力。数据集适用于文本分类、话语分析、价值观研究等任务,仅限非商业研究使用。

The Reddit Animal-Related Discussion Corpus (2020–Present) is a text dataset collected from animal-related subreddits on the Reddit platform, covering submissions (posts) and comments. This corpus was constructed as part of research on AI-mediated value entrenchment in human animal welfare discourse. The data was collected via PullPush.io, with a time range spanning from January 2020 to the present (as of May 19, 2025). The total size of the dataset is 889,110 records, covering six subreddits: r/AnimalRights, r/AntiVegan, r/AskVegans, r/PlantBasedDiet, r/vegan, and r/vegetarian, with detailed statistics available for the number of submissions and comments in each subreddit. The dataset is organized into Parquet files by subreddit and content type (submission or comment). Submission fields include id, title, body, author, creation time, score, number of comments, and more; comment fields include id, body, author, parent ID, link ID, and more. The selection of subreddits aims to cover the spectrum of animal ethical stances: pro-animal (e.g., r/vegan, r/AnimalRights), debate/mixed (e.g., r/DebateAVegan, r/AskVegans), skeptical/oppositional (e.g., r/exvegan, r/AntiVegan), and related topics (e.g., r/wildlife). The raw text content is publicly available, but to protect privacy, usernames have been salted and hashed using SHA-256, truncated to 12 hexadecimal characters and prefixed with "user_", to remove personally identifiable information while retaining the ability to analyze the same user across multiple records. This corpus is applicable to tasks such as text classification, discourse analysis, and values research, and is restricted to non-commercial research use only.

创建时间:
2026-06-09
原始信息汇总

数据集概要

  • 名称: Reddit Animal-Discourse Corpus (2020–present)
  • 语言: 英文
  • 规模: 1M < n < 10M 条记录,总计 889,110 条
  • 任务类型: 文本分类
  • 许可证: 非商业研究用途(Reddit 用户内容条款适用)

数据来源与时间范围

  • 通过 PullPush.io 收集自 2020 年 1 月至今的 Reddit 动物相关子版块帖文与评论。
  • 覆盖以下子版块及其数据量:
子版块 帖文数 评论数 帖文日期范围
r/AnimalRights 18,293 5,193 2020-01-01 → 2025-05-19
r/AntiVegan 21,365 171,450 2020-01-01 → 2025-05-19
r/AskVegans 5,167 127,895 2020-01-01 → 2025-05-19
r/PlantBasedDiet 26,629 97,582 2020-01-01 → 2025-05-19
r/vegan 93,272 228,490 2022-12-03 → 2025-05-19
r/vegetarian 46,481 47,293 2020-01-01 → 2025-05-19

文件结构

  • 每个子版块与数据类型(帖文/评论)对应一个 Parquet 文件,命名格式如 AntiVegan__submission.parquet
  • 帖文字段: id, name, created_utc, author, subreddit, title, selftext, url, score, num_comments, upvote_ratio, link_flair_text, permalink, is_self, over_18, spoiler, stickied, created_date
  • 评论字段: id, name, created_utc, author, subreddit, body, score, parent_id, link_id, permalink, is_submitter, stickied, created_date

子版块分类

  • 支持动物权益: r/vegan, r/AnimalRights, r/vegetarian, r/PlantBasedDiet
  • 辩论/混合: r/DebateAVegan, r/AskVegans
  • 怀疑/反对: r/exvegan, r/AntiVegan, r/carnivore
  • 相邻领域: r/wildlife, r/conservation

伦理与隐私处理

  • 用户名经过加盐哈希处理(SHA-256,项目特定盐值,截断为 12 位十六进制字符,前缀 user_),移除个人可识别信息(PII),同时保留同一用户跨记录分析能力。
  • 保留 [deleted][removed]AutoModerator 等标识符。
  • 内容为抓取时的快照,可能不同于当前 Reddit 状态。

引用

  • 引用出处将后续补充(研究待发布)。
搜集汇总
数据集介绍
reddit-animal-discourse-2020-present 数据集图片
构建方式
该数据集基于PullPush.io平台采集,覆盖2020年1月至今的Reddit动物相关子论坛提交和评论。构建过程聚焦于动物伦理议题中支持与质疑两大阵营的代表性子论坛,包括r/vegan、r/AnimalRights等支持方,r/DebateAVegan、r/AskVegans等辩论混合社区,以及r/AntiVegan、r/exvegan等质疑方。总计收集889,110条记录,以每个子论坛与内容类型组合为单位存储为parquet文件。为保护用户隐私,用户名经SHA-256加盐哈希处理并截断为12位十六进制前缀,同时保留[deleted]等占位符,确保用户级别分析的可追溯性。
使用方法
该数据集主要适用于文本分类与话语分析任务。用户可直接加载各子论坛对应的parquet文件进行探索,结合`subreddit`字段分群或按`created_utc`时间戳进行历时演变分析。对于情感分析、立场检测或价值锁定研究,可利用`selftext`(提交正文)和`body`(评论内容)字段作为输入,辅以`score`、`upvote_ratio`等社交信号进行上下文建模。由于用户名已被哈希处理,研究人员可在匿名化框架下追踪同一用户的言论模式变化,适合进行用户级别的话语动力学研究。建议使用前确认遵守Reddit用户内容协议及非商业研究许可限制。
背景与挑战
背景概述
Reddit Animal-Discourse Corpus(2020年至今)是由研究机构基于PullPush.io平台构建的大规模语料库,专注于收录2020年1月至2025年5月期间Reddit上涉及动物权益与伦理讨论的子版块内容。该数据集由多个子版块组成,涵盖从支持动物权利(如r/vegan、r/AnimalRights)到质疑或反对动物伦理(如r/AntiVegan、r/exvegan)的广泛观点谱系,总计89万余条帖子和评论。其核心研究问题在于探讨人工智能在人类动物福利话语中可能引发的价值锁定效应,即算法推荐如何固化特定伦理立场。作为首个系统整合跨阵营动物话语的文本资源,该数据集为计算社会科学、伦理话语分析以及AI价值对齐研究提供了独特的数据基础,推动了人机交互中价值演变机制的可量化探索。
当前挑战
该数据集所解决的领域挑战主要在于动物福利话语分析中跨阵营语料的稀缺性,以及AI系统可能通过内容推荐强化既有伦理立场的价值锁定问题,这要求数据集具备阵营覆盖的完整性和时间跨度。构建过程中面临的挑战包括:大规模Reddit数据抓取的合法性与时效性,因为PullPush接口返回的是抓取时刻的静态内容,已删除或编辑的帖子可能与当前Reddit状态不符;用户隐私保护要求对作者名进行加盐哈希脱敏,同时保留同一用户跨记录的可追踪性;多子版块数据格式的异构性需要统一转换为Parquet文件,并规范字段如时间戳、评分和评论层级关系,以确保下游分类任务的可靠性。
常用场景
经典使用场景
该数据集聚焦于Reddit平台上与动物伦理相关的多子版块讨论,收录了2020年至今的帖子与评论内容,覆盖了从坚决支持动物权利到质疑素食主义的多种立场。其经典使用场景在于进行价值话语分析,研究者可借此探索不同社群在动物福利议题上的观点交锋、立场演变及修辞策略,尤其适合用于训练和评估面向社交媒体文本的情感分类、立场检测和论辩挖掘模型。
解决学术问题
该数据集针对当代社会关于动物伦理的在线讨论缺乏系统化语料库的难题,构建了一个横跨十年、涵盖889,110条记录的多视角高质量语料。它有效解决了学术研究中难以获取大规模、立场明确的动物福利话语数据的问题,特别为研究人工智能辅助下的价值固化现象提供了实证基础,有助于理解技术如何在大规模在线对话中塑造和锁定公众的道德立场。
实际应用
在实际应用中,该数据集可直接服务于社交媒体监听与公共舆情分析系统,帮助动物保护组织、政策制定者及教育机构实时把握公众对动物福利话题的态度变化。通过训练基于该语料的文本分类器,可以实现对网络社区中动物伦理讨论的自动化标注,用于检测反动物权利言论、评估科普宣传效果,或为内容推荐系统提供伦理导向的过滤机制。
数据集最近研究
最新研究方向
该数据集聚焦于红迪(Reddit)平台上围绕动物伦理与动物福利的在线话语分析,特别关注2020年至今这一时间段内的讨论演变。其前沿研究方向在于利用大规模社交文本数据,通过自然语言处理与计算社会学方法,探索不同立场的用户群体(如纯素食者、动物权利倡导者、素食怀疑者及反对者)之间的话语互动模式与价值锁定(value lock-in)现象。当前的热点事件包括人工智慧对人类道德话语的潜在固化效应、后疫情时代动物伦理议题的极化趋势,以及跨社区话语渗透对公众认知的影响。该数据集的发布为研究网络社群意见形成、道德辩论的语义演变以及技术中介的伦理话语变迁提供了宝贵的实证基础,对理解数字时代人类与非人类动物关系的重塑具有重要的学术价值与社会意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务