遇见数据集

WitchesSocialStream/ChabikoStream

收藏
Hugging Face2024-11-03 更新2024-06-12 收录
官方服务:

资源简介:

Chabiko Stream数据集是XChan的每日数据转储,包含线程和帖子。数据集通过两种模式进行归档:Archive模式和PostStream模式。Archive模式支持已关闭线程的归档,刷新频率最多为10分钟;PostStream模式则在不支持归档的板上使用,刷新频率最多为20秒。数据集支持的站点包括4chan,数据格式为jsonl。Archive模式下,每条json行代表一个完整的线程转储;PostStream模式下,每条json代表一个单独的帖子。数据集目前仅归档文本数据,并关闭了社区帖子以防止滥用。

Chabiko Stream数据集是XChan的每日数据转储,包含线程和帖子。数据集通过两种模式进行归档:Archive模式和PostStream模式。Archive模式支持已关闭线程的归档,刷新频率最多为10分钟;PostStream模式则在不支持归档的板上使用,刷新频率最多为20秒。数据集支持的站点包括4chan,数据格式为jsonl。Archive模式下,每条json行代表一个完整的线程转储;PostStream模式下,每条json代表一个单独的帖子。数据集目前仅归档文本数据,并关闭了社区帖子以防止滥用。

提供机构:
WitchesSocialStream
原始信息汇总

数据集概述

数据集名称

Chabiko Stream

许可证

Apache 2.0

数据集描述

Chabiko Stream 是一个每日更新的 XChan 论坛帖子数据集,由 chabiko 这个 XChan 爬虫工具抓取。

数据收集模式

数据集通过两种模式进行数据收集:

  • Archive 模式:适用于支持存档的板块,存档每10分钟更新一次,如果板块更新更快,则更新频率更高。
  • PostStream 模式:适用于不支持存档的板块,以流的形式抓取帖子,每20秒更新一次,如果板块更新更快,则更新频率更高。

支持的网站

  • 4chan
  • Futaba Channel(待定)

数据格式

两种模式的数据均以 jsonl 格式存储:

  • Archive 模式:每行 json 代表一个完整的帖子存档。
  • PostStream 模式:每行 json 代表一个单独的帖子。

数据模型

数据集使用以下 pydantic 模型进行解析:

  • AttachmentData:附件数据模型,包含附件URL和文件名。
  • Post:帖子数据模型,包含板块、帖子ID、发帖人名称、内容、附件等信息。
  • Thread:帖子主题数据模型,包含标题和帖子列表。

注意事项

  • 目前仅存档文本数据,图像数据存档待定。
  • 由于潜在的滥用风险,社区帖子已关闭,相关交流请通过其他渠道联系 KaraKaraWitch。
搜集汇总
数据集介绍
WitchesSocialStream/ChabikoStream 数据集图片
构建方式
在互联网论坛数据日益成为自然语言处理研究重要资源的背景下,Chabiko Stream数据集应运而生。该数据集由XChan(一种类4chan论坛)的爬虫工具Chabiko每日采集生成,旨在提供论坛帖文与回复的持续流式数据。其构建采用双模式归档策略:对于支持存档的版面,以“Archive”模式每至多10分钟刷新一次完整线程转储;对于不支持存档的版面,则采用“PostStream”模式,以每至多20秒的频率流式抓取单条帖子。所有数据均以JSONL格式存储,其中Archive模式每行代表一个完整线程,PostStream模式每行则对应一条独立帖子。
特点
该数据集的核心特色在于其动态流式采集机制与双模式归档设计,能够灵活适应不同论坛版面的数据存储规则,确保数据获取的连续性与时效性。数据格式高度结构化,通过明确的Pydantic模型定义了帖子(Post)与线程(Thread)的字段,包括版面名称、线程ID、帖子ID、用户名、消息内容、可选附件信息及时间戳,便于程序化解析与集成。目前仅归档文本内容,兼顾了存储效率与隐私考量。此外,数据集遵循CC-BY-4.0许可协议开放使用,但出于潜在滥用风险,已关闭社区贡献入口。
使用方法
研究者可通过HuggingFace Datasets库直接加载该数据集,或下载JSONL文件进行离线处理。使用时需注意数据集已标记为废弃状态,推荐转向更新版本WitchesSocialStream/Four-Leaf-Clover。对于Archive模式数据,每行可解析为一个Thread对象,适用于线程级对话分析;PostStream模式数据每行为一个Post对象,适合单帖维度的文本挖掘。建议结合提供的Pydantic模型进行数据验证与转换,并留意文本内容可能包含论坛特有的非正式语言与敏感话题,预处理时需做好清洗与过滤工作。
背景与挑战
背景概述
在网络数据日益成为自然语言处理与社交媒体研究重要资源的背景下,WitchesSocialStream团队于近期开发了Chabiko Stream数据集,旨在系统性地捕获和归档匿名论坛(如4chan)中的动态讨论内容。该数据集由研究者KaraKaraWitch主导创建,核心研究问题聚焦于如何高效、可扩展地获取并结构化这类非传统社交平台的海量文本数据,以支持对网络亚文化、群体行为及语言模式的深度分析。Chabiko Stream通过每日增量更新的方式,提供线程与帖子的结构化转储,为研究匿名社区的信息传播机制提供了独特的数据基础,其对理解边缘化网络生态的学术价值正逐步显现。
当前挑战
Chabiko Stream所面临的挑战涵盖领域问题与构建过程两个层面。在领域问题方面,匿名论坛数据具有高度噪声、内容异质性强及语言非规范性显著的特点,这给文本清洗、语义建模及跨平台泛化带来了严峻考验,如何从中提取可靠的研究特征成为核心难点。在构建过程中,数据采集的稳定性与效率是首要挑战,原始爬取代码因过于复杂且易出错而被迫暂停,暴露出系统架构设计的脆弱性;此外,数据存储策略需平衡文本与图像的资源开销,当前仅归档文本以避免存储膨胀,但这一取舍限制了多模态分析的潜力。同时,社区参与管理也面临滥用风险,迫使团队关闭公开提交功能,进一步凸显了数据治理与伦理合规的复杂性。
常用场景
经典使用场景
Chabiko Stream数据集以每日增量更新的方式,系统性地捕获来自4chan等匿名图像讨论版(imageboard)的帖子与串流数据。其经典使用场景在于为社会科学与计算语言学研究者提供大规模、高时效性的网络亚文化语料库,尤其适用于分析匿名社区中的语言演变、模因传播与群体行为模式。通过其双模式归档机制——Archive模式保存完整线程,PostStream模式实时流式记录单条帖子——研究者得以兼顾历史回溯与动态追踪,从而深入探讨网络匿名性对言论表达的影响。
实际应用
在实际应用中,Chabiko Stream的数据可用于开发针对匿名论坛的内容审核工具与舆情监测系统。例如,安全团队可利用其帖子流训练机器学习模型,以实时识别违规言论或恶意模因传播;社会科学机构则可借助其历史存档,追踪网络迷因的跨平台扩散路径。此外,由于数据集包含结构化字段(如附件URL),多媒体内容分析(如图像文本关联)亦成为可行方向,为数字取证与网络行为建模提供基础资源。
衍生相关工作
该数据集衍生了一系列围绕匿名论坛建模的开源工作,包括基于Chabiko Stream训练的语言模型(如针对4chan方言的微调模型),以及用于帖子聚类与主题演化的时序分析工具。其后续版本Four-Leaf-Clover进一步优化了数据采集代码,减少了爬取故障率,并扩展了对Futaba Channel等更多图像版的支持。这些衍生工作共同推动了网络亚文化语料库的标准化建设,并为后续研究如匿名社区中的虚假信息检测与群体极化分析奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务