遇见数据集

zeio/batch

收藏
Hugging Face2023-12-13 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含从2ch存档的/b/板块解析的线程。数据集以三种形式表示:未压缩、压缩和语音。未压缩形式以txt文件组织,压缩形式为tar.xz文件,语音形式为mp3文件。每个线程由多个主题组成,每个主题包含多个帖子。帖子是数据集的最小单位,以纯文本形式存在。

This dataset contains threads parsed from the /b/ board archived on 2channel. It is provided in three distinct formats: uncompressed, compressed, and audio. The uncompressed format is organized into TXT files, the compressed format is packaged as tar.xz archives, and the audio format adopts MP3 files. Each thread is composed of multiple topics, and each topic encompasses multiple posts. Posts represent the smallest unit of the dataset, stored in plain text.

提供机构:
zeio
原始信息汇总

数据集概述

数据集描述

  • 语言: 俄语, 英语
  • 许可证: Apache 2.0
  • 标签: 社交网络, 不适合所有观众
  • 注释创建者: 众包
  • 语言创建者: 众包
  • 数据集名称: batch
  • 数据集大小: 100K<n<1M
  • 任务类别: 文本生成, 文本分类, 问答

数据集摘要

该数据集包含从2ch档案库/b/板块解析的线程。数据集的示例读取和使用在此Colab笔记本中提供。

数据集结构

数据集以三种格式表示:压缩, 未压缩口语

  1. 未压缩格式是默认且最简单的格式 - 在此形式中,数据集的内容组织在txt文件中,这些文件被分组到threads文件夹中的集群中。分组是根据git的限制进行的,即不能在一个目录中拥有超过10000个文件。因此,每个集群包含10000个项目(最后一个集群可能包含较少的元素)。每个集群名称的格式为${START_PAGE}-${END_PAGE},其中${START_PAGE}档案库中第一个页面的索引,${END_PAGE}是最后一个页面的索引。
  2. 压缩格式比未压缩格式稍微复杂一些 - 它由一组tar.xz文件组成,这些文件是上述txt文件的压缩集群。此表示对应于threads-compressed文件夹
  3. 口语格式由mp3文件组成,这些文件是使用交替说话者语音模式为某些线程生成的语音,即第1个帖子由第一个说话者说出,第2个帖子由第二个说话者说出,依此类推。语音是使用TTS引擎自动生成的。mp3文件位于threads-spoken-compressed文件夹中,并使用tar.xz档案进行分组,方式与compressed数据集表示中的txt文件相同。

关于threads/*/文件夹下的特定txt文件,每个项目对应于一个线程,其组织如下:

  1. 每个非空行对应于用户的一个帖子;
  2. 如果非空行跟随另一个非空行,则应将其视为对上方帖子的评论,对上方请求的回复或对问题的回答
  3. 如果非空行跟随一个空行,则应将其视为讨论或主题的开始。

因此,数据集由线程组成,这些线程可以分为主题,这些主题又由帖子组成。帖子是数据集的最底层单位,不再进一步划分 - 它们应被解释为纯文本。

数据集实例

以下代码片段包含线程0000-0019/119540414的文本:

sh Всем привет. Нужна помощь богов фотошопа, на картинке надо изменить дату на 09/03/2016 и значения тесто на 86.500++ черес код елемента ебаш Опять ты, сука ебаная? Хули тебе опять надо?

СПАСИБО Размер шрифта не совпадает, але.

该线程包含两个主题,第一个主题包含3个帖子,第二个主题包含2个帖子。

因此,该数据集条目可以以以下JSON格式表示:

json { "title": "Всем привет. Нужна помощь богов фотошопа, на картинке надо изменить дату на 09/03/2016 и значения тесто на 86.500++", "topics": [ { "posts": [ { "text": "Всем привет. Нужна помощь богов фотошопа, на картинке надо изменить дату на 09/03/2016 и значения тесто на 86.500++" }, { "text": "черес код елемента ебаш" }, { "text": "Опять ты, сука ебаная? Хули тебе опять надо?" } ] }, { "posts": [ { "text": "СПАСИБО" }, { "text": "Размер шрифта не совпадает, але." } ] } ] }

数据集字段

written配置中,数据集表示为Thread对象的列表,每个Thread对象具有一个属性topics,其中包含Topic对象的列表。每个Topic对象具有一个属性posts,指向构成TopicPost对象的列表。每个Post对象包含一个属性text,其中包含帖子的文本表示(本质上texthtml代码,没有标签和显式链接指向其他帖子;仍然可能存在以>符号为前缀的隐式链接指向其他帖子)。作为附加字段,每个实例具有一个属性title,等同于线程的主要帖子内容。
spoken配置中,结构基本相同,但某些Thread对象具有附加属性speech,其中包含线程的口语表示。

搜集汇总
数据集介绍
zeio/batch 数据集图片
构建方式
该数据集源自俄罗斯匿名贴图讨论版2ch的/b/板块,通过解析归档页面中的讨论串构建而成。数据以三种格式呈现:未压缩格式将每个讨论串存储为独立的txt文件,并按每10000个文件为一组聚类存放于目录中;压缩格式则将这些聚类打包为tar.xz归档文件;口语格式则利用文本转语音引擎,采用交替说话者模式为部分讨论串生成mp3音频。每条数据对应一个讨论串,其中非空行代表用户帖子,连续非空行表示对上方帖子的评论或回复,而空行后的非空行则标记新话题的开始。
特点
数据集规模介于10万至100万条之间,涵盖俄语和英语内容,适用于文本生成、文本分类和问答任务。其独特之处在于层次化结构:讨论串可分割为话题,话题由帖子组成,帖子为最底层文本单元。口语配置额外包含交替说话者生成的音频,模拟对话场景。数据标注和语言创建均通过众包实现,内容源自社交网络,具有非全年龄适宜性。数据集提供written和spoken两种配置,后者在保留文本结构的基础上增加了音频字段。
使用方法
用户可通过HuggingFace数据集加载器直接调用,支持written和spoken两种配置。示例用法可在配套Colab笔记本中找到。对于written配置,每条数据包含标题和话题列表,话题内嵌套帖子文本;spoken配置则额外包含音频字段。数据适用于训练对话模型、文本生成系统或问答系统。建议将帖子序列视为多轮对话,利用话题分隔符区分不同讨论主题。压缩和未压缩格式便于本地存储和分布式处理,口语格式则适合多模态研究。
背景与挑战
背景概述
在互联网社交媒体的广袤疆域中,匿名讨论板如2ch的/b/板块,以其独特的去中心化交流模式,承载了海量用户生成内容,成为研究网络语言行为、社会互动模式及多模态数据融合的天然实验室。zeio/batch数据集由研究人员Zeio Nara于2023年10月31日创建,旨在系统化地收集并结构化来自2ch存档的帖子线程,以支持文本生成、文本分类及问答等自然语言处理任务。该数据集不仅涵盖了俄英双语的书面语料,还创新性地引入了基于文本自动生成的语音版本,通过交替说话者模式模拟对话场景,为多模态学习提供了宝贵资源。其影响力体现在为社交网络分析、非正式语言模型训练及口语交互系统研究开辟了新的数据来源,推动了从匿名社区语料中挖掘潜在语言规律的学术探索。
当前挑战
该数据集面临的核心挑战源自其构建与应用的多个层面。首先,在领域问题层面,数据集聚焦于匿名讨论板的非正式、口语化乃至粗俗语言,这要求模型具备处理不规范拼写、网络俚语、情感极化和跨话题跳跃的能力,远超传统书面语料的范畴。其次,构建过程中遭遇了显著的技术性障碍:如何在不破坏Git仓库结构的前提下管理超过十万个文件,最终通过分簇压缩与目录分组得以解决;同时,将文本自动转换为语音时,需设计交替说话者模式以模拟真实对话,但TTS引擎可能无法准确还原网络文本中的语气、强调与非标准发音,导致语音质量参差不齐。此外,数据集的隐私与伦理挑战不容忽视,匿名帖子中可能包含敏感内容,需在公开使用时谨慎处理,避免侵犯用户权益。
常用场景
经典使用场景
zeio/batch数据集源自2ch论坛/b/版块的线程存档,为研究者提供了丰富的俄英双语社交网络对话文本。其经典使用场景在于文本生成任务,尤其是多轮对话生成与主题建模。数据集以线程为基本单元,将帖子组织成话题与回复的层级结构,天然适合训练能够理解对话上下文、生成连贯回复的语言模型。研究者可基于其written配置,探索非结构化论坛对话中的语义连贯性与话题转移模式,从而推动对话系统在自由讨论场景下的表现提升。
解决学术问题
该数据集有效解决了学术研究中匿名社交网络语料匮乏的难题,特别是针对俄语非正式文本的建模需求。它支持文本分类与问答任务,可用于研究论坛中的信息检索模式、用户意图识别及情感倾向分析。通过其独特的帖子层级结构,学者能够深入探究对话中的引用关系与话题演化规律,为语篇分析、社会语言学及计算社会科学提供基准数据。其意义在于弥补了主流数据集对非英语、低资源语言社交文本覆盖的不足,推动了多语言对话理解的学术进展。
衍生相关工作
该数据集衍生了一系列经典工作,例如基于其compressed和uncompressed格式的线程压缩与索引优化研究,以及利用spoken配置进行语音对话生成的探索。相关研究包括使用该数据集训练用于俄语论坛的预训练语言模型,以及开发针对匿名社交网络的仇恨言论检测系统。此外,有工作基于其对话结构设计了新的对话评估指标,推动了对话系统评价体系的完善。这些衍生产品不仅验证了数据集的多样性,还促进了社交网络分析与自然语言处理领域的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务