遇见数据集

holodata/sensai

收藏
Hugging Face2021-11-01 更新2024-03-04 收录
官方服务:

资源简介:

# ❤️‍🩹 Sensai: Toxic Chat Dataset Sensai is a toxic chat dataset consists of live chats from Virtual YouTubers' live streams. Download the dataset from [Kaggle Datasets](https://www.kaggle.com/uetchy/sensai) and join `#livechat-dataset` channel on [holodata Discord](https://holodata.org/discord) for discussions. ## Provenance - **Source:** YouTube Live Chat events (all streams covered by [Holodex](https://holodex.net), including Hololive, Nijisanji, 774inc, etc) - **Temporal Coverage:** From 2021-01-15T05:15:33Z - **Update Frequency:** At least once per month ## Research Ideas - Toxic Chat Classification - Spam Detection - Sentence Transformer for Live Chats See [public notebooks](https://www.kaggle.com/uetchy/sensai/code) for ideas. ## Files | filename | summary | size | | ------------------------- | -------------------------------------------------------------- | -------- | | `chats_flagged_%Y-%m.csv` | Chats flagged as either deleted or banned by mods (3,100,000+) | ~ 400 MB | | `chats_nonflag_%Y-%m.csv` | Non-flagged chats (3,100,000+) | ~ 300 MB | To make it a balanced dataset, the number of `chats_nonflags` is adjusted (randomly sampled) to be the same as `chats_flagged`. Ban and deletion are equivalent to `markChatItemsByAuthorAsDeletedAction` and `markChatItemAsDeletedAction` respectively. ## Dataset Breakdown ### Chats (`chats_%Y-%m.csv`) | column | type | description | | --------------- | ------ | ---------------------------- | | body | string | chat message | | membership | string | membership status | | authorChannelId | string | anonymized author channel id | | channelId | string | source channel id | #### Membership status | value | duration | | ----------------- | ------------------------- | | unknown | Indistinguishable | | non-member | 0 | | less than 1 month | < 1 month | | 1 month | >= 1 month, < 2 months | | 2 months | >= 2 months, < 6 months | | 6 months | >= 6 months, < 12 months | | 1 year | >= 12 months, < 24 months | | 2 years | >= 24 months | #### Pandas usage Set `keep_default_na` to `False` and `na_values` to `''` in `read_csv`. Otherwise, chat message like `NA` would incorrectly be treated as NaN value. ```python import pandas as pd from glob import iglob flagged = pd.concat([ pd.read_csv(f, na_values='', keep_default_na=False) for f in iglob('../input/sensai/chats_flagged_*.csv') ], ignore_index=True) ``` ## Consideration ### Anonymization `authorChannelId` are anonymized by SHA-1 hashing algorithm with a pinch of undisclosed salt. ### Handling Custom Emojis All custom emojis are replaced with a Unicode replacement character `U+FFFD`. ## Citation ```latex @misc{sensai-dataset, author={Yasuaki Uechi}, title={Sensai: Toxic Chat Dataset}, year={2021}, month={8}, version={31}, url={https://github.com/holodata/sensai-dataset} } ``` ## License - Code: [MIT License](https://github.com/holodata/sensai-dataset/blob/master/LICENSE) - Dataset: [ODC Public Domain Dedication and Licence (PDDL)](https://opendatacommons.org/licenses/pddl/1-0/index.html)

# ❤️‍🩹 Sensai:有毒聊天数据集 Sensai是一个收录虚拟主播(Virtual YouTuber)直播流实时聊天内容的有毒聊天数据集。 可从[Kaggle数据集](https://www.kaggle.com/uetchy/sensai)下载本数据集,并加入[holodata Discord社区](https://holodata.org/discord)的`#livechat-dataset`频道参与讨论。 ## 数据集溯源 - **来源**:YouTube直播聊天事件(覆盖[Holodex](https://holodex.net)收录的全部直播流,包括Hololive、Nijisanji、774inc等社团的内容) - **时间覆盖范围**:始于2021-01-15T05:15:33Z - **更新频率**:每月至少更新一次 ## 研究方向 - 有毒聊天分类 - 垃圾信息检测 - 面向直播聊天的Sentence Transformer 可参考[公开Notebook](https://www.kaggle.com/uetchy/sensai/code)获取更多研究思路。 ## 文件列表 | 文件名 | 摘要 | 大小 | | ------------------------- | -------------------------------------------------------------- | -------- | | `chats_flagged_%Y-%m.csv` | 被版主标记为删除或封禁的聊天记录(超310万条) | 约400 MB | | `chats_nonflag_%Y-%m.csv` | 未被标记的聊天记录(超310万条) | 约300 MB | 为构建均衡数据集,我们对`chats_nonflag`数据集进行随机采样,使其规模与`chats_flagged`保持一致。封禁与删除操作分别对应`markChatItemsByAuthorAsDeletedAction`与`markChatItemAsDeletedAction`。 ## 数据集结构 ### 聊天记录文件(`chats_%Y-%m.csv`) | 字段名 | 数据类型 | 说明 | | --------------- | ------ | ---------------------------- | | `body` | 字符串 | 聊天消息内容 | | `membership` | 字符串 | 会员身份状态 | | `authorChannelId` | 字符串 | 匿名化处理后的作者频道ID | | `channelId` | 字符串 | 来源频道ID | #### 会员身份状态说明 | 取值 | 时长说明 | | ----------------- | ------------------------- | | `unknown` | 无法区分 | | `non-member` | 非会员 | | `less than 1 month` | 入会时长不足1个月 | | `1 month` | 入会时长≥1个月且<2个月 | | `2 months` | 入会时长≥2个月且<6个月 | | `6 months` | 入会时长≥6个月且<12个月 | | `1 year` | 入会时长≥12个月且<24个月 | | `2 years` | 入会时长≥24个月 | #### Pandas使用指南 在使用`pd.read_csv`读取文件时,请将`keep_default_na`参数设为`False`,并将`na_values`参数设为`''`。否则,形如`NA`的聊天消息会被错误识别为缺失值(NaN)。 python import pandas as pd from glob import iglob flagged = pd.concat([ pd.read_csv(f, na_values='', keep_default_na=False) for f in iglob('../input/sensai/chats_flagged_*.csv') ], ignore_index=True) ## 注意事项 ### 匿名化处理 `authorChannelId`字段通过SHA-1哈希算法结合未公开的盐值进行匿名化处理。 ### 自定义表情处理 所有自定义表情均被替换为Unicode替换字符`U+FFFD`。 ## 引用格式 latex @misc{sensai-dataset, author={Yasuaki Uechi}, title={Sensai: Toxic Chat Dataset}, year={2021}, month={8}, version={31}, url={https://github.com/holodata/sensai-dataset} } ## 许可协议 - 代码:[MIT许可协议](https://github.com/holodata/sensai-dataset/blob/master/LICENSE) - 数据集:[ODC公共领域奉献与许可协议(PDDL)](https://opendatacommons.org/licenses/pddl/1-0/index.html)

提供机构:
holodata
原始信息汇总

数据集概述

数据集名称

Sensai: Toxic Chat Dataset

数据集来源

  • 源数据: YouTube Live Chat事件,涵盖了Holodex下的所有直播流,包括Hololive, Nijisanji, 774inc等。
  • 时间覆盖: 从2021-01-15T05:15:33Z开始。
  • 更新频率: 至少每月更新一次。

数据集内容

文件详情

文件名 概述 大小
chats_flagged_%Y-%m.csv 被标记为删除或被管理员禁止的聊天记录(超过3,100,000条) 约400 MB
chats_nonflag_%Y-%m.csv 未被标记的聊天记录(超过3,100,000条) 约300 MB

数据集结构

聊天记录 (chats_%Y-%m.csv)

列名 类型 描述
body string 聊天消息
membership string 会员状态
authorChannelId string 匿名的作者频道ID
channelId string 源频道ID

会员状态

持续时间
unknown 无法区分
non-member 0
less than 1 month < 1个月
1 month >= 1个月,< 2个月
2 months >= 2个月,< 6个月
6 months >= 6个月,< 12个月
1 year >= 12个月,< 24个月
2 years >= 24个月

数据集处理

匿名化

  • authorChannelId 使用SHA-1哈希算法进行匿名处理,并加入未公开的盐值。

处理自定义表情

  • 所有自定义表情被替换为Unicode替换字符 U+FFFD

许可证

搜集汇总
数据集介绍
构建方式
Sensai数据集源自虚拟YouTuber直播过程中的YouTube实时聊天事件,覆盖Hololive、Nijisanji、774inc等多个VTuber团体,时间跨度自2021年1月15日起。数据通过Holodex平台收集,每月至少更新一次。构建时,将聊天记录分为被版主标记为删除或封禁的违规消息(chats_flagged)与未被标记的正常消息(chats_nonflag),并通过随机采样使两类样本数量均衡,各约310万条,形成平衡数据集。每条记录包含消息文本、成员身份、匿名化的作者频道ID和来源频道ID等字段。
特点
该数据集的核心特点在于其平衡的二元分类结构,专为有毒聊天分类、垃圾信息检测及实时聊天句子嵌入等研究场景设计。数据经过严格匿名化处理,作者频道ID采用SHA-1哈希算法加盐加密,保障隐私安全。自定义表情符号统一替换为Unicode替换字符U+FFFD,确保文本一致性。数据集以月度CSV文件形式组织,体积适中,便于下载与处理。此外,数据来源涵盖多个VTuber团体,具有广泛的代表性,适用于跨平台、跨文化的毒性内容分析。
使用方法
使用Sensai数据集时,推荐采用Pandas库进行加载。需注意在read_csv函数中设置keep_default_na为False、na_values为空字符串,以避免将类似'NA'的聊天消息错误识别为缺失值。可通过glob模块的iglob函数遍历所有月度CSV文件,并使用pd.concat合并为完整数据框。数据集已公开于Kaggle平台,支持直接下载与代码集成。研究人员可参考Kaggle上的公开notebook获取分类模型训练、特征提取等实际应用示例,并参与holodata Discord社区讨论以获取最新动态。
背景与挑战
背景概述
随着虚拟主播(VTuber)产业的蓬勃发展,其直播间的实时聊天系统已成为用户互动与社区文化的重要载体。然而,这一开放性的交流空间也面临着网络暴力、恶意刷屏及垃圾信息等毒性内容的严峻挑战,严重影响了观众体验与社区生态健康。在此背景下,由研究员Yasuaki Uechi于2021年主导创建的Sensai毒性聊天数据集应运而生。该数据集依托Holodex平台,系统收集了自2021年1月15日起来自Hololive、Nijisanji、774inc等主流VTuber团体直播间的YouTube实时聊天事件,涵盖了超过310万条被版主标记为删除或封禁的毒性消息及同等数量的正常消息,为毒性聊天分类、垃圾信息检测及聊天专用句子嵌入模型等研究提供了大规模、平衡且具有代表性的标注资源,对推动虚拟直播场景下的内容安全与自然语言处理研究具有重要的基础性价值。
当前挑战
Sensai数据集所应对的核心领域挑战在于,虚拟主播直播间的实时聊天流具有高噪声、多语言混合、大量使用自定义表情符号及网络俚语等独特特征,传统毒性检测模型难以有效泛化至这一场景,亟需专用数据集以提升分类精度。在构建过程中,数据集面临多重技术难题:首先,如何从海量实时聊天事件中准确区分版主主动执行的删除与封禁操作(分别对应YouTube API中的`markChatItemsByAuthorAsDeletedAction`与`markChatItemAsDeletedAction`事件)以获取可靠的毒性标注;其次,为保护用户隐私,需对所有作者频道ID进行SHA-1哈希加盐匿名化处理,同时确保匿名化后仍可用于用户行为分析;此外,所有自定义表情符号需统一替换为Unicode替换字符U+FFFD以避免编码混乱,这些预处理步骤的精确实施直接决定了数据集的可用性与伦理合规性。
常用场景
经典使用场景
在虚拟主播(VTuber)直播生态中,实时聊天内容往往混杂着大量不当言论,而Sensai数据集正是为应对这一挑战而生。该数据集收录了来自Hololive、Nijisanji等主要虚拟主播团体直播间的逾六百万条聊天记录,其中约一半被标记为被版主删除或封禁的毒性内容,另一半则为正常信息,形成了平衡的二元分类样本库。其经典使用场景聚焦于毒性聊天分类与垃圾信息检测,研究者可基于这些带有明确标签的文本,训练能够自动识别攻击性、骚扰性或违规言论的机器学习模型,从而在直播场景中实现高效的内容审核。
衍生相关工作
围绕Sensai数据集,学术界与工业界已衍生出多项具有影响力的工作。在模型层面,研究者尝试将其与预训练语言模型如BERT或RoBERTa结合,探索针对直播聊天短文本的微调策略,并对比了不同嵌入方法在毒性分类上的性能差异。在任务拓展上,部分工作引入了基于时间序列的毒性爆发预测,利用聊天流量的异常波动提前预警潜在冲突。此外,该数据集还催生了针对虚拟主播社区特有的“会员身份与毒性言论关联性”的实证研究,揭示了不同粉丝层级在语言暴力中的参与模式,这些成果均进一步巩固了Sensai作为实时聊天毒性分析基准数据集的重要地位。
数据集最近研究
最新研究方向
在虚拟主播(VTuber)直播生态迅猛发展的背景下,holodata/sensai数据集聚焦于直播聊天室中的毒性言论识别与垃圾信息过滤,成为网络内容安全领域的前沿研究资源。该数据集收录了来自Hololive、Nijisanji等主流VTuber团体直播间的逾300万条被标记(删除或封禁)与未被标记的聊天记录,为构建平衡的毒性文本分类模型提供了高质量标注样本。当前研究热点集中于利用该数据集训练面向实时聊天流的句子嵌入模型,以提升对隐性攻击、广告骚扰及跨语言不当内容的检测精度。其匿名化处理与自定义表情符号的标准化策略,也为隐私保护与多模态内容分析树立了重要基准。随着VTuber行业在全球范围内的爆发式增长,sensai数据集不仅推动了直播社区治理技术的演进,更对维护虚拟社交空间的健康生态具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务