Gupshup
收藏资源简介:
Gupshup 是一个真实的罗马化印地语-英语混合(Hinglish)聊天数据集,源自印度社区论坛,包含 229,753 条消息。这些消息反映了印度用户实际在线输入的印地语-英语代码混合语言,其中自定义表情符号被保留为 `[EMOTE_*]` 标记,因为在这些聊天环境中表情符号本身就是一种语言。数据集涵盖四种不同类型的聊天室:大型公共青年聚集地、小型朋友圈服务器、故事社区房间以及一个跨度 7 年的大型综合房间(2019-2026)。每条记录包含匿名化作者标识符、ISO-8601 时间戳、清洗后的文本、回复文本、弱正则主题标签、是否包含表情标记、文本长度以及来源房间标签。数据经过严格的隐私清洗,包括哈希作者、删除提及/ID/邮箱/链接、滥用检测、去重等。该数据集适用于文本生成(如对话建模)和文本分类(如话题检测、情感分析、代码混合识别)等任务。
Gupshup is a real romanized Hindi-English mixed (Hinglish) chat dataset sourced from Indian community forums, containing 229,753 messages. These messages reflect the Hindi-English code-mixed language actually typed by Indian users online, where custom emojis are retained as `[EMOTE_*]` tokens because emojis themselves serve as a language in these chat environments. The dataset covers four different types of chat rooms: large public youth gathering places, small friend group servers, story community rooms, and a large comprehensive room spanning 7 years (2019-2026). Each record includes an anonymized author identifier, ISO-8601 timestamp, cleaned text, reply text, weak regular expression topic tags, emoji presence flag, text length, and source room label. The data has undergone strict privacy cleaning, including author hashing, removal of mentions/IDs/emails/links, abuse detection, deduplication, etc. This dataset is suitable for tasks such as text generation (e.g., dialogue modeling) and text classification (e.g., topic detection, sentiment analysis, code-mixed identification).
Gupshup 数据集概述
基本信息
- 名称:Gupshup
- 语言:英语(内容为罗马字母书写的印地语-英语混合语,即 Hinglish)
- 许可证:MIT
- 标签:hinglish、code-mixing(语码混合)、transliteration(音译)、sociolinguistics(社会语言学)、chat、language-modeling
- 任务类别:文本生成、文本分类
- 数据集规模:100K < n < 1M
数据集简介
Gupshup 是一个来自印度社区论坛的真实罗马字母 Hinglish 闲聊数据集,包含 229,753 条消息,涵盖问候语循环(如 kaha se ho, kkrh)、Minecraft 招募、Valorant 游戏协调以及食物/睡眠等日常闲聊内容。数据为用户真实输入,非诱导式采集,无提示语、无翻译、无参考标注。
核心特点
- 自然的语码混合:与 elicited 资源(如 hinglish-bench)互补,提供真实观察到的 Hinglish 训练/评估数据,包括音译不一致现象。
- 表情符号作为语言:超过三分之一的消息携带自定义表情符号 token(以
[EMOTE_*]形式保留),支持表情语义与预测任务。 - 四种语域:包括高流量公共青年聚集地、紧密朋友圈服务器、故事社区房间,以及横跨 2019-2026 年的大型综合房间。
- 隐私清洗:作者已哈希化,提及、ID、邮箱、链接均已删除,朋友圈服务器的名字已做名字删除处理,并设有滥用、年龄标识和私信诱惑等黑名单过滤。
数据划分
数据集按 90/10 比例进行随机划分(种子为 42):
| 划分 | 行数 | 占比 |
|---|---|---|
| Train | 206,777 | 90.0% |
| Test | 22,976 | 10.0% |
| 总计 | 229,753 | 100% |
来源分布
| 来源 | 行数 | 占比 |
|---|---|---|
| 大型综合房间(7年跨度) | 190,403 | 82.9% |
| 闲谈房间 | 29,359 | 12.8% |
| 新综合房间 | 7,701 | 3.4% |
| 大型公共房间 | 1,134 | 0.5% |
| 小型朋友圈 | 721 | 0.3% |
| 故事社区房间 | 435 | 0.2% |
数据字段
| 字段名 | 类型 | 描述 |
|---|---|---|
id |
string | 原始消息 ID |
author |
string | 匿名化作者(USER_<sha8> 格式) |
timestamp |
string | ISO-8601 UTC 时间戳 |
text |
string | 清洗后的消息文本,表情符号以 [EMOTE_*] 形式保留 |
reply_to_text |
string | 父消息文本(可能为空) |
topics |
list[string] | 基于弱正则的主题标签 |
has_emote |
bool | 是否包含 [EMOTE_*] token |
char_len |
int | text 的长度 |
source |
string | 来源房间的匿名标签(如 room-4cc844、large-public-room、small-friend-circle) |
使用方法
可通过 Hugging Face datasets 库直接加载:
python from datasets import load_dataset
ds = load_dataset("saidutta69/Gupshup", split="train") print(f"Examples: {len(ds)}") print(ds[0]["text"], ds[0]["topics"])
匿名化处理说明
原始导出数据约有 3,700,000 条消息。发布的数据仅保留实质性的良性尾部内容(60-350 字符),并经过以下处理:滥用/性别探测/年龄标识/私信诱饵/宗教/人肉搜索/电话号码/毒品等黑名单过滤、作者哈希化、提及/角色/频道/ID 删除(以 [MENTION]/[ID] 标记)、邮箱和链接删除、服务器名和创建者名删除(包括表情符号 token 内),朋友圈服务器成员名字删除,最多 3 次文本重复限制,每位作者最多 150 行,以及真实文本下限过滤(不少于 25 个非 token 字符,以过滤提及和表情垃圾信息)。数据集构建器为 _hf_datasets/build_adda.py,采用确定性流程且可重复运行;新的聊天导出可自动发现,重新导出按消息 ID 去重。
注意事项
源房间用户群体偏年轻。所有年龄和学校标识均已过滤,作者已哈希化,但数据仍属于青少年邻近内容,请谨慎使用。主题标签为正则启发式结果,并非人工标注的黄金标准。




