遇见数据集

Gupshup

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

Gupshup 是一个真实的罗马化印地语-英语混合(Hinglish)聊天数据集,源自印度社区论坛,包含 229,753 条消息。这些消息反映了印度用户实际在线输入的印地语-英语代码混合语言,其中自定义表情符号被保留为 `[EMOTE_*]` 标记,因为在这些聊天环境中表情符号本身就是一种语言。数据集涵盖四种不同类型的聊天室:大型公共青年聚集地、小型朋友圈服务器、故事社区房间以及一个跨度 7 年的大型综合房间(2019-2026)。每条记录包含匿名化作者标识符、ISO-8601 时间戳、清洗后的文本、回复文本、弱正则主题标签、是否包含表情标记、文本长度以及来源房间标签。数据经过严格的隐私清洗,包括哈希作者、删除提及/ID/邮箱/链接、滥用检测、去重等。该数据集适用于文本生成(如对话建模)和文本分类(如话题检测、情感分析、代码混合识别)等任务。

Gupshup is a real romanized Hindi-English mixed (Hinglish) chat dataset sourced from Indian community forums, containing 229,753 messages. These messages reflect the Hindi-English code-mixed language actually typed by Indian users online, where custom emojis are retained as `[EMOTE_*]` tokens because emojis themselves serve as a language in these chat environments. The dataset covers four different types of chat rooms: large public youth gathering places, small friend group servers, story community rooms, and a large comprehensive room spanning 7 years (2019-2026). Each record includes an anonymized author identifier, ISO-8601 timestamp, cleaned text, reply text, weak regular expression topic tags, emoji presence flag, text length, and source room label. The data has undergone strict privacy cleaning, including author hashing, removal of mentions/IDs/emails/links, abuse detection, deduplication, etc. This dataset is suitable for tasks such as text generation (e.g., dialogue modeling) and text classification (e.g., topic detection, sentiment analysis, code-mixed identification).

创建时间:
2026-09-05
原始信息汇总

Gupshup 数据集概述

基本信息

  • 名称:Gupshup
  • 语言:英语(内容为罗马字母书写的印地语-英语混合语,即 Hinglish)
  • 许可证:MIT
  • 标签:hinglish、code-mixing(语码混合)、transliteration(音译)、sociolinguistics(社会语言学)、chat、language-modeling
  • 任务类别:文本生成、文本分类
  • 数据集规模:100K < n < 1M

数据集简介

Gupshup 是一个来自印度社区论坛的真实罗马字母 Hinglish 闲聊数据集,包含 229,753 条消息,涵盖问候语循环(如 kaha se ho, kkrh)、Minecraft 招募、Valorant 游戏协调以及食物/睡眠等日常闲聊内容。数据为用户真实输入,非诱导式采集,无提示语、无翻译、无参考标注。

核心特点

  1. 自然的语码混合:与 elicited 资源(如 hinglish-bench)互补,提供真实观察到的 Hinglish 训练/评估数据,包括音译不一致现象。
  2. 表情符号作为语言:超过三分之一的消息携带自定义表情符号 token(以 [EMOTE_*] 形式保留),支持表情语义与预测任务。
  3. 四种语域:包括高流量公共青年聚集地、紧密朋友圈服务器、故事社区房间,以及横跨 2019-2026 年的大型综合房间。
  4. 隐私清洗:作者已哈希化,提及、ID、邮箱、链接均已删除,朋友圈服务器的名字已做名字删除处理,并设有滥用、年龄标识和私信诱惑等黑名单过滤。

数据划分

数据集按 90/10 比例进行随机划分(种子为 42):

划分 行数 占比
Train 206,777 90.0%
Test 22,976 10.0%
总计 229,753 100%

来源分布

来源 行数 占比
大型综合房间(7年跨度) 190,403 82.9%
闲谈房间 29,359 12.8%
新综合房间 7,701 3.4%
大型公共房间 1,134 0.5%
小型朋友圈 721 0.3%
故事社区房间 435 0.2%

数据字段

字段名 类型 描述
id string 原始消息 ID
author string 匿名化作者(USER_<sha8> 格式)
timestamp string ISO-8601 UTC 时间戳
text string 清洗后的消息文本,表情符号以 [EMOTE_*] 形式保留
reply_to_text string 父消息文本(可能为空)
topics list[string] 基于弱正则的主题标签
has_emote bool 是否包含 [EMOTE_*] token
char_len int text 的长度
source string 来源房间的匿名标签(如 room-4cc844large-public-roomsmall-friend-circle

使用方法

可通过 Hugging Face datasets 库直接加载:

python from datasets import load_dataset

ds = load_dataset("saidutta69/Gupshup", split="train") print(f"Examples: {len(ds)}") print(ds[0]["text"], ds[0]["topics"])

匿名化处理说明

原始导出数据约有 3,700,000 条消息。发布的数据仅保留实质性的良性尾部内容(60-350 字符),并经过以下处理:滥用/性别探测/年龄标识/私信诱饵/宗教/人肉搜索/电话号码/毒品等黑名单过滤、作者哈希化、提及/角色/频道/ID 删除(以 [MENTION]/[ID] 标记)、邮箱和链接删除、服务器名和创建者名删除(包括表情符号 token 内),朋友圈服务器成员名字删除,最多 3 次文本重复限制,每位作者最多 150 行,以及真实文本下限过滤(不少于 25 个非 token 字符,以过滤提及和表情垃圾信息)。数据集构建器为 _hf_datasets/build_adda.py,采用确定性流程且可重复运行;新的聊天导出可自动发现,重新导出按消息 ID 去重。

注意事项

源房间用户群体偏年轻。所有年龄和学校标识均已过滤,作者已哈希化,但数据仍属于青少年邻近内容,请谨慎使用。主题标签为正则启发式结果,并非人工标注的黄金标准。

搜集汇总
数据集介绍
Gupshup 数据集图片
构建方式
Gupshup数据集从印度社区论坛中采集了229,753条真实罗马音印地语-英语混合聊天消息,覆盖2019至2026年间多个不同规模的聊天室。构建过程严格遵循隐私保护与内容筛选原则:原始约370万条消息经过去重、长度过滤(保留60至350字符的实质内容)、滥用及敏感信息屏蔽后,仅保留良性尾部数据。所有作者标识均已哈希匿名化,提及、角色、频道、ID、邮箱、链接等均被脱敏处理,自定义表情符号则以[EMOTE_*]令牌形式保留,以维持原始语境。数据集按90/10比例划分训练与测试集,并确保构建过程确定性可复现。
特点
Gupshup数据集的核心特点在于其自然呈现的语言混杂现象与表情符号的语言角色。与通过诱导或翻译生成的同类资源不同,此处收录的是印度网民实际键入的印地语-英语代码混合文本,包含拼写不一致等真实特征。超过三分之一的消息携带自定义表情令牌,为表情语义与预测任务提供了独特素材。此外,数据集涵盖四种不同语域:高流量公共青年社区、紧密好友圈、故事社区及长达七年的大型综合聊天室,展现了丰富的社会语言多样性。所有内容均经过彻底隐私审查,确保合规发布。
使用方法
Gupshup数据集可直接通过HuggingFace datasets库加载,适用于文本生成与文本分类等任务。研究者可利用其进行自然代码混合的语言建模、表情符号预测、话题标签推断等研究。数据字段包含原始文本、匿名作者、时间戳、回复上下文、弱正则话题标签及表情存在标志,为多维度分析提供支持。使用时需注意话题标签为启发式标注而非金标准,且数据来源偏青年群体,应谨慎处理年龄相关推断。数据集以MIT许可证发布,可自由用于学术与商业目的。
背景与挑战
背景概述
Gupshup数据集由研究者saidutta69于2026年创建并发布,旨在捕捉印度社区论坛中真实的罗曼字体印地语-英语语码混合(Hinglish)对话。该数据集包含229,753条消息,源自四个不同注册类型的Discord房间,时间跨度从2019年至2026年,覆盖了广泛的青年社交互动场景。其核心研究问题在于提供一种自然、未经过滤的语码混合语料,以补充已有的引发式数据集如hinglish-bench,从而推动对Hinglish语言建模、情感分析及社会语言学的研究。Gupshup的独特之处在于其保留了自定义表情符号作为[EMOTE_*]标记,并强调了表情符号在交流中的语言功能,为多模态语言理解提供了新视角。该数据集通过严格的隐私清洗流程,确保作者匿名化,同时保持文本的真实性,对计算语言学、社交计算及低资源语言处理领域具有重要影响力。
当前挑战
Gupshup数据集面临的挑战主要来自两方面。在领域问题层面,Hinglish语码混合涉及复杂的音译不一致性、词汇借用及语法混合,且缺乏标准化的标注规范,给语言模型的训练与评估带来困难。此外,该数据集聚焦于青年群体,其俚语、网络用语及动态变化的表达方式,对模型的情感分析和语义理解构成了持续挑战。在构建过程中,数据处理需平衡隐私保护与信息保留,面临身份信息泄露风险,必须通过哈希、脱敏及内容过滤等多种手段确保合规,同时避免过度清洗导致文本失真。此外,从约370万条原始消息中筛选出高质量文本,需应对大量噪声、重复及滥用内容,且多源房间的整合需统一标签与格式,确保数据一致性和可用性,这些均是构建过程中不可忽视的技术难题。
常用场景
经典使用场景
在自然语言处理领域,语码混合(code-mixing)资源的稀缺长期制约着多语言社会语言学研究的深入。Gupshup数据集以其源自印度社区论坛的真实罗马化印地语-英语闲聊文本,为研究者提供了观察自然语码混合现象的宝贵窗口。该数据集最经典的使用场景当属语言建模与生成任务,其229,753条消息构建了大规模的训练与测试分割,可用于训练和评估能够处理语码混合输入的神经语言模型。特别值得注意的是,数据集中超过三分之一的样本包含自定义表情符号标记,这一特性使得Gupshup成为探索表情符语义表征及其预测任务的独特基石,这是纯文本语料库难以企及的研究维度。此外,数据集的对话结构(含回复关系)支持对话生成与响应预测任务,而四类不同语域的覆盖则允许研究者探讨语域差异对语码混合模式的影响,从而为多语言自然语言处理提供更贴近真实使用场景的测试床。
衍生相关工作
该数据集的发布已催生了一系列相关探索,尽管具体名单未在页面上详列,但可预见其将成为多个研究分支的触发点。语言建模方面,研究者可能基于此构建面向语码混合的语言模型预训练与评测基准,推动模型对转写变异和语码交替的鲁棒性研究。表情符语义方向,数据集中独有的[EMOTE_*]标记或激发诸如预测消息中应当出现何种表情符的任务,进而发展为多模态情感理解的辅助资源。社会语言学层面,带有时间戳和来源标注的消息可支持网络语言变异的纵向追踪,探究七年内青年用语及语码混合模式的变迁。自然语言处理流程中的隐私保护技术同样受益,其匿名化方法或促使构建‘隐私安全NLP基准’,推动针对敏感数据的模型开发。这些衍生工作不仅扩展了数据集本身的价值,还可能在计算语言学顶级会议如ACL、EMNLP上催生新的研究热潮,使Gupshup成为连接印地语-英语社群计算研究与工业应用的重要枢纽。
数据集最近研究
最新研究方向
该数据集聚焦于罗马化印地语-英语混码(Hinglish)的真实聊天语料,捕捉了印度社区论坛中自然发生的语言混合现象,包括拼音转写的不一致性及自定义表情符号作为语言成分的独特使用。其前沿研究方向体现在对低资源代码混合语言的社会语言学建模、表情符号语义预测以及多语态(多语码)对话系统的训练与评估。鉴于Hinglish在印度互联网用户中的广泛使用,Gupshup为自然语言处理领域提供了稀缺的真实交互数据,推动了对非规范文本、混码现象的鲁棒性研究。同时,其严格的隐私清洗流程为社交媒体语料的安全共享树立了新标杆,对开发包容性更强的多语言AI系统具有关键意义,尤其在会话式AI和文本生成领域,该数据集有助于弥合标准语言与线上实际使用之间的鸿沟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务