遇见数据集

tdtu_vietnamese_hsd_final

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

该数据集包含多个配置版本,主要用于文本分类任务。核心数据包含四个字段:text(文本内容)、label(类别标签)、source(数据来源标识)和split(数据划分标识,如训练集)。数据集提供了五种不同的配置:1) default 配置:包含标准的训练集(tdtu_train,86,719条)、开发集(tdtu_dev,2,650条)和测试集(tdtu_test,6,576条);2) baseline_llm 配置:包含一个扩增的训练集(88,279条),可能由基础大语言模型生成或处理;3) eda 配置:包含一个通过EDA(简易数据增强)技术大幅扩增的训练集(135,010条);4) llm_gemma 和 5) llm_qwen 配置:分别包含由Gemma和Qwen大语言模型生成或处理的较小规模训练集(分别为1,572条和1,492条)。不同配置旨在支持对比研究,例如评估不同数据增强方法或不同大语言模型生成数据对文本分类模型性能的影响。

This dataset contains multiple configurations primarily for text classification tasks. The core data includes four fields: text (text content), label (category label), source (data source identifier), and split (data split identifier, e.g., training set). Five configurations are provided: 1) default configuration: includes standard training set (tdtu_train, 86,719 samples), development set (tdtu_dev, 2,650 samples), and test set (tdtu_test, 6,576 samples); 2) baseline_llm configuration: includes an augmented training set (88,279 samples), possibly generated or processed by a base large language model; 3) eda configuration: includes a training set (135,010 samples) significantly augmented via EDA (Easy Data Augmentation) technique; 4) llm_gemma and 5) llm_qwen configurations: include smaller training sets (1,572 and 1,492 samples respectively) generated or processed by the Gemma and Qwen large language models. These configurations are designed to support comparative studies, such as evaluating the impact of different data augmentation methods or data generated by different large language models on text classification model performance.

创建时间:
2026-07-27
原始信息汇总

数据集概述

该数据集是一个用于越南语辱骂性言论检测(Hate Speech Detection)的数据集,包含多个配置(config),每个配置代表不同的数据增强或生成方式。数据集由四个字段组成:文本(text)、标签(label)、来源(source)和划分(split)。

配置详情

数据集共提供五个配置,各配置的划分与规模如下:

配置名称 划分 样本数量 数据大小(字节)
default tdtu_train 86,719 16,524,140
tdtu_dev 2,650 255,536
tdtu_test 6,576 641,101
baseline_llm tdtu_train 88,279 19,274,023
eda tdtu_train 135,010 27,604,330
llm_gemma tdtu_train 1,572 367,249
llm_qwen tdtu_train 1,492 392,200

字段说明

所有配置均包含以下四个字段:

  • text:文本内容(字符串类型)。
  • label:标签(字符串类型,如正常/辱骂等)。
  • source:数据来源。
  • split:数据划分标识(如训练集/开发集/测试集)。

数据来源

  • default 配置包含完整的三部分划分(训练、开发、测试),是基础数据集。
  • baseline_llmedallm_gemmallm_qwen 配置仅提供训练集,分别代表由大语言模型生成或经过数据增强(EDA)处理后的版本。
搜集汇总
数据集介绍
tdtu_vietnamese_hsd_final 数据集图片
构建方式
在越南语社交媒体文本的情感分析研究中,数据集的质量与规模直接决定了模型的泛化能力与鲁棒性。tdtu_vietnamese_hsd_final数据集由多个配置子集构成,其中默认配置(default)包含训练集(86719条)、开发集(2650条)与测试集(6576条),形成经典的三元组划分。此外,还提供了基于大语言模型生成的扩充数据:baseline_llm配置通过语言模型对原始训练数据进行重写,规模扩大至88279条;eda配置利用同义词替换与随机插入等词级增强策略,将训练集扩展至135010条;llm_gemma与llm_qwen配置则分别利用Gemma与Qwen模型生成语料,各包含约1500条样本。所有样本均包含文本内容、情感标签及来源标识,便于追踪数据出处。
特点
该数据集的核心特色在于其多维度配置设计,赋予了研究者灵活的实验选择。默认配置提供了一个完整的基准评测框架,训练、开发、测试集划分规范,便于模型效果的可重复验证。增强版配置则展现了数据集在缓解类别不平衡与提升模型鲁棒性上的潜力:eda配置通过词汇扰动丰富了表达多样性,而基于大语言模型(如Gemma、Qwen)的生成配置则为探索知识蒸馏与跨模型迁移提供了独特素材。特别地,所有增强配置均保留了与原始标签结构的一致性,确保了多源融合的可行性。此外,数据集涵盖了来自社交媒体等多种渠道的越南语文本,反映了真实场景中的语言混杂性与情感表达复杂性。
使用方法
研究者可通过HuggingFace的datasets库便捷加载不同配置子集,例如使用load_dataset函数并指定config_name参数为'default'获取标准划分,或选择'eda'、'baseline_llm'等增强版本进行实验。在情感分类任务中,建议以默认配置的tdtu_train作为训练集、tdtu_dev作为验证集、tdtu_test作为测试集,以公平评估模型性能。对于数据扩张研究,可将原始训练集与增强配置(如eda或llm_qwen)合并,观察数据多样性对模型的影响。各配置均包含'text'与'label'字段,可直接适配主流神经网络框架的输入格式;'source'字段可用于追溯样本生成来源,为消融分析提供依据。
背景与挑战
背景概述
社交媒体上的仇恨言论检测是自然语言处理领域的一项关键任务,尤其在多语言和低资源语言环境中面临严峻挑战。tdtu_vietnamese_hsd_final数据集由越南孙德胜大学(TDTU)的研究团队构建,旨在推动越南语仇恨言论检测的研究。该数据集创建于近年来,核心研究问题为如何有效识别和分类越南语社交媒体文本中的仇恨与攻击性言论。数据集包含多个配置,如default、baseline_llm、eda等,提供了训练、开发与测试集的划分,总计超过8万条样本,覆盖不同数据增强策略和生成式语言模型(如Gemma、Qwen)的辅助标签。该数据集的出现填补了越南语在此领域高质量标注资源的空白,为越南语社交媒体内容审核、舆情监控等应用提供了基础数据支撑,显著推动了低资源语言仇恨言论检测研究的发展。
当前挑战
该数据集所解决的领域挑战主要集中在越南语社交媒体文本的仇恨言论自动检测上。越南语作为一种低资源语言,缺乏大规模、高质量的标注数据集,且社交媒体文本包含大量俚语、拼写错误、表情符号和网络用语,使得传统模型难以捕捉语义和上下文中的仇恨表达。此外,仇恨言论的定义本身具有主观性和文化依赖性,标注一致性难以保证。在数据构建过程中,团队面临了多重挑战:首先,需从多样化的社交媒体平台(如Facebook、Twitter等)采集大规模原始文本,并有效过滤不相关或冗长内容;其次,人工标注成本高,且需要制定详尽且一致的标注指南来区分仇恨、攻击与正常言论;再者,为了缓解标注不平衡和提升模型鲁棒性,团队探索了数据增强(如EDA)和利用大语言模型(如Gemma、Qwen)生成伪标签的策略,但这些方法引入的噪声和偏见也带来了新的挑战,需要在模型训练中进行精细调参和验证。
常用场景
经典使用场景
在自然语言处理领域,tdtu_vietnamese_hsd_final数据集主要被用于构建和评估越南语仇恨言论检测系统。该数据集汇集了来自不同来源的文本样本,并标注了是否包含仇恨言论的标签,为研究人员提供了一个标准化的基准平台。经典的使用方式是利用其训练集(tdtu_train)来训练文本分类模型,进而通过开发集(tdtu_dev)和测试集(tdtu_test)对模型性能进行客观评估。此外,该数据集还提供了多种配置版本,包括基线模型、数据增强后的版本以及由不同大语言模型生成的样本,使得研究者能够探索不同训练策略和模型架构在越南语仇恨言论检测任务上的表现差异。
解决学术问题
该数据集的核心价值在于解决了越南语社会媒体内容中仇恨言论自动识别这一关键学术问题。随着社交网络的普及,越南语网络环境中仇恨言论的泛滥对社区和谐构成威胁,但缺乏高质量标注数据长期制约着该领域的深入研究。tdtu_vietnamese_hsd_final通过提供大规模、多源且经过精细标注的语料,使得研究者能够系统性地探索文本分类、少样本学习、跨语言迁移学习以及数据增强技术如何应用于低资源语言的仇恨言论检测任务。其多配置设计还促进了对比实验的开展,推动了鲁棒性与泛化能力的探讨,对构建安全、文明的多语言网络环境具有重要的学术启示意义。
衍生相关工作
tdtu_vietnamese_hsd_final数据集引发了多项衍生研究工作。研究者基于该数据集探索了数据增强策略对模型性能的影响,例如通过EDA(同义词替换、随机插入等)方法扩充训练样本,以及利用Gemma、Qwen等大语言模型生成合成数据以应对标注稀缺的问题。这些工作验证了数据增强在低资源场景下的有效性,并对比了不同生成模型所产数据质量的优劣。此外,该数据集还被用作评估预训练语言模型(如PhoBERT、XLM-R)在越南语仇恨言论检测任务上迁移学习能力的基准,推动了多语言语义理解与细粒度情感分析研究的深入发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务