benjaminvdb/dbrd
收藏官方服务:
资源简介:
DBRD(Dutch Book Review Dataset)数据集包含超过110,000条荷兰语书籍评论,其中22,000条带有二元情感极性标签。该数据集旨在作为荷兰语情感分类的基准,填补了荷兰语中缺乏适合情感分类的标注数据的空白。数据集分为训练集、测试集和无监督集,分别用于不同的机器学习任务,如文本生成、文本分类和情感分类。数据集的评论来源于荷兰书籍评论网站Hebban,经过过滤去除了非荷兰语评论。
DBRD(Dutch Book Review Dataset)数据集包含超过110,000条荷兰语书籍评论,其中22,000条带有二元情感极性标签。该数据集旨在作为荷兰语情感分类的基准,填补了荷兰语中缺乏适合情感分类的标注数据的空白。数据集分为训练集、测试集和无监督集,分别用于不同的机器学习任务,如文本生成、文本分类和情感分类。数据集的评论来源于荷兰书籍评论网站Hebban,经过过滤去除了非荷兰语评论。
提供机构:
benjaminvdb原始信息汇总
数据集概述
名称: DBRD (Dutch Book Review Dataset) 语言: 荷兰语 (nl) 许可证: Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License (cc-by-nc-sa-4.0) 多语言性: 单语种 大小: 100K<n<1M 源数据集: 原始数据 任务类别: 文本生成、填充掩码、文本分类 任务ID: 语言建模、掩码语言建模、情感分类 论文代码ID: dbrd 美观名称: DBRD
数据集结构
- 特征:
text: 字符串类型label: 分类标签,0 (neg) 或 1 (pos)
- 配置名称: plain_text
- 数据分割:
train: 20028个实例,29496333字节test: 2224个实例,3246243字节unsupervised: 96264个实例,152733031字节
- 下载大小: 79065872字节
- 数据集大小: 185475607字节
数据集创建
- 来源数据: 来自荷兰的书籍评论网站Hebban
- 注释: 通过将用户提供的1至5星评级映射到正面或负面标签来生成
- 个人和敏感信息: 数据集不包含个人或敏感信息
使用数据集的考虑
- 社会影响: 主要用于模型基准测试,特别是在荷兰语情感分类任务中
- 偏见讨论: 待补充
- 其他已知限制: 可能包含非荷兰语文本和商业内容,可能影响模型性能
搜集汇总
数据集介绍

构建方式
荷兰语情感分析领域长期受限于标注语料匮乏,DBRD数据集应运而生。该数据集源自荷兰书评平台Hebban,通过爬虫技术采集用户对书籍的1至5星评分及评论文本。构建过程中,将1-2星评分映射为消极标签(0),4-5星映射为积极标签(1),而3星中性评论则归入无监督集。为确保语言纯净性,利用langdetect工具过滤非荷兰语文本,最终形成逾11万条评论,其中约2.2万条带有明确的二元情感极性标注,并划分为训练集、测试集与无监督集,且正负样本在监督子集中保持平衡。
特点
DBRD数据集的核心特质在于其作为荷兰语情感分类基准的稀缺性与实用性。其标注来源于用户自然产生的星级评分,无需人工二次标注,降低了构建成本。数据呈现高度生态效度,涵盖长短不一、包含拼写错误及多语言混杂的真实网络评论,可有效检验模型在噪声环境下的鲁棒性。此外,数据集的规模与结构设计精巧,监督集(约2.2万条)与无监督集(约9.6万条)的划分支持半监督学习范式,为语言模型微调及序列建模任务提供了理想试验田。
使用方法
该数据集在HuggingFace上以plain_text配置存储,加载便捷。用户可通过datasets库的load_dataset函数直接调用,自动获取含标签的train和test分片用于监督学习,以及无标签的unsupervised分片用于预训练或特征提取。数据字段简洁,包含文本(text)与标签(label)两列,标签值0代表消极、1代表积极,无监督样例标签默认为-1。适用于文本分类、掩码语言建模及文本生成任务的模型训练与评估,尤其适合作为荷兰语自然语言处理研究的标准化测试平台。
背景与挑战
背景概述
荷兰语作为小语种在自然语言处理领域长期面临标注资源匮乏的困境,尤其在情感分类任务上,缺乏大规模、高质量的基准数据集。为填补这一空白,Benjamin van der Burgh于2019年在莱顿大学高级计算机科学研究所(LIACS)主导创建了DBRD(Dutch Book Review Dataset)数据集。该数据集从荷兰书评平台Hebban上采集了超过11万条用户评论,其中约2.2万条通过将1-2星评分映射为负面、4-5星评分映射为正面而获得二元情感极性标签,并保持了类别平衡。作为首个专为荷兰语情感分类设计的基准数据集,DBRD不仅为低资源语言模型评估提供了关键测试平台,还催生了关于通用语言模型微调在小数据集上效用的研究,其相关论文发表于arXiv,对推动多语言情感分析技术发展具有重要影响力。
当前挑战
DBRD数据集面临的核心挑战源于荷兰语情感分析领域的特殊困境。首先,领域问题层面,荷兰语缺乏像英语那样丰富的预训练资源和标注语料,使得情感分类模型在低资源场景下容易过拟合,而DBRD中评论包含拼写错误、多语言混杂等真实网络文本噪声,进一步加剧了模型泛化难度。其次,构建过程中,数据采集面临多重技术瓶颈:非荷兰语评论的自动过滤工具langdetect存在误判风险,尤其是多语言混合评论容易漏检;基于评分映射的标签生成方式(中性3星评论被剔除)虽简化标注流程,却可能丢失细微情感差异,导致标签噪声;此外,用户评论的匿名性和质量参差不齐(短评、商业推广内容混杂)也为数据清洗和模型鲁棒性带来持续挑战。
常用场景
经典使用场景
DBRD数据集作为荷兰语情感分类的标杆基准,被广泛应用于序列建模与文本分类任务。在经典使用场景中,研究人员利用其标注的22,252条正负极性书评,训练和评估面向小语种的深度学习模型。该数据集的独特之处在于其包含约96,264条无标注样本,为半监督学习和语言模型微调提供了天然试验场。通过构建平衡的正负样本划分,研究者能够严格测试模型在荷兰语情感分析上的泛化能力,尤其适用于验证跨语言迁移学习策略的有效性。
解决学术问题
该数据集核心解决了荷兰语自然语言处理中标注资源匮乏的学术困境。在英语情感分析数据集泛滥的背景下,DBRD为低资源语言的情感计算提供了首个大规模、高质量的标注基准。它使得研究者得以探索通用语言模型微调(ULMFiT)在小数据集上的适应性,实证了预训练-微调范式在荷兰语场景中的可行性。数据集还揭示了非规范文本(如拼写错误、口语化表达)对情感分类性能的影响,推动了针对噪声文本的鲁棒性建模研究。
衍生相关工作
基于DBRD衍生出一系列荷兰语自然语言处理的重要工作。原始论文验证了ULMFiT在小语种情感分类中的优越性,开创了荷兰语预训练语言模型的研究方向。后续工作包括跨语言情感词典构建、荷兰语BERT模型(如BERTje)的微调基准,以及多任务学习框架在荷兰语情感分析中的探索。该数据集还催生了针对荷兰语社交媒体文本的域适应研究,推动了少样本学习技术在低资源语言场景中的方法论创新。
以上内容由遇见数据集搜集并总结生成



