遇见数据集

ruanchaves/stan_large

收藏
Hugging Face2022-10-20 更新2024-03-04 收录
官方服务:

资源简介:

STAN Large数据集是一个用于标签分割任务的数据集,包含12,594个独特的英语标签及其相关的推文。该数据集由专家精心策划,并对人工注释进行了额外的质量控制。数据集的结构包括标签、分割结果以及其他可接受的分割方案。数据集的创建过程涉及标签分割和标识符分割,且所有数据集都包含相同的基本字段。

The STAN Large dataset is a specialized dataset designed for label segmentation tasks, containing 12,594 unique English labels and their associated tweets. This dataset was meticulously curated by domain experts, with additional quality control conducted on the manual annotations. The structure of the dataset includes labels, segmentation results, and other acceptable segmentation schemes. The development of this dataset involved both label segmentation and identifier segmentation, and all data entries within the dataset share the same basic fields.

提供机构:
ruanchaves
原始信息汇总

数据集概述

数据集名称

  • 名称: STAN Large

数据集属性

  • 语言: 英语
  • 许可证: AGPL-3.0
  • 多语言性: 单语种
  • 来源: 原始数据
  • 任务类别: 结构预测
  • 标签: 词分割

数据集详情

数据集摘要

  • 描述: STAN Large 是一个包含12,594个独特英语标签及其相关推文的数据集,由专家精心策划。该数据集旨在提供更高质量的人工标注,以减少先前数据集中发现的6.8%的标注错误。

语言

  • 语言: 英语

数据集结构

数据实例
  • 示例:

    { "index": 15, "hashtag": "PokemonPlatinum", "segmentation": "Pokemon Platinum", "alternatives": { "segmentation": [ "Pokemon platinum" ] } }

数据字段
  • index: 数值索引。
  • hashtag: 原始标签。
  • segmentation: 标签的金标准分割。
  • alternatives: 其他也被接受为金标准分割的分割方式。

数据集创建

  • 数据字段: 所有标签分割和标识分割数据集都包含基本字段:hashtagsegmentationidentifiersegmentation
  • 差异: hashtagsegmentationidentifiersegmentation 之间的唯一区别是空格字符。拼写检查、缩写扩展或字符大写更正体现在其他字段中。

附加信息

搜集汇总
数据集介绍
ruanchaves/stan_large 数据集图片
构建方式
在社交媒体文本分析与自然语言处理领域,哈希标签的语义解析对于信息检索与情感计算具有重要价值。STAN Large数据集由Maddela等人基于此前广泛使用的STAN Small数据集构建而成,旨在解决原有数据集中存在的标注错误问题。研究团队在重新审查后发现,STAN Small中约6.8%的哈希标签存在标注偏差,尤其集中于命名实体领域,例如将游戏公司名称“Lionhead”错误分割为“lion head”。为提升数据质量,他们从同一斯坦福数据源中筛选出12,594个独特的英文哈希标签及其关联推文,通过专家人工标注与额外的质量控制流程,构建了全新的STAN Large数据集。该数据集以JSON格式存储,每条记录包含原始哈希标签、黄金标准分割结果以及可接受的替代分割方案,确保了标注的准确性与多样性。
使用方法
使用STAN Large数据集进行模型开发时,研究者可将其直接用于哈希标签分割任务的训练与评估。数据集以标准JSON格式提供,每条样本包含'hashtag'与'segmentation'字段,便于加载与处理。模型输入为连续的哈希标签字符串,输出应为添加空格后的分割结果。对于需要处理命名实体或大小写变体的场景,可利用'alternatives'字段中的替代分割作为补充标签。该数据集与hashformers库兼容,可通过HuggingFace Datasets库直接加载,简化数据预处理流程。研究者可基于此数据集训练序列标注或排序模型,并参考原始论文中的多任务成对神经排序框架进行实验设计,以评估模型在哈希标签语义理解上的性能提升。
背景与挑战
背景概述
在社交媒体的蓬勃发展中,话题标签(hashtag)作为信息组织和检索的关键元数据,其语义理解却因用户自创的拼写习惯与多词连写而充满挑战。STAN Large数据集由Mounica Maddela、Wei Xu和Daniel Preoțiu-Pietro于2019年在ACL会议上提出,旨在解决话题标签自动分割这一核心研究问题。该数据集由斯坦福大学相关团队构建,包含12,594个经过专家精心标注的英文话题标签及其关联推文,是对此前广泛使用的STAN Small数据集的重大改进。研究者发现STAN Small中存在6.8%的标注错误,尤其集中于命名实体,例如将游戏公司“Lionhead”误标为“lion head”,这严重制约了模型性能。STAN Large通过额外的质量控制流程,显著提升了标注准确性,推动了话题标签分割领域的发展,并为情感分析等下游任务提供了坚实基础。
当前挑战
STAN Large数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,话题标签分割的难点在于用户创造的标签常包含无空格的多词组合、缩写及非常规拼写,如“PokemonPlatinum”需准确识别为专有名词“Pokemon Platinum”,这对模型在上下文理解和命名实体识别方面提出了极高要求。其次,在数据集构建过程中,最大的挑战是克服STAN Small中高达6.8%的标注错误率,这些错误多源于人类对命名实体边界的主观判断差异,例如将品牌名“Lionhead”错误分割为通用词。为此,研究团队采用了更严格的专家审核流程,并引入替代分割方案(alternatives)以容纳合理的标注歧义,从而确保了数据集的可靠性与一致性。
常用场景
经典使用场景
STAN Large数据集的核心经典应用场景在于社交媒体文本中的话题标签(Hashtag)分词任务。话题标签作为社交媒体中承载语义信息的关键元数据,常由多个单词拼接而成,缺乏明确的分隔符,给自然语言理解带来挑战。该数据集为研究者提供了12,594条经过专家精心标注的英文话题标签及其对应分词结果,成为训练和评估分词模型的权威基准。通过将话题标签分割为有意义的单词序列,该数据集支持基于序列标注、神经排序等方法的模型开发,显著提升了分词准确性,尤其在处理命名实体和缩写等复杂情况时表现出色。
解决学术问题
该数据集解决了话题标签分词领域长期存在的标注质量不足与评估标准模糊的学术难题。此前广泛使用的STAN Small数据集存在6.8%的标注错误,严重影响了模型性能评估的可靠性,因为当时最先进模型的错误率仅为10%左右。STAN Large通过严格的专家重审和质量控制,大幅降低了标注噪声,为模型对比提供了更纯净的基准。此外,它推动了分词任务从简单规则匹配向神经排序框架的演进,揭示了多任务学习在语义分割中的潜力,为后续研究奠定了数据基础。
实际应用
在实际应用中,STAN Large赋能了社交媒体内容分析与信息检索系统的性能提升。例如,在情感分析任务中,准确的话题标签分词能帮助模型捕捉用户情绪倾向,如#HappyBirthday的正确分割可区分生日祝福与一般提及,从而在SemEval 2017情感分析数据集上实现了平均召回率2.6%的提升。该数据集还支持搜索引擎的标签索引优化、广告投放的语义匹配以及舆情监控中的关键词提取,尤其适用于处理用户生成内容中非规范化的语言现象。
数据集最近研究
最新研究方向
在自然语言处理领域,标签分割(hashtag segmentation)作为一项关键的子任务,正逐渐成为社交媒体文本理解的前沿焦点。STAN Large数据集由专家精心构建,包含12,594个英文标签及其对应的推文,其诞生源于对既有数据集标注错误的深刻反思——研究发现STAN Small中高达6.8%的标签存在标注谬误,尤其是涉及命名实体的歧义,例如将“Lionhead”游戏公司误拆为“lion head”。这一缺陷在模型误差率仅约10%的背景下显得尤为突出。为此,STAN Large通过严格的质量控制,提供了更可靠的标注基准,并催生了基于多任务成对神经排序的创新方法。该研究不仅实现了标签分割准确率24.6%的误差降低,更揭示了分割质量对下游任务如情感分析的显著增益——在SemEval 2017情感分析数据集上平均召回率提升2.6%。这一数据集与相关研究共同推动了社交媒体语义理解向精细化、鲁棒性方向的演进,为处理非规范文本中的命名实体识别与语义消歧提供了关键资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务