遇见数据集

Multilingual-USAS-Labelled-Silver-Wikipedia

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

Multilingual USAS Silver Labelled Wikipedia Articles 是一个多语言数据集,覆盖8个维基百科语言站点(英语、荷兰语、葡萄牙语、西班牙语、丹麦语、意大利语、芬兰语和中文)。该数据集旨在用于训练 USAS 语义标签器和多词表达(MWE)识别器。数据来源于 HuggingFaceFW/finewiki,仅选取被评为“优良”(Good)或“特色”(Featured)的文章,经过句子分割后,使用 PyMUSAS 规则标注器自动标注 USAS 语义标签和 MWE。数据集包含约10k至100k个样本,每个语言配置划分为训练集和验证集。每条记录包含以下字段:text(处理后的文章文本)、id(唯一标识符)、page_id(维基百科页面ID)、title(文章标题)、url(文章URL)、version(版本标识)、start_end_sentence_character_indexes(句子字符偏移列表)、tokens(按句子组织的分词列表)、tags(每个词最可能的USAS标签列表)、other_tags(每个词的其他有效USAS标签列表)、mwes(MWE标签列表)。数据以 zstd 压缩的 Parquet 文件存储。许可证为 CC BY-SA 4.0 和 GFDL。

The Multilingual USAS Silver Labelled Wikipedia Articles is a multilingual dataset covering 8 Wikipedia language editions: English, Dutch, Portuguese, Spanish, Danish, Italian, Finnish, and Chinese. This dataset is designed for training USAS semantic taggers and multi-word expression (MWE) recognizers. It is sourced from the HuggingFaceFW/finewiki repository, and only articles rated as "Good" or "Featured" are selected. After sentence segmentation, USAS semantic tags and MWEs are automatically annotated using the PyMUSAS rule-based tagger. The dataset contains approximately 10,000 to 100,000 samples, with each language edition split into a training set and a validation set. Each record includes the following fields: text (processed article text), id (unique identifier), page_id (Wikipedia page ID), title (article title), url (article URL), version (version identifier), start_end_sentence_character_indexes (list of character offset ranges for sentences), tokens (list of tokenized text organized by sentences), tags (list of the most probable USAS tags for each token), other_tags (list of other valid USAS tags for each token), and mwes (list of MWE tags). The dataset is stored in zstd-compressed Parquet files. It is licensed under CC BY-SA 4.0 and GFDL.

创建时间:
2026-07-30
原始信息汇总

Multilingual USAS Silver Labelled Wikipedia Articles 数据集详情

数据集概述

  • 数据集名称: Multilingual USAS Silver Labelled Wikipedia Articles
  • 语言: 多语言(英语、荷兰语、葡萄牙语、西班牙语、丹麦语、意大利语、芬兰语、中文)
  • 规模: 10,000 < n < 100,000 条数据
  • 许可证: CC-BY-SA-4.0 和 GFDL

数据集用途

该数据集可用于训练 USAS 语义标注器和多词表达式(MWE)识别器。

数据来源与处理流程

来源

  • 源文本来自 HuggingFace 的 HuggingFaceFW/finewiki 数据集
  • 仅包含被评为 Good (GA) 或 Featured (FA) 的文章(使用 ucrelnlp/wikipedia-ga-fa-ids 中的文章 ID 列表筛选)

处理流程

  1. 筛选出GA或FA评级的文章
  2. 排除人工筛选测试集中的文章
  3. 移除家族树表格、数学公式和其他表格
  4. 剥离 Markdown 格式
  5. 删除少于 50 个 tokens 的文章
  6. 进行精确和 MinHash 去重
  7. 使用语言特定的 spaCy 句子分割器进行句子切分
  8. 使用 PyMUSAS 基于规则的标注器对每个句子进行 USAS 语义标签和 MWE 标注

数据集结构

数据格式

  • 数据以 zstd 压缩的 Parquet 文件存储
  • 每个配置按语言分为 trainvalidation 子集

数据字段

字段 描述
text 处理后的文章文本
id 文章唯一标识符
page_id Wikipedia 页面 ID
title 文章标题
url 文章 URL
version 页面修订版本标识符
start_end_sentence_character_indexes 每个句子的字符偏移量列表
tokens 句子分词后的 token 列表
tags PyMUSAS 规则标注器预测的 USAS 标签
other_tags token 的其他有效 USAS 标签
mwes 多词表达式标签

数据拆分

  • 每个语言独立拆分为训练集和验证集
  • 验证集容量由百分比和最大文档数两者中先达到者决定
  • 拆分基于页面 ID 的哈希确定,可复现

数据集配置

包含 8 个语言配置:da(丹麦语)、nl(荷兰语)、fi(芬兰语)、it(意大利语)、pt(葡萄牙语)、es(西班牙语)、zh(中文)、en(英语)

构建与联系

  • 数据集维护者: 兰卡斯特大学 UCREL 研究组
  • 代码仓库: https://github.com/UCREL/wikipedia-USAS-processing
  • 联系方式: ucrel@lancaster.ac.uk
  • 数据集作者: UCREL 团队、Andrew Moore、Paul Rayson
搜集汇总
数据集介绍
Multilingual-USAS-Labelled-Silver-Wikipedia 数据集图片
构建方式
该数据集由兰卡斯特大学UCREL团队构建,旨在为USAS语义标注器和多词表达识别器的训练提供银标准语料。数据源取自HuggingFaceFW/finewiki,仅保留被评为优质或特色的维基百科文章,并依据文章ID列表进行筛选。处理流程包括排除人工测试集、去除表格与数学公式、剥离Markdown格式、过滤短文章、执行精确与MinHash去重,随后利用语言专属的spaCy分句器进行分句,并借助PyMUSAS基于规则的标注器对每个句子进行USAS语义标签与多词表达标注。最终数据按语言分为训练集与验证集,以zstd压缩的Parquet格式存储。
特点
该数据集覆盖英语、荷兰语、葡萄牙语、西班牙语、丹麦语、意大利语、芬兰语和中文八种语言,规模介于一万至十万篇文章之间。其独特之处在于每篇文章均附带逐句的字符偏移索引、词元序列、USAS语义标签、候选标签及多词表达标签,为细粒度的语义分析提供了丰富标注。数据仅包含优质或特色文章,且经过严格筛选与去重,保证了文本质量。验证集划分采用确定性哈希方法,确保可复现性,同时针对低资源语言设定百分比与数量上限,兼顾了数据平衡与实用性。
使用方法
该数据集主要用于训练USAS语义标注器和多词表达识别器,适用于跨语言的语义分析任务。研究人员可直接基于其提供的词元、USAS标签及多词表达标签进行模型训练与评估。数据按语言划分为训练集与验证集,便于进行监督学习。由于验证集划分基于确定性哈希,实验结果在不同的运行间具有可比性。此外,数据集的构建代码公开于GitHub,用户可参考其处理流程,或将数据集作为基准,用于评测自家标注系统在多种语言上的表现。
背景与挑战
背景概述
该数据集由兰卡斯特大学UCREL团队于近期构建,旨在为多语言USAS语义标注及多词表达式识别提供训练语料。其核心研究问题在于解决跨语言语义标注资源匮乏的困境,通过整合维基百科高质量条目(GA/FA)并运用PyMUSAS规则标注器生成银标准数据,覆盖英、荷、葡、西、丹、意、芬、中八种语言。该数据集不仅为低资源语言的语义分析研究提供了宝贵的标注资源,还通过开源方式推动了自然语言处理领域多语言语义标注技术的进步,对跨语言信息检索与文本挖掘研究具有重要影响。
当前挑战
领域层面,该数据集着力应对多语言语义标注中标注体系一致性、语言特异性与标注规模受限的挑战,尤其是在低资源语言上,语义标注语料稀缺且标注成本高昂。构建过程中,团队面临了严格的文本筛选与清洗难题,包括去除数学公式、表格及非叙事性内容,并进行精确与MinHash双重去重以保障数据质量。此外,句级分割与规则标注器的适应性问题(如无法预测某些token的语义标签)也是一大考验,同时需在保持各语言训练/验证划分的科学性与资源平衡之间寻求最优解。
常用场景
经典使用场景
该数据集为多语言USAS语义标注的维基百科文章集合,涵盖八种语言,其核心用途在于为训练USAS语义标注器和多词表达式识别器提供大规模银标准语料。研究人员可直接利用其丰富的词级语义标签和MWE注释,进行序列标注模型的监督学习或弱监督预训练,亦可作为评估语义分析工具性能的基准测试集。
实际应用
在实际应用中,该数据集可用于构建跨语言的文本理解和信息抽取系统,如智能问答、情感分析、社会舆情监测等领域。其语义标签有助于提升机器翻译的语义一致性,优化搜索和推荐系统的语义匹配,亦可辅助语言教学和词典编纂工作,促进自然语言处理技术的多语言落地。
衍生相关工作
该数据集的发布催生了多项后续研究,包括基于其语料微调的多语言USAS标注模型,以及融合MWE信息的语义解析器。同时,其构建流程被复用于其他语料库的自动化标注,推动了半监督学习在语义分析中的应用。后续工作还探索了将银标准数据与人工标注数据结合,以提升标注精度和覆盖度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务