相关数据集
XLEnt
XLEnt数据集由约翰斯·霍普金斯大学等机构创建,包含1.64亿对跨语言实体,覆盖120种语言与英语的对应关系。该数据集通过自动挖掘网络数据,利用词义音位对齐技术LSP-Align构建,旨在改善低资源语言的跨语言实体识别。XLEnt不仅支持机器翻译和跨语言信息链接,还为多语言自然语言处理任务提供重要资源,有助于推动全球语言技术的进步。
arXiv2021-09-11 更新290
CFET 中文超细粒度实体分类
# cfet Entity Typing 数据 ## 数据集概述 cfet 数据集是从论文 [A Chinese Corpus for Fine-grained Entity Typing](https://aclanthology.org/2020.lrec-1.548/) 所发布的数据集处理得到的。 ### 数据集简介 包含通过众包人工标注的 4,800 个提及词。每个提及词都使用自由形
魔搭社区2026-07-12 更新190
TH-WordSim-353, TH-SimLex-999, TH-SemEval-500
本研究针对泰语创建了三个词相似度数据集,分别是TH-WordSim-353、TH-SimLex-999和TH-SemEval-500,总计包含1852个词对。这些数据集通过翻译和重新评分英文原版数据集WordSim-353、SimLex-999和SemEval-2017-Task-2而得。数据集涵盖不同难度、领域覆盖和相似性概念(相关性与相似性),旨在为泰语词嵌入模型提供全面的评估。创建过程中,通
arXiv2019-04-09 更新130
cmrc2019
## GitHub repository: https://github.com/ymcui/cmrc2019 This repository contains the data for [The Third Evaluation Workshop on Chinese Machine Reading Comprehension (CMRC 2019)](https://hfl-rc.gith
魔搭社区2026-05-30 更新260
duwuonline/UIT-VSMEC
该数据集来自UIT(信息技术大学),包含7个类别:其他、厌恶、享受、愤怒、惊讶、悲伤、恐惧。数据集的语言为越南语,主要用于情感分类任务。
Hugging Face2023-08-28 更新160



