官方服务:
资源简介:
搜集、整理、发布 中文 自然语言处理 语料/数据集,与 有志之士 共同 促进 中文 自然语言处理 的 发展。
应用场景:
创建时间:
2024-04-30
相关数据集
GSM8k中文数据集
# Dataset `GSM8K_zh` is a dataset for mathematical reasoning in Chinese, question-answer pairs are translated from GSM8K (https://github.com/openai/grade-school-math/tree/master) by `GPT-3.5-Turbo`
魔搭社区2026-07-14 更新1920
tay-yozhik/NaturalText
该数据集包含200万条自然语言句子,主要来源于三个新闻子语料库(Lenta.ru, Interfax, N+1)和俄罗斯维基百科文本。所有文本仅包含西里尔字母。具体数据来源及句子数量如下:Lenta.ru子语料库124,681条,Interfax子语料库230,246条,N+1子语料库33,268条,俄罗斯维基百科文本1,611,805条。
Hugging Face2023-08-28 更新570
Sinhala-English Parallel Word Dictionary Dataset
本研究介绍了三个英语-僧伽罗语平行词典数据集(En-Si-dict-large, En-Si-dict-filtered, En-Si-dict-FastText),旨在支持英语和僧伽罗语之间的多语言自然语言处理任务。这些数据集由莫勒图沃大学计算机科学与工程系的Kasun Wickramasinghe和Nisansa de Silva创建,包含546,156个词对。数据集通过使用FastText模
arXiv2023-08-04 更新100
BELLE eval
BELLE评估数据集包含由BELLE项目创建的1000条中文指令。该数据集主要用于评估大型语言模型(LLMs)在中文环境下的通用能力,涵盖九项任务:信息提取、封闭式问答、改写、摘要、生成、分类、头脑风暴、开放式问答以及其他任务。其中“其他”类别主要关注与数学和编程相关的任务。评估过程使用ChatGPT进行打分。
github2023-04-01 更新1200



