相关数据集
Native Chinese Reader (NCR)
Native Chinese Reader (NCR) 是一个专为机器阅读理解设计的数据集,包含8390个文档,平均长度为1024字,涵盖现代和古典中文多种文体。该数据集源自中国高中语文课程的考试题目,旨在评估母语为中文的青少年的语言能力。与现有中文MRC数据集相比,NCR不仅文档长度更长,问题也更具有挑战性,需要较强的推理能力和常识知识来解答。NCR的应用领域主要集中在提升中文自然语言理解能力,
arXiv2021-12-14 更新1360
mteb/MSMARCO_PL_test_top_250_only_w_correct
该数据集包含三个配置:corpus、default和queries。corpus配置包含文档的标题和文本,default配置包含查询ID、文档ID和分数,queries配置包含查询文本。每个配置都有对应的测试集,测试集包含示例数量和大小信息。
Hugging Face2024-09-27 更新140
Sharka/layoutlm_sqad
--- dataset_info: features: - name: input_ids sequence: int32 - name: attention_mask sequence: int8 - name: start_positions dtype: int64 - name: end_positions dtype: int64
Hugging Face2023-04-25 更新140



