相关数据集
MCAFP
MCAFP数据集是由谷歌公司开发的机器阅读理解数据集,包含约200万条新闻文章和相关问题。该数据集利用段落向量模型生成,旨在通过大规模数据提升机器阅读理解能力。数据集内容丰富,覆盖多种语言理解挑战,如词汇匹配、复杂词汇使用和关系确定等。MCAFP数据集的创建过程涉及使用特定的算法从公开可用的新闻数据中提取和生成数据。该数据集主要应用于机器阅读理解领域,旨在通过提供高质量、高容量的训练和测试数据,推
arXiv2016-12-14 更新310
dmayhem93/agieval-logiqa-zh
该数据集取自https://github.com/microsoft/AGIEval,并按照该仓库中的方式进行处理。原始数据集来自https://github.com/lgw863/LogiQA-dataset。数据集的特征包括查询(query)、选项(choices)和正确答案(gold),并且只有一个测试分割。该数据集用于评估基础模型在逻辑推理任务上的表现。
Hugging Face2023-06-18 更新250
irds/beir_msmarco_train
--- pretty_name: '`beir/msmarco/train`' viewer: false source_datasets: ['irds/beir_msmarco'] task_categories: - text-retrieval --- # Dataset Card for `beir/msmarco/train` The `beir/msmarco/train` da
Hugging Face2023-01-05 更新300



