相关数据集
MKQA (Multilingual Knowledge Questions and Answers)
多语言知识问答 (MKQA) 是一个开放域问答评估集,包含 10k 个问答对,这些问答对排列在 26 种不同类型的语言中(总共 260k 个问答对)。该数据集的目标是为各种语言的问答质量提供具有挑战性的基准。答案基于与语言无关的数据表示,使结果可以跨语言进行比较,并且独立于特定语言的段落。该数据集包含 26 种语言,为评估问答提供了迄今为止最广泛的语言。
OpenDataLab2026-07-12 更新490
Labagaite/fr-summarizer-dataset
--- dataset_info: features: - name: fr-summarizer-dataset dtype: string - name: content dtype: string splits: - name: train num_bytes: 13739369 num_examples: 1968 - name: v
Hugging Face2024-04-13 更新190
yguooo/summarize_from_feedback_oai_preprocessing_pythia_scene2
该数据集包含多个字段,如info、summaries、choice、worker等,每个字段都有其特定的数据类型和结构。数据集被分为三个部分:train、validation和validation_cnndm,每个部分都有相应的字节大小和示例数量。
Hugging Face2024-11-25 更新100
PAQ (Probably Asked Questions)
可能问的问题 (PAQ) 是一个非常大的资源,包含 6500 万个自动生成的 QA 对。 PAQ 是 65M 自然语言 QA 对的半结构化知识库 (KB),模型可以记忆和/或学习从中检索。 PAQ 与传统 KB 的不同之处在于问题和答案以自然语言存储,并且生成的问题很可能出现在 ODQA 数据集中。 PAQ 是使用问题生成模型和维基百科自动构建的。
OpenDataLab2026-07-12 更新300
arthurmluz/GPTextSum_data-temario_results
--- dataset_info: features: - name: id dtype: int64 - name: text dtype: string - name: summary dtype: string - name: gen_summary dtype: string - name: rouge struct:
Hugging Face2023-11-15 更新120



