数据链接:
官方服务:
资源简介:
Raw Wikipedia data for TopiOCQA
应用场景:
创建时间:
2022-02-20
相关数据集
deepset/germandpr
--- language: - de multilinguality: - monolingual source_datasets: - original task_categories: - question-answering - text-retrieval task_ids: - extractive-qa - closed-domain-qa thumbnail: >- https:
Hugging Face2023-04-06 更新220
Khatwanigaurav/rag-mini-wikipedia
--- license: cc-by-3.0 language: - en task_categories: - question-answering - sentence-similarity tags: - rag - wikipedia - open-domain - information-retrieval - dpr size_categories: - n<1K configs: -
Hugging Face2026-03-27 更新140
pedrocurvo/vdocrag-odvqa-dse-s3-200k_mix-qa
该数据集包含50,000个训练样本,每个样本包括查询ID、查询内容、答案列表、相关文档ID列表和数据集名称列表。数据集主要用于训练目的,总文件大小为12,170,216字节,下载文件大小为4,008,469字节。
Hugging Face2025-12-14 更新190
nvidia/Nemotron-RL-knowledge-openqa
Nemotron-RL-knowledge-openQA是一个多领域的合成数据集,包含基于知识的问答对。它来源于非结构化数据如书籍和文章,涵盖物理、生物、数学、计算机科学、工程、化学、法律等多个领域。该数据集是NVIDIA NeMo Gym框架的一部分,用于训练大型语言模型的强化学习环境。数据集格式为纯文本,与NeMo Gym兼容,包含135987个(问题,答案)元组,总存储量为50.5MB。数据
Hugging Face2025-12-12 更新110



