kiyam/ddro-nq-dataset
收藏资源简介:
该数据集包含预处理的Natural Questions (NQ320K)语料库,用于训练和评估DDRO生成式检索模型。数据源自Google的Natural Questions原始数据集,经过处理统一格式,包含文档文本、查询和相关注释,适用于生成式检索训练流程。数据集包括三个文件:nq_merged.json(完整文档语料库,JSONL格式)、nq_train.gz(训练集,TSV压缩格式)和nq_val.gz(验证集,TSV压缩格式),总计约109,739个唯一文档。数据集主要用于信息检索任务,支持生成式检索模型的开发和评估。
license: CC-BY-SA-3.0 language: - en tags: - 生成式检索 - 信息检索 - 自然问题(Natural Questions) - DDRO - 文档检索 task_categories: - 文本检索 pretty_name: DDRO NQ320K数据集 size_categories: - 100K<n<1M # DDRO — NQ320K 处理后数据集 本数据集包含经过预处理的**自然问题(Natural Questions, NQ320K)**语料库,用于训练和评估来自以下论文的DDRO生成式检索模型: 📄 **《轻量级直接文档相关性优化用于生成式信息检索(SIGIR 2025)》**(https://arxiv.org/abs/2504.05181) 原始NQ数据集(来自谷歌)已被处理为统一格式,包含文档文本、查询语句与相关性标注,可直接用于生成式检索训练流水线。 --- ## 文件列表 | 文件 | 描述 | 大小 | |---|---|---| | `nq_merged.json` | 完整NQ320K文档语料库(含109,739个唯一文档,JSONL格式) | 5.5 GB | | `nq_train.gz` | 训练集拆分 — 包含查询语句与文档字段(TSV格式,经gzip压缩) | 6.5 GB | | `nq_val.gz` | 验证集拆分 — 包含查询语句与文档字段(TSV格式,经gzip压缩) | 159 MB | --- ## 数据格式 ### `nq_merged.json`(JSONL格式) 每行对应一个文档: json { "id": "5655493461695504401", "query": "opt-in电子邮件营销最常见的用途是什么", "long_answer": "...", "short_answer": "发送给广告公司客户的新闻通讯", "title": "电子邮件营销", "abstract": "...", "content": "...", "document_url": "https://en.wikipedia.org/...", "doc_tac": "<title> + <abstract> + <content>", "language": "en" } ### `nq_train.gz` / `nq_val.gz`(TSV格式,经gzip压缩) 制表符分隔,无表头。列顺序为:`query`、`id`、`long_answer`、`short_answer`、`title`、`abstract`、`content`、`document_url`、`doc_tac`、`language` --- ## 数据集统计信息 | 拆分集 | 样本数 | |---|---| | 训练集 | 原始约307,373条 → 按标题去重后87,791条 | | 验证集 | 原始约7,830条 → 去重后21,948条 | | 唯一文档数 | 109,739 | --- ## 使用方法 ### 加载语料库 python import json docs = {} with open("nq_merged.json") as f: for line in f: doc = json.loads(line) docs[doc["id"]] = doc ### 加载训练/验证拆分集 python import gzip import pandas as pd columns = ["query", "id", "long_answer", "short_answer", "title", "abstract", "content", "document_url", "doc_tac", "language"] with gzip.open("nq_train.gz", "rt") as f: train_df = pd.read_csv(f, sep=" ", names=columns) --- ## 对应模型 基于本数据集训练的模型: | 模型 | 文档ID类型 | MRR@10 | 召回率@10 | |---|---|---|---| | [`kiyam/ddro-nq-pq`](https://huggingface.co/kiyam/ddro-nq-pq) | PQ(乘积量化,Product Quantization) | 55.51 | 67.31 | | [`kiyam/ddro-nq-tu`](https://huggingface.co/kiyam/ddro-nq-tu) | TU(标题+URL,Title + URL) | 45.99 | 55.98 | 监督微调参考策略:[`kiyam/ddro-nq-pq-sft`](https://huggingface.co/kiyam/ddro-nq-pq-sft)、[`kiyam/ddro-nq-tu-sft`](https://huggingface.co/kiyam/ddro-nq-tu-sft) --- ## 源数据来源 本数据集衍生自**谷歌自然问题(Natural Questions, NQ)**数据集: > Tom Kwiatkowski、Jennimaria Palomaki、Olivia Redfield等人,2019年。**《自然问题:问答研究基准数据集》**,发表于《计算语言学协会汇刊》(*Transactions of the Association for Computational Linguistics*)。 - 项目主页:https://ai.google.com/research/NaturalQuestions - 许可证:[知识共享署名-相同方式共享3.0协议](https://creativecommons.org/licenses/by-sa/3.0/) - 原始文件路径:`gs://natural_questions/v1.0-simplified/` 原始数据由谷歌基于CC BY-SA 3.0协议发布,本处理后版本沿用相同许可条款。 完整预处理流程可参考 [`process_nq_dataset.py`](https://github.com/kidist-amde/ddro/blob/main/src/data/data_prep/nq/process_nq_dataset.py)。 --- ## 引用格式 bibtex @inproceedings{amdie2025ddro, title={轻量级直接文档相关性优化用于生成式信息检索}, author={Amdie, Kidist}, booktitle={第48届国际ACM信息检索研究与发展大会论文集}, year={2025}, }



