遇见数据集

Turbo-AI/doc2query-generate

收藏
Hugging Face2024-11-02 更新2024-12-14 收录
官方服务:

资源简介:

doc2query-generate-v2数据集包含文档和对应的查询信息。每个样本由一个唯一的id标识,包含文档文本和查询文本。其中,查询文本分为相关和不相关两种。该数据集目前只有一个训练集部分,共有约1252937个样本,总数据大小约为2GB。

The doc2query-generate-v2 dataset consists of documents and their corresponding queries. Each sample is identified by a unique id and includes a document text and a query text. The query text is categorized into relevant and irrelevant. Currently, the dataset has only a training split with approximately 1,252,937 samples, totaling about 2GB in size.

提供机构:
Turbo-AI
二维码
社区交流群
二维码
科研交流群
商业服务