Hyukkyu/beir-quora

Name: Hyukkyu/beir-quora
Creator: Hyukkyu
Published: 2025-11-25 06:55:17
License: 暂无描述

Hugging Face2025-11-25 更新2025-12-20 收录

下载链接：

https://hf-mirror.com/datasets/Hyukkyu/beir-quora

下载链接

链接失效反馈

官方服务：

资源简介：

--- license: apache-2.0 task_categories: - information-retrieval - text-retrieval tags: - beir - quora - information-retrieval - retrieval - search configs: - config_name: corpus data_files: - split: train path: corpus/train-* - config_name: queries data_files: - split: train path: queries/train-* dataset_info: - config_name: corpus features: - name: metadata dtype: 'null' - name: text dtype: string - name: _id dtype: string - name: title dtype: string splits: - name: train num_bytes: 41829670 num_examples: 522931 download_size: 23626447 dataset_size: 41829670 - config_name: queries features: - name: metadata dtype: 'null' - name: _id dtype: string - name: text dtype: string splits: - name: train num_bytes: 979930 num_examples: 15000 download_size: 647448 dataset_size: 979930 --- # BEIR QUORA Dataset (Migrated) This is a migrated version of BeIR/quora that is compatible with datasets library 4.0.0+. ## Dataset Description This dataset contains the quora dataset from the BEIR benchmark, converted from the old script-based format to Parquet format. ## Dataset Structure ### Queries - **Split 'queries'**: 15,000 examples - Features: ['_id', 'text', 'metadata'] - **Total examples**: 15,000 ### Corpus - **Split 'corpus'**: 522,931 examples - Features: ['_id', 'title', 'text', 'metadata'] - **Total examples**: 522,931 ## Usage ```python from datasets import load_dataset # Load queries (split: queries) queries = load_dataset("Hyukkyu/beir-quora", "queries", split="queries") # Load corpus (split: corpus) corpus = load_dataset("Hyukkyu/beir-quora", "corpus", split="corpus") ``` ## Available Splits ### Queries - `queries`: 15,000 examples ### Corpus - `corpus`: 522,931 examples ## Original Dataset This dataset is migrated from: BeIR/quora ## Citation If you use this dataset, please cite the original BEIR paper: ```bibtex @article{thakur2021beir, title={BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models}, author={Thakur, Nandan and Reimers, Nils and Ruckle, Andreas and Srivastava, Abhishek and Gurevych, Iryna}, journal={arXiv preprint arXiv:2104.08663}, year={2021} } ```

提供机构：

Hyukkyu

5,000+

优质数据集

54 个

任务类型

进入经典数据集