遇见数据集

irds/beir_fever

收藏
Hugging Face2023-01-05 更新2024-03-04 收录
官方服务:

资源简介:

--- pretty_name: '`beir/fever`' viewer: false source_datasets: [] task_categories: - text-retrieval --- # Dataset Card for `beir/fever` The `beir/fever` dataset, provided by the [ir-datasets](https://ir-datasets.com/) package. For more information about the dataset, see the [documentation](https://ir-datasets.com/beir#beir/fever). # Data This dataset provides: - `docs` (documents, i.e., the corpus); count=5,416,568 - `queries` (i.e., topics); count=123,142 This dataset is used by: [`beir_fever_dev`](https://huggingface.co/datasets/irds/beir_fever_dev), [`beir_fever_test`](https://huggingface.co/datasets/irds/beir_fever_test), [`beir_fever_train`](https://huggingface.co/datasets/irds/beir_fever_train) ## Usage ```python from datasets import load_dataset docs = load_dataset('irds/beir_fever', 'docs') for record in docs: record # {'doc_id': ..., 'text': ..., 'title': ...} queries = load_dataset('irds/beir_fever', 'queries') for record in queries: record # {'query_id': ..., 'text': ...} ``` Note that calling `load_dataset` will download the dataset (or provide access instructions when it's not public) and make a copy of the data in 🤗 Dataset format. ## Citation Information ``` @inproceedings{Thorne2018Fever, title = "{FEVER}: a Large-scale Dataset for Fact Extraction and {VER}ification", author = "Thorne, James and Vlachos, Andreas and Christodoulopoulos, Christos and Mittal, Arpit", booktitle = "Proceedings of the 2018 Conference of the North {A}merican Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long Papers)", month = jun, year = "2018", address = "New Orleans, Louisiana", publisher = "Association for Computational Linguistics", url = "https://www.aclweb.org/anthology/N18-1074", doi = "10.18653/v1/N18-1074", pages = "809--819" } @article{Thakur2021Beir, title = "BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models", author = "Thakur, Nandan and Reimers, Nils and Rücklé, Andreas and Srivastava, Abhishek and Gurevych, Iryna", journal= "arXiv preprint arXiv:2104.08663", month = "4", year = "2021", url = "https://arxiv.org/abs/2104.08663", } ```

--- pretty_name: '`beir/fever`' viewer: 否 source_datasets: [] task_categories: - 文本检索(text-retrieval) --- # `beir/fever` 数据集卡片 本`beir/fever`数据集由[ir-datasets](https://ir-datasets.com/)工具包提供。如需了解该数据集的详细信息,请参阅[官方文档](https://ir-datasets.com/beir#beir/fever)。 # 数据 本数据集包含以下两类数据: - `docs`(文档,即语料库):总计5,416,568条 - `queries`(查询,即主题):总计123,142条 以下数据集均使用本数据集:[`beir_fever_dev`](https://huggingface.co/datasets/irds/beir_fever_dev)、[`beir_fever_test`](https://huggingface.co/datasets/irds/beir_fever_test)、[`beir_fever_train`](https://huggingface.co/datasets/irds/beir_fever_train) ## 使用方法 python from datasets import load_dataset docs = load_dataset('irds/beir_fever', 'docs') for record in docs: record # {'doc_id': ..., 'text': ..., 'title': ...} queries = load_dataset('irds/beir_fever', 'queries') for record in queries: record # {'query_id': ..., 'text': ...} 请注意,调用`load_dataset`将下载该数据集(若数据集未公开则会提供访问指引),并将数据转换为Hugging Face数据集(🤗 Dataset)格式。 ## 引用信息 @inproceedings{Thorne2018Fever, title = "{FEVER}:面向事实抽取与验证的大规模数据集", author = "Thorne, James and Vlachos, Andreas and Christodoulopoulos, Christos and Mittal, Arpit", booktitle = "2018年计算语言学协会北美分会会议论文集:人类语言技术,第1卷(长文)", month = "jun", year = "2018", address = "美国路易斯安那州新奥尔良市", publisher = "计算语言学协会", url = "https://www.aclweb.org/anthology/N18-1074", doi = "10.18653/v1/N18-1074", pages = "809--819" } @article{Thakur2021Beir, title = "BEIR:面向信息检索模型零样本(Zero-shot)评估的异构基准测试集", author = "Thakur, Nandan and Reimers, Nils and Rücklé, Andreas and Srivastava, Abhishek and Gurevych, Iryna", journal = "arXiv预印本 arXiv:2104.08663", month = "4", year = "2021", url = "https://arxiv.org/abs/2104.08663", }

提供机构:
irds
原始信息汇总

数据集概述:beir/fever

数据集信息

  • 名称:beir/fever
  • 提供者:ir-datasets
  • 任务类别:text-retrieval

数据内容

  • 文档 (docs):5,416,568个
  • 查询 (queries):123,142个

使用方式

python from datasets import load_dataset

docs = load_dataset(irds/beir_fever, docs) for record in docs: record # {doc_id: ..., text: ..., title: ...}

queries = load_dataset(irds/beir_fever, queries) for record in queries: record # {query_id: ..., text: ...}

引用信息

@inproceedings{Thorne2018Fever, title = "{FEVER}: a Large-scale Dataset for Fact Extraction and {VER}ification", author = "Thorne, James and Vlachos, Andreas and Christodoulopoulos, Christos and Mittal, Arpit", booktitle = "Proceedings of the 2018 Conference of the North {A}merican Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long Papers)", month = jun, year = "2018", address = "New Orleans, Louisiana", publisher = "Association for Computational Linguistics", url = "https://www.aclweb.org/anthology/N18-1074", doi = "10.18653/v1/N18-1074", pages = "809--819" } @article{Thakur2021Beir, title = "BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models", author = "Thakur, Nandan and Reimers, Nils and Rücklé, Andreas and Srivastava, Abhishek and Gurevych, Iryna", journal= "arXiv preprint arXiv:2104.08663", month = "4", year = "2021", url = "https://arxiv.org/abs/2104.08663", }

搜集汇总
数据集介绍
构建方式
在信息检索与事实核查的交汇领域,数据集扮演着连接模型能力与真实世界需求的桥梁角色。irds/beir_fever数据集源自FEVER(Fact Extraction and VERification)大规模事实抽取与验证任务,经由BEIR基准平台进行标准化封装,旨在为零样本信息检索模型的评估提供异构化测试环境。该数据集构建过程严谨,首先从维基百科中系统性地抽取了超过540万篇文档构成语料库,随后基于这些文档生成了12.3万余条查询,每条查询均对应一个待验证的声明,从而形成了文档与查询之间的天然关联。通过将原始FEVER数据适配至BEIR框架,数据集确保了检索任务所需的统一格式与接口兼容性。
特点
该数据集的核心特质体现在其规模与结构的双重优势上。语料库包含5,416,568篇文档,覆盖了丰富的知识领域,为模型提供了广袤的检索空间;而123,142条查询则涵盖了从简单事实到复杂推理的多样化验证需求。不同于传统检索数据集,beir/fever的查询天然带有事实核查的语义标签,使得模型在检索过程中不仅需关注词汇匹配,更需理解声明与文档间的逻辑关系。此外,数据集被划分为训练、验证与测试三个独立子集,分别对应beir_fever_train、beir_fever_dev与beir_fever_test,支持从模型训练到性能评估的全流程研究。
使用方法
使用irds/beir_fever数据集时,研究人员可通过HuggingFace的datasets库便捷地加载数据。具体而言,调用load_dataset('irds/beir_fever', 'docs')即可获取包含doc_id、text及title字段的文档集合,而load_dataset('irds/beir_fever', 'queries')则返回包含query_id与text的查询集合。这一接口设计简化了数据预处理流程,使研究者能够直接聚焦于检索模型的构建与优化。值得注意的是,数据集遵循ir-datasets规范,首次加载时会自动下载完整数据,并缓存为本地副本以提升后续访问效率。对于需要复现实验或开展公平比较的学术工作,该数据集提供了明确的引用指南,建议引用FEVER与BEIR两篇核心文献以尊重原始贡献。
背景与挑战
背景概述
在自然语言处理领域,事实核查与信息检索的交叉研究日益受到关注,旨在从海量文本中甄别真伪、验证陈述的准确性。FEVER数据集由James Thorne、Andreas Vlachos等学者于2018年在计算语言学协会北美分会(NAACL)会议上提出,核心研究问题在于构建一个大规模、可复现的基准,以支撑从文档集合中提取证据并验证事实主张的自动化系统。该数据集包含超过540万篇文档和12万余条查询,为事实核查任务提供了丰富的语料资源。随后,BEIR基准的引入进一步将FEVER纳入零样本信息检索评估框架,显著推动了检索模型在跨领域场景下的泛化能力研究,对事实验证与知识检索的融合发展产生了深远影响。
当前挑战
FEVER数据集所解决的领域问题聚焦于事实提取与验证,其挑战在于如何从大规模、异构的文档语料中精准定位支持或反驳给定主张的证据,并据此进行逻辑推理与真伪判定。构建过程中面临多重困难:首先,语料库规模庞大(逾540万文档),需确保索引与检索的高效性;其次,查询与文档之间的语义匹配复杂,需应对自然语言表述的歧义性与隐含信息;再者,证据的完整性验证要求系统具备跨句推理能力,而现有模型常受限于上下文理解瓶颈。此外,零样本评估场景下,模型需适应未见过的领域与任务,进一步加剧了泛化性能的挑战。
常用场景
经典使用场景
在信息检索与事实验证交叉领域,irds/beir_fever数据集作为FEVER(Fact Extraction and VERification)任务的检索组件,被广泛用于零样本信息检索模型的评估与训练。该数据集包含超过540万篇文档和12万余条查询,其核心使用场景在于从海量语料库中检索与给定声明(claim)相关的证据文档,为后续的事实判定环节提供支撑。研究者常基于此数据集构建检索-验证流水线,测试模型在未见领域中的泛化能力,尤其是在跨域迁移场景下,衡量检索器对细粒度语义匹配的捕捉效果。
衍生相关工作
基于irds/beir_fever数据集衍生出多项经典工作,如ColBERT-v2通过延迟交互机制优化了证据检索的精度,而SPLADE则利用稀疏表示提升了跨域迁移能力。在BEIR基准测试框架下,该数据集被用于评估ANCE、DPR等密集检索模型的零样本表现,相关分析揭示了语义匹配与词汇匹配之间的权衡。此外,事实验证领域的工作如KGAT和GEAR进一步将该数据集与知识图谱结合,探索了结构化知识对检索质量的增强作用。这些成果共同推动了检索模型从相关性匹配向证据级推理的演进。
数据集最近研究
最新研究方向
在假新闻泛滥与信息生态治理备受关注的当下,FEVER数据集作为事实核查领域的里程碑式资源,其与BEIR基准的融合正推动信息检索向零样本泛化能力迈进。前沿研究聚焦于利用该数据集训练模型在未见领域进行事实验证,探索跨任务语义匹配与反驳证据的细粒度抽取。结合近期社交平台虚假信息检测的迫切需求,该数据集成为评估检索增强型语言模型鲁棒性的关键测试床,其大规模语料与百万级查询为验证系统在复杂事实性论证中的可信度提供了严苛标尺,对构建可解释的自动化事实核查体系具有奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务