遇见数据集

citation-integrity-bench

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Citation Integrity Bench 是一个专门用于评估大语言模型生成虚假引用(幻觉引用)检测器的标注数据集。其创建背景源于虚假引用对学术文献的污染问题,旨在为检测工具提供标准化的评估基准。数据集包含两个核心部分:1) 一个包含 256 个标注案例的引用完整性评估集,每个案例对应一个参考文献条目,并标注为四种类型之一:real(真实且元数据正确)、real_partial(真实但元数据不完整)、poisoned_metadata(真实作品但作者或年份等关键元数据错误,模拟常见LLM错误)、fabricated(完全虚构的作品)。其中,虚构和元数据被“下毒”的条目是人工合成的,仅用于评估目的,不针对任何真实论文。数据以 JSONL 和 BibTeX 格式提供,包含 id, label, title, authors, year, doi 等多个字段。2) 一个包含 285 个主张-引用对的子集,用于评估引用在词汇层面是否支持给定的主张。数据集的主要用途是评估检测器在判断引用是否存在及其元数据完整性方面的性能,使用者可以通过比较检测器输出与数据集中预定义的 expected_status_family(如 verified, metadata_mismatch, not_found 等)来评分。数据集采用 CC0-1.0 许可证发布。

Citation Integrity Bench is a labeled dataset specifically designed for evaluating large language model-generated false citation (hallucination citation) detectors. Its creation background stems from the issue of false citations polluting academic literature, aiming to provide a standardized evaluation benchmark for detection tools. The dataset consists of two core parts: 1) A citation integrity evaluation set containing 256 labeled cases, each corresponding to a reference entry and annotated as one of four types: real (real with correct metadata), real_partial (real but with incomplete metadata), poisoned_metadata (real work but with key metadata errors such as author or year, simulating common LLM errors), and fabricated (completely fabricated work). Among these, the fabricated and metadata-poisoned entries are artificially synthesized, solely for evaluation purposes and not targeting any real papers. The data is provided in JSONL and BibTeX formats, including fields such as id, label, title, authors, year, and doi. 2) A subset containing 285 claim-citation pairs, used to evaluate whether citations lexically support given claims. The main purpose of the dataset is to assess the performance of detectors in judging the existence of citations and the integrity of their metadata. Users can score by comparing detector outputs with predefined expected_status_family (e.g., verified, metadata_mismatch, not_found) in the dataset. The dataset is released under the CC0-1.0 license.

创建时间:
2026-07-23
原始信息汇总

数据集概述:Citation Integrity Bench

  • 数据集名称:Citation Integrity Bench
  • 许可证:CC0-1.0(公共领域奉献)
  • 语言:英语、中文、德语
  • 任务类别:文本分类、其他
  • 标签:引用、文献计量学、幻觉检测、学术、评估
  • 数据集规模:少于1000条(n<1K)

数据集内容

该数据集是一个精心标注的评估集,包含 256 个标注案例,用于检测引文存在性和元数据完整性。旨在帮助检测工具识别大语言模型(LLM)虚构的参考文献。

标签含义

标签 含义
real 真实作品,核心元数据正确
real_partial 真实作品,元数据不完整但无矛盾
poisoned_metadata 真实标题/作品,但作者或年份错误(常见的LLM失败模式)
fabricated 不存在该作品(应为 not_found

文件结构

  • data/citations.jsonl:每条引用一个JSON对象
  • data/citations.bib:相同数据集的BibTeX格式,适用于CLI工具

字段说明

id, label, title, authors, year, doi, arxiv_id, venue, notes, expected_status_family

预期用途

通过比较检测结果与 expected_status_family 来评分检测工具。expected_status_family 取值及其映射关系:

  • verified_or_mismatch_okverified 或轻微 metadata_mismatch
  • verifiedverified
  • metadata_mismatch_or_ambiguousmetadata_mismatchambiguous
  • metadata_mismatch_or_not_foundmetadata_mismatch, ambiguous, 或 not_found
  • not_foundnot_found
  • retractedretracted

额外子集:Claim Support Mini-Bench

  • 文件data/claims.jsonl
  • 规模285 个 声明-引用对
  • 用途:用于词汇层面声明-支持评分(supported_or_weak / unsupported_or_weak 家族)
  • 工具:配套于 citesure claims-file 命令使用

基线性能

使用 citesure 工具在数据集上的基线结果:250/250(基于美国判例法,通过CourtListener;包含CJK标题)。

搜集汇总
数据集介绍
citation-integrity-bench 数据集图片
构建方式
Citation Integrity Bench数据集由256个精心标注的案例构成,旨在评估文献引用存在性与元数据完整性的检测器性能。构建过程中,每个案例被赋予一个标签:'real'代表真实著作且核心元数据正确;'real_partial'表示真实著作但元数据不完整且无矛盾;'poisoned_metadata'指真实标题或著作但作者或年份错误,反映常见的大语言模型错误模式;'fabricated'则对应完全虚构的著作。数据集以JSON Lines和BibTeX两种格式存储于'data/'目录下,便于命令行工具直接调用。所有虚构条目均为合成生成,有毒元数据条目也只针对知名论文进行修改,仅用于评估目的,不暗示任何真实论文存在学术不端。
特点
该数据集的核心特点在于其精细的标签体系,能够区分引用真实性与元数据完整性的不同层次,特别关注LLM幻觉引用的典型表现。256个案例规模虽小但高度聚焦,覆盖了从完全真实到完全虚构的连续谱系。另一独特之处是引入了'expected_status_family'字段,将具体标签映射为六种预期结果类型,如'verified_or_mismatch_ok'、'not_found'等,为不同检测器的输出提供了统一的评分基准。此外,数据集还包含一个285个claim-引用对的辅助测试集,用于评估词汇层面的声明-引用支持度评分,进一步拓展了评估维度。
使用方法
该数据集主要通过配合专用检测工具(如citesure)进行使用。用户可运行'citesure check data/citations.bib -f json -o report.json'命令,将BibTeX文件输入检测器,生成JSON格式报告。评估时,将检测器输出的结果与'expected_status_family'字段中的预期类型进行比对,例如:'verified_or_mismatch_ok'预期检测器返回'verified'或轻微的'metadata_mismatch';'not_found'预期返回'not_found'。这种映射机制使得不同检测器在同一基准上的性能可量化比较。对于辅助测试集,则通过'citesure claims-file'命令进行claim-引用支持度评分,帮助评估模型在语义层面正确关联声明与参考文献的能力。
背景与挑战
背景概述
随着大型语言模型(LLM)在学术写作中的广泛应用,生成的参考文献中频繁出现幻觉引文(即虚构或错误引文)已成为一个严峻问题。2026年《自然》杂志等权威期刊及arXiv等预印本平台相继发文指出,这些伪造或失实的引文正污染学术文献,破坏研究的可信度与可追溯性。为此,研究者构建了 Citation Integrity Bench,一个包含256个精心标注样本的评估基准,旨在系统性检测引文存在性与元数据完整性。该数据集由相关机构于近年创建,核心研究聚焦于评估和提升引文真实性检测工具的性能,为学术诚信维护提供了标准化测试平台,对推动引文验证技术的发展具有奠基性意义。
当前挑战
该数据集面临多重挑战。在领域问题层面,如何精准区分真实引文、部分真实但元数据不完整的引文、元数据被恶意篡改的引文以及完全虚构的引文,是引文真实性检测的核心难点。此外,现有检测工具在处理跨语言(如中英文)及跨领域文献时表现不稳定,尤其对复杂元数据冲突(如作者与年份错误)的检测能力不足。在数据集构建过程中,挑战在于如何平衡标签的细粒度与标注一致性,确保256个样本涵盖多样化的引文失真场景,同时避免因样本规模有限而导致的评估偏差。合成数据与真实数据边界模糊的问题,也对检测算法的泛化能力提出了更高要求。
常用场景
经典使用场景
Citation Integrity Benchmark(简称CIB)是一个精心标注的评估基准,专为检验学术文献中引文存在性与元数据完整性而设计。在学术出版生态中,大型语言模型生成的幻觉引文日益泛滥,严重侵蚀了文献的可信根基。该数据集包含256个标注样本,覆盖真实引用、元数据部分缺失、元数据恶意篡改以及完全虚构四类情形,为检测工具提供了统一、透明的测试平台。研究者可利用此基准对引文验证系统进行标准化评估,客观衡量其在区分真实文献与虚假信息方面的性能表现。
衍生相关工作
围绕CIB基准,科研社区已催生出一系列具有影响力的衍生工作。最典型的范例是基于该数据集训练的引文验证工具citesure,其基线测试在该基准上实现了250/250的完美命中率,证明了方法的有效性。此外,CIB衍生出的声明支撑性(claim-support)迷你基准包含285组声明-引用配对,推动了引文与文本论据之间语义关联的量化评估研究。该基准持续随citesure v0.6.1的领域适配包更新,覆盖从管理学至艺术史等多元学科。这些工作共同构筑了一个从元数据验证到语义溯源的引文完整性评估生态,为学术界对抗信息污染提供了多层防御手段。
数据集最近研究
最新研究方向
针对大型语言模型幻觉引发的引用参考文献伪造问题,citation-integrity-bench数据集构建了一个精细标注的评测基准(256例),系统性地覆盖真实引用、部分信息缺失、元数据篡改(如作者或年份错置)及完全虚构四类情形。该数据集顺应了学术界对生成内容可验证性的迫切需求,尤其在Nature 2026年关注、arXiv审稿强化及各类会议审计的背景下,为引用存在性与元数据完整性检测工具提供了标准化测试平台,推动了检测器从二元判断向细粒度错误分类的演进,有效助力学术文献净化与科研诚信维护。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务