sam234990/ADC
收藏资源简介:
ADC(Abstractive Document Comprehension)是一个用于文档级别、合成密集型问答任务的数据集和基准测试,特别适用于检索增强生成系统。它评估系统是否能够阅读长文档、组织证据并生成基于证据的抽象答案,而不仅仅是检索简短的事实。数据集包含869个问题,分为5种任务类型(Single-Sum、Pair-Comp、Multi-Comp、Enum和Temp)和2个来源领域(学术文档和新闻文档)。数据集文件包括corpus.jsonl(用于检索和证据基础的源文档)和questions.jsonl(抽象问答对及基准测试元数据)。数据来源包括arXiv、OpenReview和通过mediastack.com收集的新闻文章。数据集采用Open Data Commons Attribution License(ODC-By)许可。
ADC (Abstractive Document Comprehension) is a dataset and benchmark for document-level, synthesis-heavy question answering in retrieval-augmented generation systems. It evaluates whether a system can read long documents, organize evidence, and produce grounded abstractive answers, rather than only retrieve short facts. The dataset contains 869 questions, divided into 5 task types (Single-Sum, Pair-Comp, Multi-Comp, Enum, and Temp) and 2 source domains (academic documents and news documents). Dataset files include corpus.jsonl (source documents used for retrieval and evidence grounding) and questions.jsonl (abstractive question-answer pairs with benchmark metadata). Data sources include arXiv, OpenReview, and news articles collected via mediastack.com. The dataset is released under the Open Data Commons Attribution License (ODC-By).



