遇见数据集

jeremygracey-ai/provenance-corpus

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是Provenance Corpus — OpenStax Anatomy & Physiology 2e (page images),包含OpenStax《解剖学与生理学》第2版教科书的页面图像,共1,347页,每页以PNG格式存储(分辨率为150 DPI)。它用作Provenance演示系统的检索语料库,Provenance是一个基于引用的检索增强生成(RAG)系统,能够验证每个声明对应的确切页面图像。数据集通过多模态模型(Cohere Embed v4)进行嵌入,支持文本查询和页面图像在共享向量空间中的检索,并通过余弦相似度匹配。检索到的图像用于Claude模型的回答和逐项声明验证。页面通过ID(如anatomy-physiology-2e#p{N})引用,并可通过特定URL访问。数据来源于OpenStax的CC BY 4.0许可内容,数据集同样遵循该许可。

This dataset is the Provenance Corpus — OpenStax Anatomy & Physiology 2e (page images), containing page-image renders of the OpenStax Anatomy & Physiology 2e textbook (1,347 pages), with each page stored as a PNG at 150 DPI. It serves as the retrieval corpus for the Provenance demo—a citation-grounded RAG system that verifies every claim against the exact page image that proves it. The images are embedded using Cohere Embed v4 (a multimodal model where query text and page images share one vector space) and retrieved by cosine similarity. Retrieved page images are then passed to Claude for answering and per-claim verification. Pages are referenced by IDs (e.g., anatomy-physiology-2e#p{N}) and accessible via specific URLs. The source is OpenStax content under CC BY 4.0 license, and the dataset is redistributed under the same license.

提供机构:
jeremygracey-ai
搜集汇总
数据集介绍
jeremygracey-ai/provenance-corpus 数据集图片
构建方式
该数据集基于OpenStax《解剖学与生理学(第二版)》教科书构建,将全书1347页内容逐页渲染为150 DPI分辨率的PNG图像,每张图像以唯一标识符'anatomy-physiology-2e#p{N}'进行索引,其中N为基于PDF的页码索引。数据集的页面图像以公共文件形式托管于HuggingFace,可通过标准URL直接解析访问,确保了数据的高可用性与可复现性。
特点
数据集专为溯源式检索增强生成(RAG)系统设计,核心特点在于每张页面图像均作为可验证的引用来源,支持多模态嵌入模型(如Cohere Embed v4)将文本查询与图像映射至同一向量空间进行相似度检索。这一特性使系统能够将生成的每个声明直接关联至确凿的页面证据,实现细粒度的可验证性。
使用方法
使用时,通过多模态嵌入模型对查询文本与页面图像进行联合编码,计算余弦相似度以召回相关页面。检索到的图像随后输入至大语言模型(如Claude)进行答案生成与逐声明验证,引用的页码直接对应数据集中的图像索引。向量索引另行存储于关联仓库中,而本数据集仅提供原始页面图像作为浏览器渲染的来源。
背景与挑战
背景概述
Provenance Corpus是由开发者Jeremy Gracey于近期创建的一个多模态检索语料库,专为支撑名为Provenance的引用溯源RAG系统而设计。该语料库以OpenStax发布的《解剖学与生理学2e》教材的1347页图像为核心,每页以150 DPI的PNG格式存储,旨在通过图像级别的精确引用,解决生成式AI在回答专业领域知识时缺乏可验证信息来源的痛点。Provenance系统利用Cohere Embed v4多模态嵌入模型将文本与页面图像映射至同一向量空间,经余弦相似度检索后,由Claude模型逐条验证回答中的每一个主张,并直接指向语料库中的具体页面图像,从而在解剖学与生理学这一高风险知识领域实现了对AI生成内容的可追溯性保障。该数据集虽规模虽小(小于10K),但其工作流为RAG系统中事实性与可信度的提升提供了可复用的范例,对开放教育资源的可解释应用具有潜在影响力。
当前挑战
该数据集所应对的核心领域挑战,在于传统RAG系统仅依赖文本块检索,难以精确锚定复杂教科书中的图表示意、解剖图示等视觉证据,导致引证模糊甚至产生幻觉。Provenance Corpus通过将每页渲染为独立图像,实现了从文本查询到视觉证明页面的直接跳转,迫使生成模型必须基于原始页面内容逐一核验每个陈述,显著降低了无中生有的风险。在构建过程中,面临的挑战主要包括:其一,教材页面结构复杂,包含大量图表、标注及跨页内容,需确保图像渲染质量与页面编号的精确对齐;其二,多模态嵌入模型的选取与优化,需保证文本与图像在跨模态检索中的语义一致性,避免因视觉特征差异导致检索偏差;其三,系统需维持低延迟响应以支撑交互式演示,而将向量索引部署于无服务器函数中又对资源效率提出了更苛刻的要求。
常用场景
经典使用场景
Provenance Corpus 数据集的核心价值在于为基于引用的检索增强生成(RAG)系统提供可追溯的视觉语料库。该数据集将《解剖学与生理学 2e》教科书的1347页内容渲染为高清页面图像,每一页都拥有唯一的标识符与可解析的URL地址。在经典使用场景中,研究者利用Cohere Embed v4等多模态嵌入模型,将查询文本与页面图像映射至同一向量空间,通过余弦相似度检索最相关的页面图像,随后将检索结果传递给大语言模型(如Claude)进行答案生成与逐句验证。这一范式确保了模型生成的每个声明都能指向确切的原始页面,从而在医学、生物学等知识密集型领域实现了信息溯源与可靠性保障。
实际应用
在实际应用层面,Provenance Corpus为医学教育、临床决策支持与教材数字化领域提供了切实可行的技术方案。教育工作者可以基于该数据集搭建智能辅导系统,当学生提出关于人体解剖结构或生理机制的问题时,系统不仅提供解答,还能直接展示教材中对应的图文页面,极大提升了学习过程中的证据获取效率。临床环境中,医生在使用AI辅助诊断工具时,能够追溯每个推理步骤所依据的解剖学知识源,从而降低了因信息误差导致的医疗风险。此外,该数据集还支撑着多模态文档检索系统的性能评估,推动了对教科书级知识库进行自动化问答与信息抽取的技术进步。
衍生相关工作
围绕Provenance Corpus,学术界与工业界衍生出一系列具有影响力的工作。其背后的Provenance系统本身便是一个开创性的示范项目,展示了如何通过多模态检索与声明级验证构建可信RAG框架。该数据集的构建理念启发了其他学科领域(如组织学、病理学)的教科书图像化检索语料库开发,推动了以证据为中心的知识图谱构建研究。在技术方法论层面,研究者基于这一数据集探讨了不同多模态嵌入模型在医学教材检索中的性能对比,以及如何优化图像分辨率与向量维度之间的权衡。这些衍生工作共同推动着检索增强生成从单纯的信息拼接走向真正意义上的知识求证与溯源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务