JDocQA
收藏资源简介:
JDocQA是一个大规模的文档基础问答数据集,主要使用视觉和文本信息来回答问题,包含5,504个PDF格式的文档和11,600个日语的问题-答案实例。
JDocQA is a large-scale document-based question-answering dataset that primarily utilizes visual and textual information to answer questions. It includes 5,504 documents in PDF format and 11,600 question-answer instances in Japanese.
数据集概述
数据集基本信息
- 名称: JDocQA
- 语言: 日语(ja-JP)
- 多语言性: 单语种
- 数据集大小: 1K<n<10K
- 许可: CC-BY-SA-4.0
- 数据来源: 原始数据
- 任务类别: 问答(question-answering)
- 任务ID:
- extractive-qa
- open-domain-qa
- closed-domain-qa
数据集描述
数据集摘要
JDocQA是一个大规模的基于文档的日语问答数据集,包含5,504个PDF格式的文档和11,600个标注的问答实例。该数据集要求结合视觉和文本信息来回答问题。
支持的任务和排行榜
JDocQA支持生成式问答任务,包括四种问题类型:
- 是/否问题:答案为“是”或“否”。
- 事实问题:答案为文档中出现的事实,如命名实体。
- 数值问题:答案为数值,可能包含单位或日本数字。
- 开放式问题:需要自由形式的回答,评估基于提供上下文和问题的复杂理解能力。
语言
数据集中的语言为日语。
数据集结构
数据实例
数据集包含训练、验证和测试集,分别有9,290、1,134和1,176个问答实例。每个实例包括多个字段,如答案、答案类型、上下文、问题等。
数据字段
answer: 答案answer_type: 答案类型(是/否、事实、数值、开放式)context: 上下文信息original_question: 原始问题pdf_category: 文档类别pdf_name: PDF文件名question: 问题查询type_of_image: 图像类型(如表格、图表等)
数据分割
数据集被分割为训练、验证和测试集,确保同一PDF文件始终出现在同一分割中。
数据集创建
数据收集和规范化
数据集从日本国家图书馆的数字收藏、网络存档项目和日本政府部门网站等公开资源手动收集PDF文档。文档类型包括报告、手册或网站,由公共或准公共部门发布。
标注过程
数据集由43名标注者进行问答对标注。每个文档要求标注者编写两到四个问答对,不使用任何AI工具。问题根据文档中的文本和视觉信息生成。
使用数据的考虑
社会影响
数据集预计对生成语言模型及其在日语文档问答中的应用研究和开发有用。
偏见讨论
数据集避免使用私人文档,选择由公共或准公共部门发布的公开文档,遵循机构规则和外部顾问的建议进行数据收集。
其他已知限制
数据集包含不可回答的问题,有助于解决大型语言模型的幻觉问题,但并不保证完全消除幻觉。




