korfinvdr-disclosure_report
收藏资源简介:
KorFinVDR 数据集中的 disclosure_report 子集是一个专门用于韩语视觉文档检索和复杂文档问答的语料库。该数据集包含来自韩国公平交易委员会(Fair Trade Commission)的企业集团所有权披露报告,具体包括年度股票所有权状况报告(주식소유현황 보고서)和按企业集团划分的所有权结构图(기업집단별 소유지분도)。数据涵盖2013年至2025年期间的报告,共有24份原始文档,总计1231个页面。数据集包含489个查询(queries)和1436个查询-文档页面相关性判断(qrels)。每个查询都带有类型、格式和答案。语料库(corpus)配置提供页面图像(PIL.Image)、提取的文本(markdown)和布局元素(elements)等。文档元数据(document_metadata)配置提供标题、文件名、来源URL、发布者、年份、页数和许可证信息。该数据集旨在支持韩语视觉文档检索和复杂文档问答任务,特别是针对金融领域的企业集团所有权结构文档。所有标注、查询-文档相关性判断及相关元数据均采用知识共享署名4.0国际许可协议(CC BY 4.0),原始文档的许可继承自原始发布者,多数为韩国开放政府许可证(KOGL)第一类。
The disclosure_report subset of the KorFinVDR dataset is a specialized corpus for Korean visual document retrieval and complex document question answering. It contains corporate group ownership disclosure reports from the Korea Fair Trade Commission, including annual stock ownership status reports (주식소유현황 보고서) and ownership structure diagrams by business group (기업집단별 소유지분도). The data covers reports from 2013 to 2025, comprising 24 original documents with a total of 1231 pages. The dataset includes 489 queries and 1436 query-document page relevance judgments (qrels). Each query has a type, format, and answer. The corpus configuration provides page images (PIL.Image), extracted text (markdown), and layout elements. The document metadata configuration provides title, filename, source URL, publisher, year, page count, and license information. The dataset is designed to support Korean visual document retrieval and complex document QA tasks, particularly for financial sector corporate group ownership structure documents. All annotations, query-document relevance judgments, and related metadata are licensed under CC BY 4.0; the original documents inherit licenses from the original publishers, mostly Korea Open Government License (KOGL) Type 1.
KorFinVDR: Disclosure Report 数据集概述
数据集简介
KorFinVDR: Disclosure Report 是一个韩语视觉文档检索和复杂文档问答数据集,包含韩国公平贸易委员会关于企业集团所有权的报告。该数据集是 KorFinVDR Benchmark 的五个子集之一,文档类型涵盖所有权现状报告和企业集团所有权结构图。
数据集统计
- 总文档数: 24
- 总语料页数: 1,231
- 总查询数: 489
- 总相关性判断数(qrels): 1,436
- 语言: 韩语(
ko)
数据子集结构
数据集包含四个子集:corpus、queries、qrels 和 document_metadata。
1. Corpus(语料库)
包含待检索的完整文档集合,每个实例包含以下字段:
- corpus_id
<int>:语料页面的唯一数字标识符 - image
<PIL.Image>:渲染的页面图像 - doc_id
<str>:源文档的标识符 - markdown
<str>:通过文档处理流程从页面提取的文本 - elements
<str>:JSON 序列化的布局元素列表,包含边界框和文本 - page_number_in_doc
<int>:源文档中的原始页码
2. Queries(查询)
包含韩语问题或搜索查询集,每个实例包含以下字段:
- query_id
<int>:查询的唯一数字标识符 - query
<str>:用于检索的搜索问题或陈述 - query_type
<str>:描述查询意图的类别 - query_format
<str>:查询格式,如instruction、keyword或question - answer
<str>:基于源文档的答案
3. Qrels(相关性判断)
将查询映射到对应的相关语料页面,每个实例包含以下字段:
- query_id
<int>:查询的唯一数字标识符 - corpus_id
<int>:对应语料页面的唯一数字标识符 - score
<int>:查询-语料对的相关性得分,可为1(部分相关)或2(完全相关)
4. Document Metadata(文档元数据)
包含原始 PDF 的文档级元数据,每个实例包含以下字段:
- doc_id
<str>:用于关联语料页面与其源文档的标识符 - title
<str>:文档标题 - file_name
<str>:原始 PDF 文件名 - url
<str>:文档的来源 URL - provider
<str>:原始发布者或提供者 - year
<int>:出版年份 - page_number
<int>:文档的页数 - license
<str>:源文档的许可或版权信息
许可信息
- 数据集的所有标注、查询-文档相关性判断及相关元数据采用 CC BY 4.0 许可。
- 原始源文档及其解析文本的许可状态继承自原始发布者,各文档的具体许可在
document_metadata["license"]字段中提供。 - 部分文档遵循 Korea Open Government License (KOGL) Type 1,来源为韩国公平贸易委员会的公开资料(2013年–2025年的年度报告和所有权结构图)。
相关链接
- GitHub: https://github.com/Marker-Inc-Korea/kor-fin-vdr
- 数据集集合: https://huggingface.co/collections/MarkrAI/korfinvdr




