遇见数据集

korfinvdr-disclosure_report

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

KorFinVDR 数据集中的 disclosure_report 子集是一个专门用于韩语视觉文档检索和复杂文档问答的语料库。该数据集包含来自韩国公平交易委员会(Fair Trade Commission)的企业集团所有权披露报告,具体包括年度股票所有权状况报告(주식소유현황 보고서)和按企业集团划分的所有权结构图(기업집단별 소유지분도)。数据涵盖2013年至2025年期间的报告,共有24份原始文档,总计1231个页面。数据集包含489个查询(queries)和1436个查询-文档页面相关性判断(qrels)。每个查询都带有类型、格式和答案。语料库(corpus)配置提供页面图像(PIL.Image)、提取的文本(markdown)和布局元素(elements)等。文档元数据(document_metadata)配置提供标题、文件名、来源URL、发布者、年份、页数和许可证信息。该数据集旨在支持韩语视觉文档检索和复杂文档问答任务,特别是针对金融领域的企业集团所有权结构文档。所有标注、查询-文档相关性判断及相关元数据均采用知识共享署名4.0国际许可协议(CC BY 4.0),原始文档的许可继承自原始发布者,多数为韩国开放政府许可证(KOGL)第一类。

The disclosure_report subset of the KorFinVDR dataset is a specialized corpus for Korean visual document retrieval and complex document question answering. It contains corporate group ownership disclosure reports from the Korea Fair Trade Commission, including annual stock ownership status reports (주식소유현황 보고서) and ownership structure diagrams by business group (기업집단별 소유지분도). The data covers reports from 2013 to 2025, comprising 24 original documents with a total of 1231 pages. The dataset includes 489 queries and 1436 query-document page relevance judgments (qrels). Each query has a type, format, and answer. The corpus configuration provides page images (PIL.Image), extracted text (markdown), and layout elements. The document metadata configuration provides title, filename, source URL, publisher, year, page count, and license information. The dataset is designed to support Korean visual document retrieval and complex document QA tasks, particularly for financial sector corporate group ownership structure documents. All annotations, query-document relevance judgments, and related metadata are licensed under CC BY 4.0; the original documents inherit licenses from the original publishers, mostly Korea Open Government License (KOGL) Type 1.

创建时间:
2026-07-27
原始信息汇总

KorFinVDR: Disclosure Report 数据集概述

数据集简介

KorFinVDR: Disclosure Report 是一个韩语视觉文档检索和复杂文档问答数据集,包含韩国公平贸易委员会关于企业集团所有权的报告。该数据集是 KorFinVDR Benchmark 的五个子集之一,文档类型涵盖所有权现状报告和企业集团所有权结构图。

数据集统计

  • 总文档数: 24
  • 总语料页数: 1,231
  • 总查询数: 489
  • 总相关性判断数(qrels): 1,436
  • 语言: 韩语(ko

数据子集结构

数据集包含四个子集:corpusqueriesqrelsdocument_metadata

1. Corpus(语料库)

包含待检索的完整文档集合,每个实例包含以下字段:

  • corpus_id <int>:语料页面的唯一数字标识符
  • image <PIL.Image>:渲染的页面图像
  • doc_id <str>:源文档的标识符
  • markdown <str>:通过文档处理流程从页面提取的文本
  • elements <str>:JSON 序列化的布局元素列表,包含边界框和文本
  • page_number_in_doc <int>:源文档中的原始页码

2. Queries(查询)

包含韩语问题或搜索查询集,每个实例包含以下字段:

  • query_id <int>:查询的唯一数字标识符
  • query <str>:用于检索的搜索问题或陈述
  • query_type <str>:描述查询意图的类别
  • query_format <str>:查询格式,如 instructionkeywordquestion
  • answer <str>:基于源文档的答案

3. Qrels(相关性判断)

将查询映射到对应的相关语料页面,每个实例包含以下字段:

  • query_id <int>:查询的唯一数字标识符
  • corpus_id <int>:对应语料页面的唯一数字标识符
  • score <int>:查询-语料对的相关性得分,可为 1(部分相关)或 2(完全相关)

4. Document Metadata(文档元数据)

包含原始 PDF 的文档级元数据,每个实例包含以下字段:

  • doc_id <str>:用于关联语料页面与其源文档的标识符
  • title <str>:文档标题
  • file_name <str>:原始 PDF 文件名
  • url <str>:文档的来源 URL
  • provider <str>:原始发布者或提供者
  • year <int>:出版年份
  • page_number <int>:文档的页数
  • license <str>:源文档的许可或版权信息

许可信息

  • 数据集的所有标注、查询-文档相关性判断及相关元数据采用 CC BY 4.0 许可。
  • 原始源文档及其解析文本的许可状态继承自原始发布者,各文档的具体许可在 document_metadata["license"] 字段中提供。
  • 部分文档遵循 Korea Open Government License (KOGL) Type 1,来源为韩国公平贸易委员会的公开资料(2013年–2025年的年度报告和所有权结构图)。

相关链接

  • GitHub: https://github.com/Marker-Inc-Korea/kor-fin-vdr
  • 数据集集合: https://huggingface.co/collections/MarkrAI/korfinvdr
搜集汇总
数据集介绍
korfinvdr-disclosure_report 数据集图片
构建方式
KorFinVDR Disclosure Report数据集的构建源于韩国公平交易委员会公开的企业集团所有权状态报告及所有权结构图,覆盖了2013年至2025年的年度文档。为适配视觉文档检索与复杂文档问答任务,构建流程首先将这些原始PDF文档进行页面级拆分,并通过文档处理流水线提取文本及布局元素,生成带边界框的结构化信息。随后,依据这些文档内容,人工制定了涵盖不同意图与格式的韩语查询,并为每个查询标注了与其相关的页面相关度评分,从而形成包含语料库、查询、相关度判断及文档元数据四个子集的数据结构。
特点
该数据集的特点在于其针对韩国企业集团所有权披露文档的视觉检索与复杂问答场景进行了专门设计。其语料库以页面为单位存储,每页不仅包含渲染图像和Markdown文本,还保留了详细的布局元素与坐标信息,便于处理图文混排的复杂版式。相关度标注区分了完全相关和部分相关两个层级,为评估检索系统提供了细致的粒度。查询集则包含了指令、关键词和问题等多种格式,并附有标准答案,能够全面检验模型在信息定位与综合推理方面的性能。此外,数据集还提供了完整的文档级元数据,包括来源、年份和许可信息,增强了数据的可利用性与透明度。
使用方法
使用该数据集时,研究者可充分利用其四个子集开展多种任务。通过语料库子集中的页面图像和文本,可以训练或评估视觉文档检索模型,利用查询子集中的问题与qrels中的相关度判断来衡量检索效果。对于文档问答任务,可以将查询中的问题、语料库中的文本作为输入,以answer字段作为参考答案。同时,document_metadata子集提供了文档的背景信息,便于进行细粒度分析或构建元数据感知的模型。数据集在HuggingFace上以corpus、queries、qrels和document_metadata四个配置组织,可分别加载,便于与现有工具链集成。
背景与挑战
背景概述
KorFinVDR Disclosure Report数据集由Marker Inc. Korea的研究团队于近期创建,旨在推动韩语视觉文档检索与复杂文档问答领域的发展。该数据集以韩国公平交易委员会发布的年度企业集团所有权报告为核心,系统性地收集了2013年至2025年间的24份官方文档,涵盖1231个语料页面、489条查询及1436个相关性标注,构建了一个专为视觉文档检索和文档级问答设计的高质量基准。作为KorFinVDR基准的五个子集之一,该数据集聚焦于企业集团持股结构这一特定金融领域,填补了韩语金融文档智能处理方向的数据空白。其发布为研究者提供了评估检索模型在处理非结构化、视觉密集型文档时的性能基准,对推动多模态信息检索与金融文本分析交叉领域的研究具有重要参考价值与影响力。
当前挑战
该数据集在构建过程中面临多重挑战。首先,核心领域问题在于文档结构高度复杂,企业集团所有权报告包含大量层级关系、图表和跨页信息,需实现细粒度的视觉与语义理解,这对现有文档检索模型提出了超越传统文本匹配的鲁棒性要求。其次,构建过程中需处理多类型文档,包括所有权报告和所有权地图,其布局差异大、信息密度高,且部分年份的文档格式不统一,增加了数据清洗与标准化难度。此外,由于原始PDF以韩语撰写,需设计专门的多模态解析流程来提取版式与内容信息,并确保数据标注的准确性和一致性,尤其在区分部分相关与完全相关的相关性等级时,依赖人工专家的细致判断,成本高且易产生主观偏差。
常用场景
经典使用场景
KorFinVDR-disclosure_report数据集聚焦于韩国企业集团所有权披露报告的视觉文档检索与复杂文档问答任务,其经典使用场景涉及利用高分辨率页面图像与结构化文本(markdown)及布局元素(elements)进行多模态信息抽取。研究者常借助该数据集评估模型在处理密集的股权结构图、注释性表格及分层级标题等复杂版面时的视觉-语言对齐能力,推动视觉文档检索(VDR)与文档问答(Document QA)在金融监管语料上的性能提升。
解决学术问题
该数据集有效解决了学术研究中韩国金融监管文档缺乏高质量标注基准的瓶颈问题,为视觉文档检索与复杂文档理解提供了包含精细相关性判断(部分相关与完全相关)的评测集。通过提供查询意图分类(query_type)、多样化查询格式(指令、关键词、问题)及布局元素级标注,它支持了对模型在跨页信息整合、表格理解、多层结构推理等学术挑战的系统性研究,并促进了多模态文档处理技术在低资源语言(韩语)上的探索,对文档智能领域有重要推动作用。
衍生相关工作
KorFinVDR-disclosure_report作为KorFinVDR基准的组成部分,催生了多项视觉文档底层技术的研究工作。其发布激励了针对韩语文档的视觉语言模型预训练、基于布局感知的文档表示学习、以及表格结构识别与解析算法的研发。此外,该数据集的查询与相关文档对常被用于训练和评估密集检索模型、重排序器以及生成式问答模型,并为多模态大型语言模型(如文档级VLM)的微调提供基准,进而衍生出金融文档专用的信息抽取与知识图谱构建等延伸研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务