bevaya/MultiHiertt
收藏资源简介:
MultiHiertt是一个用于数值推理的数据集,专门针对包含多个层次金融表格的文档。该数据集基于FinTabNet构建,从S&P 500年度报告(1999-2019年)中提取了4,791个多页文档。每个文档包含2-6个层次HTML表格和周围文本。问题需要跨多个表格和/或文本段落进行推理,答案通过算术程序或直接跨度选择得出。数据集包含训练集(7,830个示例)和验证集(1,044个示例),并提供了详细的字段描述,如唯一ID、段落、表格HTML、表格描述、问题、答案、程序、文本证据和表格证据。数据集的许可证为MIT,底层表格数据来自CDLA-Permissive-1.0许可证的FinTabNet。
MultiHiertt is a dataset for numerical reasoning over documents containing multiple hierarchical financial tables. It is built on FinTabNet, extracting 4,791 multi-page documents from S&P 500 annual reports (1999-2019). Each document contains 2-6 hierarchical HTML tables and surrounding text. Questions require reasoning across multiple tables and/or text passages, with answers derived via arithmetic programs or direct span selection. The dataset includes a train split (7,830 examples) and a validation split (1,044 examples), with detailed fields such as unique ID, paragraphs, table HTML, table description, question, answer, program, text evidence, and table evidence. The license is MIT for QA annotations, and the underlying table data is sourced from FinTabNet under CDLA-Permissive-1.0.



