遇见数据集

large-traversaal/HYDRA-M3-V0

收藏
Hugging Face2025-11-29 更新2026-02-07 收录
官方服务:

资源简介:

--- license: mit task_categories: - question-answering - text-generation language: - en tags: - finance - multimodal - multihop - rag - 10-K - financial-analysis size_categories: - n<1K configs: - config_name: default data_files: - split: train path: "Dataset/finalized_dataset.jsonl" --- # MMM_HYDRA: Heterogeneous Yielding Dataset for Reasoning Across - Multi-hop, Multimodal, Multicompany ## Dataset Description **MMM_HYDRA** is a benchmark dataset for evaluating Retrieval-Augmented Generation (RAG) systems on complex financial document analysis. The dataset contains 200 carefully curated questions with answers extracted from 99 unique corporate 10-K filings across 15 industry sectors. ### Key Features - **Multi-Company**: 54 questions (27%) span multiple corporate entities requiring cross-company analysis - **Multimodal**: Text, images, and tables from financial documents - **Multihop**: Requires reasoning across multiple document sections and sources - **Real-World**: Based on actual SEC 10-K filings from major corporations ### Dataset Statistics - **Total Questions**: 200 - **Unique Documents**: 99 corporate 10-K filings - **Industry Sectors**: 15 (Tech Giants, Fast Food, Healthcare, Retail, etc.) - **Multi-Company Questions**: 54 (27%) - **Single-Company Questions**: 146 (73%) - **Average Question Length**: 142 characters - **Average Answer Length**: 543 characters ### Question Distribution **By Type:** - Long Answer: 106 questions (53%) - Short Answer: 94 questions (47%) **By Industry Sector:** - Tech Giants: 43 questions (21.5%) - Fast Food: 23 questions (11.5%) - Delivery & Groceries: 22 questions (11%) - Beverages: 22 questions (11%) - Entertainment: 20 questions (10%) - Retail: 19 questions (9.5%) - Airlines: 12 questions (6%) - Healthcare: 9 questions (4.5%) - Others: 30 questions (15%) **By Solution Modality:** - Text Only: ~50% - Text + Table: ~25% - Text + Image: ~15% - Table Only/Image Only: ~10% **By Document Count:** - 2 documents: 150 questions (75%) - 3 documents: 40 questions (20%) - 4 documents: 8 questions (4%) - 1 document: 1 question (0.5%) ### Top Companies in Dataset Most frequently referenced companies: 1. Meta (42 references) 2. Alphabet/Google (28 references) 3. Burger King (17 references) 4. Uber (17 references) 5. Wendy's (12 references) 6. DoorDash (12 references) 7. Best Buy (12 references) 8. McDonald's (11 references) ## Dataset Structure ### Data Configurations This dataset includes multiple configurations accessible through the viewer: - **default**: Main dataset with questions and answers (`dataset/dataset.json`) - **images_metadata**: Metadata for associated images (`dataset/images_csv`) - **categories**: Category information (`dataset/categories.csv`) - **tables**: Structured table data (`tables/all_tables.json`) ### Data Fields - `id`: Unique identifier for each question - `q_no`: Question number - `Subset`: Industry sector/category - `Multi company ?`: Boolean indicating if question spans multiple companies - `Number of Docs`: Number of source documents required - `Question`: The question to answer - `Answer`: Ground truth answer - `Question Type`: Short Answer or Long Answer - `Solution Requires`: Modality required (Text Only, Text + Table, Text + Image, etc.) - `Context(s)`: Relevant document sections (text) - `Context Images`: Associated image references - `Context tables`: Associated table references - `Related Images`: Image identifiers - `Related tables`: Table identifiers - `Number of Pages`: Page count of source documents - `Solution in Page(s)`: Specific pages containing the answer - `Sources DOCS`: List of source document filenames # ## Benchmark Use Cases This dataset is designed to evaluate: 1. **Multi-document Reasoning**: Questions require synthesizing information from 1-4 documents 2. **Multimodal Understanding**: Integration of text, tables, and images from financial documents 3. **Cross-company Analysis**: Comparing metrics and strategies across different companies 4. **Financial Domain Knowledge**: Understanding of business terminology and financial concepts 5. **Long-form Generation**: Producing detailed, accurate answers to complex questions ## Citation If you use this dataset, please cite: ```bibtex @dataset{mmm_hydra_2025, title={MMM_HYDRA: Multi-Company Multimodal Multihop Financial Reasoning Benchmark}, year={2025}, publisher={Hugging Face}, howpublished={\url{https://huggingface.co/datasets/your-username/MMM_HYDRA}} } ``` ## License This dataset is released under the MIT License. ## Acknowledgments This dataset is built from publicly available SEC 10-K filings and is intended for research and evaluation purposes. This dataset is released under the MIT License.

--- 许可证:MIT协议 任务类别: - 问答 - 文本生成 语言: - 英语 标签: - 金融 - 多模态 - 多跳 - 检索增强生成(Retrieval-Augmented Generation,RAG) - 10-K文件 - 金融分析 数据规模类别: - 样本数少于1000 配置项: - 配置名称:default 数据文件: - 拆分:训练集 路径:"Dataset/finalized_dataset.jsonl" --- ## MMM_HYDRA:面向多跳、多模态、跨企业推理的异构收益基准数据集 ## 数据集说明 **MMM_HYDRA**是一款用于评估检索增强生成(Retrieval-Augmented Generation,RAG)系统在复杂金融文档分析任务中性能的基准数据集。该数据集包含200条精心筛选的问题,其答案取自覆盖15个行业板块的99份独立企业10-K文件。 ### 核心特性 - **跨企业分析**:54条问题(占比27%)涉及多家企业实体,需开展跨企业对比分析 - **多模态支持**:涵盖金融文档中的文本、图像与表格数据 - **多跳推理**:需跨多个文档章节与数据源完成逻辑推演 - **真实场景构建**:基于头部企业的公开美国证券交易委员会(Securities and Exchange Commission,SEC)10-K文件构建 ### 数据集统计数据 - **总问题数**:200条 - **独立文档数**:99份企业10-K文件 - **覆盖行业板块**:15个(科技巨头、快餐、医疗保健、零售等) - **跨企业问题数**:54条(占比27%) - **单企业问题数**:146条(占比73%) - **平均问题长度**:142个字符 - **平均答案长度**:543个字符 ### 问题分布 **按类型划分:** - 长答案问题:106条(占比53%) - 短答案问题:94条(占比47%) **按行业板块划分:** - 科技巨头:43条(21.5%) - 快餐行业:23条(11.5%) - 配送与杂货零售:22条(11%) - 饮料行业:22条(11%) - 娱乐行业:20条(10%) - 零售行业:19条(9.5%) - 航空行业:12条(6%) - 医疗保健行业:9条(4.5%) - 其他行业:30条(15%) **按求解模态划分:** - 仅文本:约50% - 文本+表格:约25% - 文本+图像:约15% - 仅表格/仅图像:约10% **按所需文档数量划分:** - 2份文档:150条问题(75%) - 3份文档:40条问题(20%) - 4份文档:8条问题(4%) - 1份文档:1条问题(0.5%) ### 数据集中高频引用企业 被引用次数最多的企业如下: 1. Meta(42次引用) 2. Alphabet/谷歌(28次引用) 3. 汉堡王(17次引用) 4. Uber(17次引用) 5. 温迪汉堡(12次引用) 6. DoorDash(12次引用) 7. 百思买(12次引用) 8. 麦当劳(11次引用) ## 数据集结构 ### 数据配置 该数据集包含多个可通过查看器访问的配置项: - **default**:包含问题与答案的主数据集(`dataset/dataset.json`) - **images_metadata**:关联图像的元数据(`dataset/images_csv`) - **categories**:分类信息(`dataset/categories.csv`) - **tables**:结构化表格数据(`tables/all_tables.json`) ### 数据字段 - `id`:每条问题的唯一标识符 - `q_no`:问题编号 - `Subset`:行业板块/分类 - `Multi company ?`:布尔值,用于标识问题是否涉及多家企业 - `Number of Docs`:所需源文档的数量 - `Question`:待解答的问题 - `Answer`:标准答案 - `Question Type`:问题类型,分为短答案与长答案 - `Solution Requires`:所需求解模态(仅文本、文本+表格、文本+图像等) - `Context(s)`:相关文档章节(文本内容) - `Context Images`:关联图像引用 - `Context tables`:关联表格引用 - `Related Images`:图像标识符 - `Related tables`:表格标识符 - `Number of Pages`:源文档的总页数 - `Solution in Page(s)`:包含答案的特定页面 - `Sources DOCS`:源文档文件名列表 ## 基准测试用例 本数据集旨在评估以下能力: 1. **多文档推理**:问题需要整合1至4份文档中的信息 2. **多模态理解**:对金融文档中的文本、表格与图像进行融合理解 3. **跨企业分析**:对比不同企业的业务指标与战略规划 4. **金融领域知识**:掌握商业术语与金融概念 5. **长文本生成**:针对复杂问题生成详细且准确的答案 ## 引用声明 若使用本数据集,请引用以下文献: bibtex @dataset{mmm_hydra_2025, title={MMM_HYDRA: Multi-Company Multimodal Multihop Financial Reasoning Benchmark}, year={2025}, publisher={Hugging Face}, howpublished={url{https://huggingface.co/datasets/your-username/MMM_HYDRA}} } ## 许可证 本数据集采用MIT协议发布。 ## 致谢声明 本数据集基于公开可获取的美国证券交易委员会(Securities and Exchange Commission,SEC)10-K文件构建,仅用于研究与评估用途。本数据集采用MIT协议发布。

提供机构:
large-traversaal
二维码
社区交流群
二维码
科研交流群
商业服务