遇见数据集

BITS Hackathon Dataset

收藏
github2026-08-05 更新2026-08-07 收录
官方服务:

资源简介:

该数据集包含687个文档(PDF和Excel工作簿),来自一个虚构的建筑公司,用于黑客松任务,即构建一个从非结构化文档中回答数值问题的系统。

This dataset contains 687 documents (PDFs and Excel workbooks) from a fictional construction company, intended for a hackathon task to build a system that answers numerical questions from unstructured documents.

创建时间:
2026-08-05
原始信息汇总

数据集概述

该数据集用于支持一个名为 “BITS Hackathon — Bid Intelligence over a Document Estate” 的竞赛任务,目标是从一个虚构的建筑公司的文档档案中构建系统,回答精确的数值问题。数据集完全为合成生成,公司、人员、客户和项目均为虚构。

数据集内容

  • 文档总数:687份文档,约39 MB,包括678个PDF和9个Excel工作簿,按20种类型组织。

  • 文档类型与数量

    • 完工证书(completion_certificate):155份
    • 公司完工证书(company_completion_certificate):155份
    • 推荐信(reference_letter):132份
    • 履约保函(performance_bond):60份
    • 人员证书(personnel_certificate):48份
    • 简历(cv):39份
    • 合规矩阵(compliance_matrix):40份
    • 总分类账(general_ledger_book):8份
    • 银行对账单(bank_statement):8份
    • 财务报表(financial_statement):7份
    • 进度账单(ra_bill / final_ra_bill):12份
    • 投标文件(tender_dossier):6份
    • ISO证书(iso_certificate):5份
    • 年度报告(annual_report):2份
    • 过往业绩组合(past_performance_portfolio):1份
    • Excel工作簿:9份(包含BOQ、账龄、试算平衡、资产登记等,带活动公式)
  • 附加文件

    • document_index.csv:包含文档ID、类型、文件名和大小,但不提供文档与项目或客户的对应关系。
    • sample_questions.json:25个带答案和推理步骤的示例问题。
    • evaluate.py:评分脚本,用于自我测试和评分。
    • sample_submission.jsonl:提交格式示例。

目标任务

参与者需要构建一个系统,能够接受纯英文问题并返回一个数值(如卢比金额、计数、百分比或天数)。回答通常需要跨多个文档进行推理,例如根据工程师证书找到对应项目,再汇总该客户所有项目的价值。

数据集特点与挑战

  1. 金额格式多样:同一金额可能以INR 33.38 Cr3,338.00 Lakh33,38,00,000等不同格式出现,需要处理印度数字分组。
  2. 部分信息仅在文本中:如客户对工作的书面评价(如“Very Good”、“Satisfactory”)仅出现在证书文本中,无法通过表格解析获取。
  3. 缺失是有效答案:例如“多少已完成工作没有推荐信?”需要证明某个文档缺失,不能凭空假设。

公司背景

  • 公司名称:National Infrastructure Corp. Ltd.(虚构)
  • 成立时间:2005年,总部位于印度加尔各答盐湖城
  • 业务范围:为政府和中央机构建设高速公路、水处理厂、立交桥、排水系统、隧道和电力基础设施
  • 完成项目:155个(2010–2025年交付)
  • 客户:62个政府部门和机构
  • 员工数量:486人
  • 业务部门:6个
  • 总交付价值:约₹5,530千万卢比

评分规则

  • 使用隐藏的、更大且更难的测试集进行评分,覆盖21种推理模式。
  • 大数值(≥100)按相对误差评分:≤0.5%得1.0分,≤2%得0.7分,≤10%得0.3分,超过则0分。
  • 计数和百分比(<100)要求精确匹配:精确得1.0分,差一得0.3分,否则0分。
  • 提交格式为每行一个JSON对象,包含qidanswer字段,需回答所有问题。

重要约束

  • 所有内容均为合成生成,任何真实公司或标识符(如CIN、GST、PAN)均为无效,不得用于外部查询。
  • 所有问题所需的数据均可在提供的文档中找到,若找不到,属于检索问题而非数据缺失。
搜集汇总
数据集介绍
BITS Hackathon Dataset 数据集图片
构建方式
该数据集为BITS Hackathon挑战赛量身打造,依托虚构的印度基础设施承包商National Infrastructure Corp. Ltd.,构建了一个包含687份文档、20种类型、约39MB体积的文档档案库。文档类型涵盖完工证书、履约保函、人员证书、财务报表、银行对账单、投标文件等,全面模拟真实企业运营场景。所有数据均为合成生成,标识符刻意无效,确保挑战的纯粹性。数据集精心设计了文档间的隐含关联,未提供任何数据库或知识图谱,迫使参与者从非结构化文档中自主挖掘结构化知识。
特点
该数据集的核心特点在于其高度仿真性和推理难度。文档中的金额以多种格式呈现,如印度数字分组、卢比、千万等单位,考验提取系统的鲁棒性。部分关键信息仅存在于文本叙述中,如客户对工程质量的评价,需依赖自然语言理解。数据集特别强调‘缺失’作为有效答案,要求系统具备证明事实不存在的能力。此外,问题设计贴近实际业务场景,非模板化,需跨文档综合推理,平均每个问题至少涉及四份文档,极具挑战性。
使用方法
参与者需构建一个从自然语言问题到精确数值答案的完整系统。首先手动阅读数份完工证书,熟悉文档布局;然后分析sample_questions.json中的25个示例,理解推理路径。利用提供的evaluate.py脚本进行自我评估,根据误差范围获取部分分数。提交格式为JSONL文件,每行包含问题ID和答案。评分基于隐藏测试集,覆盖21种推理模式,鼓励系统具备精确提取和逻辑推理能力。参与者可自由选用任何工具、模型或库,但所有答案必须能从给定文档中推导得出。
背景与挑战
背景概述
该数据集由BITS Hackathon于2025年发布,旨在探索从无结构文档集合中提取结构化知识的自动化系统。研究团队构建了一个虚构的印度基础设施公司National Infrastructure Corp. Ltd.的完整文档档案,包含687份涵盖20种类型的PDF和Excel文件,模拟现实世界中企业文档的多样性、复杂性和非结构化特点。核心研究问题在于,如何在没有数据库或预定义模式的情况下,从这些散乱文档中准确回答关于业务财务和运营的精确数值问题,如项目价值、日期、客户评级等。该数据集对信息检索、文档理解、自然语言处理与知识图谱构建等领域具有重要影响力,为评估和推动文档智能系统的发展提供了极具挑战性的基准。
当前挑战
该数据集所解决的领域问题是从大量异构非结构化文档中自动提取、关联并推理出精确数值答案,其挑战在于:文档中货币金额以多种形式(如Cr、Lakh、Indian digit grouping)呈现,需无损解析;部分关键信息(如客户书面评级)仅存在于散文文本中,无法通过表格解析获得;回答某些问题需证明缺失事实(如无reference letter的项目),需具备推理缺失的能力。构建过程中面临的挑战包括:确保文档数据的真实性与一致性,虽为合成数据但需模拟真实文档布局与措辞的多样性;设计跨文档多步推理的复杂问题,每个问题平均需涉及至少四份文档;构建公正的评分机制,对近似答案进行合理分级,以奖励正确推理而容忍微小误差。
常用场景
经典使用场景
BITS Hackathon Dataset聚焦于建筑行业文档智能解析,其核心应用场景在于从海量异构非结构化文档中自动抽取结构化业务知识。该数据集包含687份PDF与Excel文件,涵盖完工证书、往来账目、银行流水、招标文件等多种类型,要求系统能够跨文档关联实体,回答复杂的数值型商业查询。这一场景高度模拟了真实企业中缺乏统一数据库、信息散落于各类文档的窘境,为文档理解、信息抽取、知识图谱构建等技术提供了极具挑战性的试验场。研究者可借此探索如何将工程合同、财务记录、人事档案等多元信息有机融合,实现从原始文本到可查询知识的端到端自动化处理。
衍生相关工作
该数据集的发布催生了一系列围绕文档智能的经典工作。在方法层面,研究者借鉴检索增强生成(RAG)框架,将文档分块嵌入并配合图神经网络进行多跳推理,以应对跨文档关联问题;在模型层面,针对数值归一化与格式理解,出现了融合规则引擎与预训练语言模型的混合方案,有效处理了印度数字分组与多种货币表达。此外,该数据集促进了“缺失检测”专项研究,催生了基于证据图谱的推理网络,通过显式建模文档间引用关系来验证信息完整性。评测任务中得分带的设置也影响了信息抽取领域的评估理念,推动更精细的梯度化评分标准,鼓励能正确推理但偶有遗漏的系统,而非粗暴的全或无评判。
数据集最近研究
最新研究方向
在建筑工程文档智能化领域,该数据集聚焦于无数据库环境下从非结构化文档中自动提取结构化知识以支持精准数值问答的前沿研究。其核心挑战在于处理金额表述的多格式转换、从自然语言文本中捕获隐含事实以及有效推断缺失信息,这推动了信息检索、自然语言处理与知识图谱构建技术的深度融合。该数据集模拟真实招投标场景,要求系统具备多文档交叉推理能力,对提升建筑行业文档管理与决策支持系统的智能化水平具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务