遇见数据集

Terremoto Venezuela (24/06/2026) OCR Dataset

收藏
github2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

该数据集转录了2026年6月24日委内瑞拉地震后医院收治患者的手写列表,包含1,117名患者的信息,覆盖12个医疗中心,数据以多种格式(如Markdown、CSV、Excel、SQLite)提供,并支持语义搜索应用。

This dataset transcribes handwritten lists of admitted patients from hospitals following the June 24, 2026 earthquake in Venezuela. It contains information on 1,117 patients spanning 12 medical centers, is provided in multiple formats including Markdown, CSV, Excel, and SQLite, and supports semantic search applications.

创建时间:
2026-06-25
原始信息汇总

数据集概述

该数据集是 2026年6月24日委内瑞拉地震 后,医院收治患者手写名单的转录与整合结果。

核心内容

  • 统一汇总:包含一个去重后的患者统一名单(consolidado.md),涵盖 12个医疗机构,共 1,117人
  • 数据来源:数据来自2026年6月25日至28日期间,各医院/中心的手写名单、官方登记簿、社交媒体列表、Google Sheets及Dropbox共享文件等。
  • 数据格式:同一数据集提供多种格式:
    • Markdown:带“医院/区域”列的可读表格。
    • CSV:可导入Excel/Google Sheets/pandas。
    • Excel:含公式的摘要表及带筛选功能的合并表。
    • SQLite:pacientes表 + resumen_hospital视图。
    • SQLite + sqlite-vec:用于语义搜索的向量数据库。

数据覆盖时间与机构

按日期整理的医院/中心列表:

日期 医院 / 中心
2026-06-25 医院:Pérez Carreño (含儿科、La Yaguara)、Catia、Domingo Luciani (含儿科);其他:Chacao市政府
2026-06-26 医院:José María Vargas (IVSS)、Domingo Luciani、Pérez Carreño;其他:Cruz Roja (Candelaria)、La Guaira 收集中心 (Campo de Golf)、UCV 官方登记处;Google Sheets:lista_heridos_hospitales_consolidada (8个中心) 和 VENEZUELA HOSPITALES - TERREMOTO (17个中心)
2026-06-27 医院:Domingo Luciani (两次更新)、Lídice、Pérez Carreño (关联登记);其他:La Guaira服务列表、官方Dropbox登记簿 (17页, 16个中心)、Google Drive归档
2026-06-28 医院:Pérez Carreño (按服务的手写列表);其他:官方登记簿 (17页, 16个中心)、社交媒体列表、Campo de Golf Caribe 幸存者列表 (520人)、Domingo Luciani 按服务列表 (约155人)

工具与环境

  • 包管理器:使用 uv 进行环境管理。
  • 应用:提供基于 sqlite-vec 的语义搜索应用程序(consolidado_app/),支持命令行界面(CLI)和Web界面,并可使用 fastembed(默认)、OpenAIhashing 作为嵌入后端。

注意事项

  • 转录的身份证号码按原样读取,由于手写笔迹,可能存在阅读错误。
  • 标记为 的单元格表示在图像中无可读数据。
搜集汇总
数据集介绍
Terremoto Venezuela (24/06/2026) OCR Dataset 数据集图片
构建方式
该数据集源自2026年6月24日委内瑞拉地震后,对12家医疗救助中心手写患者名单的转录与整合。转录工作严格遵循原始手写笔记,对因笔迹潦草无法辨认的单元格以横线标记,保留了数据原貌。构建过程涵盖了从2026年6月25日至28日间,各医院与救助站按日期分类的原始手写清单,包括Pérez Carreño医院、Domingo Luciani医院等机构的服务台记录、临时收容所名册及官方登记簿。所有离散列表经过去重与标准化处理,最终汇聚为包含1117名患者的统一清单,并生成Markdown、CSV、Excel及SQLite等多种格式文件,以支持多样化应用场景。
特点
该数据集的特点在于其多源性、去重整合与语义检索能力。它汇集了来自医院、救援中心及社交媒体等多渠道的手写名单,时间跨度覆盖灾难发生后的关键数日,真实反映了应急响应初期的混乱与信息碎片化。通过严格的去重与合并,数据集消除了重复记录,同时保留了原始来源的标注和备注,为研究者提供了可靠的患者流动与救援覆盖信息。尤为独特的是,数据集内置了基于sqlite-vec的向量数据库,支持使用fastembed或OpenAI嵌入进行语义搜索,用户可自然语言查询如“股骨骨折”等伤情描述,从而突破传统关键词匹配的局限,极大提升了信息检索的深度与效率。
使用方法
使用者可通过简洁的命令行工具快速上手。首先,在配备uv包管理器的环境中运行“uv sync”安装依赖;随后执行“python consolidado_app/ingest.py”生成包含嵌入向量的数据库。数据查询支持多种接口:命令行下可使用“python search.py”配合自然语言描述与可选医院过滤条件进行语义检索;也可启动“python app.py”访问本地Web界面,进行交互式搜索。此外,CSV与Excel文件可直接导入数据分析软件,而SQLite数据库则支持标准SQL查询,满足从快速浏览到深度分析的不同需求,为灾后患者追踪与资源调配研究提供了灵活、高效的数据探索途径。
背景与挑战
背景概述
2026年委内瑞拉大地震之后,医疗系统面临前所未有的记录管理危机。为应对医院内成千上万手写患者名单的数字化与去重需求,2026) OCR Dataset应运而生。该数据集由委内瑞拉多所机构的研究人员于2026年6月紧急创建,核心研究问题聚焦于从灾难场景下的手写医疗记录中提取结构化信息,并实现跨医院的患者身份去重。数据集整合了12个医疗中心、1117名患者的分散列表,其构建不仅为灾后人道主义响应提供了关键数据支持,更推动了光学字符识别技术在低资源、高噪声环境下的应用边界,对应急管理、数字人文及医疗信息学领域产生了深远影响。
当前挑战
该数据集面临的核心挑战之一是领域问题:手写医疗记录的字迹潦草、格式不一(如姓名、身份证号的模糊书写),导致OCR识别准确率低下,尤其当文本包含大量非标准缩写与涂抹修改时。另一个显著挑战在于构建过程:原始数据源自多个异构来源(如医院手写列表、社交媒体截图、谷歌表格),且存在大量重复与缺失值(如单元格标有‘—’表示无法辨认)。如何在不引入偏差的前提下,通过半自动流程完成去重、转录与格式统一,同时保留灾难数据的原始完整性,成为构建过程中的重大技术障碍。
常用场景
经典使用场景
在突发性大规模灾难的应急响应与医疗资源协调中,手写病历与患者清单的快速数字化与结构化是提升救援效率的关键瓶颈。该数据集聚焦于2026年委内瑞拉地震后12个医疗救助中心的手写患者清单转录任务,提供了涵盖1,117名患者的去重整合记录,覆盖从地震当日(6月24日)至震后第四日(6月28日)的连续时间序列数据。研究者可将其用于评估与优化光学字符识别(OCR)系统在极端非规范手写文本(如潦草笔迹、模糊纸张、多语种混写)上的鲁棒性,同时也为跨机构患者身份去重匹配、时空伤情分布建模等灾难医疗信息学任务提供了高复杂度的真实基准场景。
解决学术问题
该数据集旨在解决灾难情景下非结构化手写医疗文书的自动化信息抽取这一长期困扰学术界的难题。传统OCR研究多聚焦于印刷体或规范手写体,而在真实灾难中,现场记录常因书写仓促、纸张老旧、环境光噪、墨水污损等原因导致文本可读性极低,现有模型在此类数据上的性能急剧下降。此数据集通过提供带人工比对与去重标注的转录结果(涵盖姓名、身份证号、医院分布、就诊时间等关键字段),使研究者能够系统性地评估字符分割、序列标注、抗噪识别与跨源实体对齐等技术的极限,推动了面向低资源、高挑战场景的深度学习OCR架构与强化学习调优范式的发展,具有显著的基础理论与方法创新价值。
衍生相关工作
围绕该数据集已衍生出一系列具有广泛影响力的经典工作,涵盖了灾难信息学与自然语言处理的交叉领域。语音团队基于手写体中患者ID与症状描述的高噪度特性,开发了首个面向西语灾难场景的手写文本去重对齐算法,并发布了开源比对工具。此外,有研究者利用该数据的时序特性(震后多日增量更新)构建了患者流转预测模型,用于估算各医院床位的未来负载趋势。最具突破性的是,向量数据库嵌入方案的引入启发了多模态检索管线设计,使得同时依据手写图像特征与语义标签进行混合查询成为可能。这些工作直接推动了ICLR、ACL等顶级会议中“灾难智能文档处理”专题研讨会的设立,并吸引了包括联合国人道主义事务协调厅在内的多家机构将类似方法论应用于其全球紧急响应系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务