遇见数据集

Dataset Saúde do Rio

收藏
github2026-05-24 更新2026-05-26 收录
官方服务:

资源简介:

该数据集是为Claude Impact Lab 2026 Hackathon准备的,涉及里约热内卢的医疗数据,包括患者注册、临床事件、社区卫生工作者访问记录和健康团队信息。所有数据都经过严格的匿名化处理,不反映现实情况,仅用于说明医疗系统动态。

This dataset is prepared for the Claude Impact Lab 2026 Hackathon, covering medical data from Rio de Janeiro including patient registrations, clinical events, community health worker visit records and health team information. All data has undergone strict anonymization, does not reflect real-world scenarios, and is only used to illustrate medical system dynamics.

创建时间:
2026-05-21
原始信息汇总

🏥 Claude Impact Lab 2026 | Dataset Saúde do Rio

📊 Visão Geral do Dataset

Este dataset é parte do Claude Impact Lab 2026, um desafio promovido pela Prefeitura do Rio de Janeiro em parceria com a Anthropic. O objetivo é otimizar o planejamento de visitas domiciliares dos Agentes Comunitários de Saúde (ACS) utilizando inteligência artificial.

Contexto do Desafio

  • O Rio possui 6.200 ACS responsáveis por visitar ativamente 4,5 milhões de residentes nos territórios mais vulneráveis da cidade.
  • Atualmente, o planejamento das visitas depende de memória, papel e conhecimento informal do território.
  • Dados clínicos e sociais relevantes permanecem dispersos e pouco utilizados.
  • O desafio é transformar esses dados em uma resposta prática diária: quem visitar, em qual ordem, por qual motivo, com base em risco real e lacunas de cuidado.

🗂️ Estrutura dos Dados

O dataset é composto por 4 tabelas no formato Parquet:

1. Cadastros de Pacientes (pacientes.csv)

Cadastro completo de pacientes com informações demográficas e clínicas.

Coluna Tipo Descrição
paciente_id string Identificador único do paciente (hash)
equipe_id string Identificador da equipe responsável (hash)
unidade_id string Identificador da unidade de saúde (hash)
faixa_etaria string Faixa etária do paciente (ex: 0-6)
sexo string Sexo do paciente (Masculino/Feminino)
raca_cor string Raça/cor declarada (Branca/Preta/Parda)
situacao_vulnerabilidade boolean Indica se paciente está em situação de vulnerabilidade
endereco_longitude float Longitude do endereço do paciente
endereco_latitude float Latitude do endereço do paciente
hipertenso boolean Indica se paciente é hipertenso
diabetico boolean Indica se paciente é diabético
gestacao boolean Indica se paciente está gestante

2. Eventos Clínicos (eventos_clinicos.csv)

Registro de eventos clínicos dos pacientes.

Coluna Tipo Descrição
paciente_id string Identificador único do paciente (hash)
tipo string Tipo do evento clínico (ex: agendamento)
data_referencia date Data de referência do evento (formato: YYYY-MM-DD)

3. Visitas dos ACS (visitas.csv)

Registro de visitas realizadas por profissionais de saúde.

Coluna Tipo Descrição
profissional_id string Identificador único do profissional (hash)
registrados_em date Data em que a visita foi registrada (formato: YYYY-MM-DD)
ordem_visita_dia integer Ordem sequencial da visita no dia
paciente_id string Identificador do paciente visitado (hash)

4. Equipes de Saúde (equipes.csv)

Cadastro de equipes de saúde e suas localizações.

Coluna Tipo Descrição
equipe_id string Identificador único da equipe (hash)
endereco_latitude float Latitude da localização da unidade de saúde (ACS sempre começam aqui)
endereco_longitude float Longitude da localização da unidade de saúde (ACS sempre começam aqui)

🔗 Acesso aos Dados

Tabela Download
Cadastros de Pacientes 📥 Download
Eventos Clínicos 📥 Download
Visitas dos ACS 📥 Download
Equipes de Saúde 📥 Download

📘 Materiais de Apoio

Manuais do ACS (Ministério da Saúde)

Exemplos de Publicações


⚠️ Processo de Anonimização

Todos os dados do desafio passaram por rigoroso processo de anonimização. Indicadores gerados a partir dos dados NÃO representam a realidade, apenas ilustram as dinâmicas do sistema de saúde.

Técnicas Aplicadas

Técnica Descrição
Hash Criptográfico (SHA256) Geração de chave artificial para integração de tabelas via hash SHA256 com secret
Amostragem Cadastral Amostra de 2.000 pacientes por equipe
Date Shifting Deslocamento aleatório de dias (varia por paciente, mantém ordem sequencial)
Anonimização Geográfica Adição de até 100m de ruído nas coordenadas
Randomização de Endereços Embaralhamento de endereços mantendo lógica territorial de equipe
Generalização e Agregação Faixas etárias, categorias de raça/cor, agregação temporal
Supressões Remoção de procedimentos raros (<1000) e registros com k-anonymity <5

Impactos da Anonimização

O que NÃO representa a realidade:

  • Indicadores absolutos
  • Mapeamento territorial exato
  • Localização precisa
  • População total
  • Datas exatas de eventos

O que está preservado:

  • Sequência temporal dos eventos
  • Lógica territorial (com ruído)
  • Dinâmicas do sistema
  • Relações entre tabelas
  • Principais padrões de comportamento

🎯 Desafios Bônus

  • Para gestão: construir visualizações importantes para os gestores das unidades ou da área programática
  • Para o ACS: detectar lacunas de cuidado e melhorias em acompanhamentos que indiquem respostas mais rápidas
搜集汇总
数据集介绍
Dataset Saúde do Rio 数据集图片
构建方式
在里约热内卢庞大的公共卫生体系中,数以千计的社区卫生代理人负责对数百万居民进行家访,而这一日常工作的规划长期依赖纸质记录与个人记忆。为彻底扭转这一局面,Dataset Saúde do Rio应运而生。该数据集巧妙融合了患者登记、临床事件、家访记录与医疗团队信息四张核心表格,通过加密哈希、日期偏移与地理坐标添加随机噪声等手段,在严格保护隐私的前提下,精准描绘了社区健康管理的动态全貌。
使用方法
使用时,可首先通过患者登记表与医疗团队表建立空间关联,明确每个团队所需覆盖的服务对象范围。随后,结合临床事件记录筛选出患有慢性病或存在照护缺口的重点人群,并根据既往家访序列,生成基于风险等级的优先访问列表。最终,借助开源的数据分析工具与空间计算库,将多张表格的信息加以集成,设计出能够实时动态优化的智能家访规划方案。
背景与挑战
背景概述
Dataset Saúde do Rio 由里约热内卢市政府与 Anthropic 的 Claude Impact Lab 于 2026 年共同创建,旨在通过数据驱动优化社区卫生工作者(ACS)的入户探访规划。该数据集聚焦于巴西里约热内卢的基层医疗体系,涵盖超过 6200 名 ACS 负责的 450 万居民的健康管理数据。核心研究问题在于如何整合分散的临床与社会数据,将依赖人工记忆和纸质记录的探访计划转变为基于风险优先级的智能决策。该数据集已对敏感信息进行严格匿名化处理,包括哈希加密、地理噪声、日期移位等技术,以保障隐私安全。作为开放数据集,它推动了预防性医疗、减少可避免急诊入院的研究,对全球城市公共卫生领域的精准干预与资源分配具有重要示范意义。
当前挑战
领域内挑战:现有基层医疗探访规划严重依赖社区工作者的个人记忆、纸质记录和本地经验,缺乏对临床数据(如高血压、糖尿病、妊娠状态)和社会风险因素(如脆弱性)的系统整合,导致高风险家庭难以及时获得干预,可预防的急诊和住院发生率居高不下。构建过程中挑战:数据集构建需在隐私保护与现实可用性间取得平衡——采用 SHA256 哈希、地理坐标随机偏移(≤100 米)、日期随机移动(保持时序)等技术,但这也引入了局限性:绝对指标失真、精确地理位置不可用、仅保留 2000 人/团队的抽样,限制了基于空间聚集度的风险建模;同时,稀有事件被抑制(k-匿名性 <5),可能遗漏罕见危险信号,影响模型对真实动态的捕获能力。
常用场景
经典使用场景
在基层公共卫生服务的优化中,该数据集的核心用途在于构建基于风险分层的社区健康工作者(ACS)家访调度模型。研究人员可以利用患者人口统计学、临床状况(如高血压、糖尿病、妊娠状态)、社会脆弱性标记以及历史家访记录,结合地理坐标数据,设计路径规划算法。其经典场景是通过整合多源异构数据,生成每日优先家访清单,使ACS能够按照风险等级、空间邻近性与照护缺口顺序高效访问最急需干预的家庭,从而实现从经验驱动到数据驱动的工单分发转型。
解决学术问题
该数据集回应了初级医疗体系中资源配置不均与响应滞后的核心学术难题。传统研究往往因缺乏细粒度、多模态的社区健康数据而难以量化家庭访视优先级,该数据通过脱敏后的患者档案与事件日志,使学者能够系统评估可预防住院与急诊负担的降低机制。它解决了如何利用有限人力覆盖高密度脆弱人群的运筹学挑战,并为构建预防性而非反应性照护模式提供了实证基础,推动了公平导向的医疗资源分配理论研究。
实际应用
在实际应用中,此数据集支持开发面向里约热内卢市约6,200名社区健康工作者的智能决策辅助系统。所生成的解决方案可被集成至城市卫生平台,每日为ACS提供基于实时风险评分与空间优化的访问路线。应用成果包括缩短高危家庭获得上门服务的时间窗口(从数周压缩至数天)、提升单次巡诊中的有效家访密度,以及通过早期发现慢性病恶化或妊娠并发症,减少因延误导致的急诊涌入,最终增强整个社区卫生网络的韧性与响应效率。
数据集最近研究
最新研究方向
该数据集聚焦于通过人工智能与大数据优化巴西里约热内卢社区健康探访规划的前沿方向。在全球公共卫生体系数字化转型浪潮中,如何利用海量匿名化医疗数据提升初级保健效率成为热点。Dataset Saúde do Rio整合了患者登记、临床事件、探访记录及团队地理信息,旨在将传统依赖记忆与纸质记录的探访流程革新为风险驱动的智能排序。当前研究重点在于开发基于时空聚类与健康风险分层(如慢性病、妊娠、社会脆弱性等指标)的算法,实现每日探访名单的动态生成与路径优化。该数据集的价值在于真实模拟了医疗系统数据稀疏性与噪声环境,其匿名化技术(如坐标噪声注入与日期偏移)为隐私保护下的大规模健康数据挖掘提供了范本,有望减少可预防的急诊事件并推动社区医疗向预防性模式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务