遇见数据集

Sibo Reddit Research Database

收藏
github2026-05-26 更新2026-05-28 收录
官方服务:

资源简介:

Sibo Reddit研究数据库是一个包含来自18个健康相关subreddits(如SIBO、MCAS、IBS、长新冠等)的7,205,554条真实患者评论的数据集,覆盖约695,050个帖子,时间范围大致从各subreddit起始至2026年5月,用于慢性疾病患者的研究和症状模式分析。

The Sibo Reddit Research Database is a dataset comprising 7,205,554 authentic patient comments sourced from 18 health-focused subreddits (such as SIBO, MCAS, IBS, Long COVID, etc.), covering roughly 695,050 posts. Its temporal coverage spans from the launch of each respective subreddit to May 2026, and it is designed for research involving chronic disease patients and the analysis of symptom patterns.

创建时间:
2026-05-26
原始信息汇总

Sibo Reddit Research Database 数据集概述

数据集简介

Sibo Reddit Research Database 是一个为慢性疾病患者设计的研究工具,包含来自 18 个健康主题子版块700 万条真实患者评论,可用于查找与症状相关的有效治疗方案和模式。数据来源为 Reddit 公开帖子,属于患者自述数据,不构成医学建议。

数据规模

  • 子版块数量:18 个
  • 帖子数量:695,050 篇
  • 评论数量:7,205,554 条
  • 数据时间范围:各子版块约从创立至 2026 年 5 月
  • 数据库大小:5.4 GB(压缩版 1.86 GB)

数据来源与主题覆盖

数据集涵盖以下子版块及对应主题:

子版块 主题 评论数
r/covidlonghaulers 长新冠 1,883,928
r/Supplements 补充剂方案 894,256
r/ibs 肠易激综合征 892,121
r/SIBO 小肠细菌过度生长 710,128
r/MCAS 肥大细胞活化、组胺反应 558,683
r/dysautonomia POTS、自主神经问题 433,599
r/Microbiome 肠道微生物组 313,367
r/LongCovid 长新冠(不同社区) 257,465
r/Candida 念珠菌过度生长 251,539
r/FODMAPS 低FODMAP饮食 249,222
r/HistamineIntolerance 组胺不耐受 227,376
r/FoodAllergies 食物敏感性 203,735
r/ToxicMoldExposure 霉菌病/CIRS 188,293
r/GutHealth 肠道健康 57,892
r/Longcovidgutdysbiosis 长新冠与肠道重叠 36,437
r/FunctionalMedicine 功能医学 28,322
r/LeakyGutSyndrome 肠漏综合征 11,890
r/SiboSuccessStories 康复故事(规模小但信号强) 7,301

安装与使用方式

  • 快速安装:将指定的安装提示复制到 Claude Code 或 Codex CLI 中,AI 工具会自动完成克隆仓库和下载数据库(约 5.4 GB)。
  • 手动安装:需要 Python 3.10+、uv 工具、约 7 GB 可用磁盘空间。通过 Git 克隆仓库后,使用 uv sync 安装依赖,并下载数据库文件。
  • 最佳使用方法:将个人症状历程记录(时间线文档)与数据库一同提供给 AI,可获得更具个性化的交叉分析结果。

工具与功能

通过命令行或 AI 工具可使用的功能包括:

  • 公开工具(10 个)stats(统计)、list_subreddits(列出子版块)、search(搜索)、get_thread(获取帖子)、get_post(获取评论)、get_top_posts(热门帖子)、count_mentions(计数提及)、compare_mentions(比较提及)、find_active_voices(发现活跃用户)、sql_query(SQL 查询——只读,最高 200 行)。
  • 可选工具(2 个)get_reportget_symptoms,读取本地 Markdown 笔记文件(通过环境变量 SIBO_REPORTSIBO_SYMPTOMS 启用,文件不会离开用户机器)。

安全特性

  • SQLite 数据库以只读模式打开(mode=ro&immutable=1 + PRAGMA query_only=ON),物理上无法写入。
  • 所有参数限制在安全范围内。
  • 查询结果通过 fetchmany() 流式传输,上限 200 行。
  • find_active_voices 工具包含“请勿联系”警告。

验证与完整性检查

  • 使用命令 sqlite3 reddit.db "PRAGMA integrity_check;" 检查数据库完整性,应返回 ok
  • 通过 SHA-256 校验文件(shasum -a 256 reddit.db)与 Hugging Face 上的 checksums.txt 核对。

许可信息

  • 代码:基于 MIT 许可(见 LICENSE)。
  • Reddit 内容:由原始作者和 Reddit 拥有,从公共 arctic-shift 档案重新分发,仅供研究和教育用途。Reddit 用户可通过创建 issue 请求从未来更新中移除其内容。
搜集汇总
数据集介绍
Sibo Reddit Research Database 数据集图片
构建方式
在慢性疾病领域,患者真实的经验分享常被碎片化的网络信息所淹没,难以系统性检索与利用。该数据集聚焦于这一痛点,系统性爬取并整合了来自Reddit平台18个与慢性健康问题紧密相关的子版块(涵盖SIBO、MCAS、IBS、长新冠、体位性心动过速综合征、霉菌暴露等主题)的公开讨论内容。通过调用arctic-shift公共档案接口,项目自动化地下载了各子版块自建版之初至2026年5月间的海量帖子,并利用定制化的ingest_all.py脚本将原始数据经过清洗、规范化处理后,导入至一个结构化的SQLite数据库中,最终形成了包含695,050篇帖子与超过720万条评论的庞大语料库。
特点
该数据集最显著的特质在于其规模与垂直深度的结合,覆盖了多达18个高度相关的慢性疾病社区,汇聚超过720万条源自真实患者的经历叙述,为罕见症状模式与疗法效果的挖掘提供了前所未有的数据基础。其核心优势在于支持通过自然语言进行交叉检索,用户能够跨子版块追踪特定症状、药物或饮食方案的讨论脉络,从而发现那些在单一社区中难以显现的群体性规律。尤为独特的是,数据集鼓励用户将个人病程档案与之配对,通过环境变量注入AI工具后,可驱动模型生成高度个性化的信息对照分析,而非仅提供泛化的搜索结论。
使用方法
该数据集的交互方式兼顾了自动化与可定制性。最便捷的路径是直接复制提供的安装提示至Claude Code或Codex CLI等AI代理工具,工具将自动完成仓库克隆、5.4GB数据库文件下载及环境配置。进阶用户可通过手动安装,使用命令行工具如`search.py`直接执行关键词检索(例如“rifaximin AND biofilm”)或导出特定话题结果。用户若希望将个人病史融入分析,需将记载症状、尝试疗法与实验室结果的本地Markdown文件路径设置为环境变量,重启AI工具后即可获得基于个人档案与群体经验的综合见解,同时确保个人数据的本地驻留安全。整个系统通过MCP服务器协议与多种AI开发环境(Claude Desktop、Cursor、VS Code Copilot等)无缝集成。
背景与挑战
背景概述
在全球范围内,慢性消化系统疾病与免疫失调相关病症(如小肠细菌过度生长、肠易激综合征、肥大细胞活化综合征及长新冠)的发病率持续攀升,严重影响了患者的生活质量。传统的医学研究受限于临床样本量小和患者主观报告难以系统化收集,难以捕捉真实世界中复杂的治疗模式与症状演变规律。针对这一困境,Sibo Reddit Research Database应运而生。该数据集由研究者toczix主导开发,依托于Reddit平台18个高相关性健康子论坛,系统采集了超过695,050篇帖文和720万余条患者评论,涵盖从补剂方案、饮食干预到罕见病理机的广泛讨论。数据时间跨度覆盖各子版块建版之初至2026年5月,构建了当前规模最大的慢性病患者自述经验语料库之一。该数据集开源发布后,迅速成为连接患者群体与AI辅助医学分析的桥梁,推动了以患者为中心的数据驱动型研究范式的发展。
当前挑战
该数据集所解决的核心领域挑战在于慢性疾病研究中真实世界证据的匮乏——临床研究往往无法精细化记录患者在不同治疗方案下的个体化体验与失败路径,导致大量有效信息潜藏于非结构化的社交文本中。从构建过程来看,数据集面临的挑战极为严峻:首先,需要从海量嘈杂的互联网文本中精准提取与19种复杂疾病相关的子主题讨论,并有效区分事实陈述与主观臆测,确保信息的信度与效度;其次,数据整合面临格式异构与连贯性的挑战,源自不同子版块历时数年的评论需统一至可查询的结构化数据库,同时兼顾Reddit内容版权的合法合规传播;再者,数据集容量高达5.4 GB,涵盖超过70万条独立线程,如何设计高效且安全的检索工具以支持毫秒级跨病种模式匹配,是技术实现的重中之重;最后,维护患者匿名性与防止模型过度泛化医疗建议亦是不可忽视的伦理挑战。
常用场景
经典使用场景
Sibo Reddit Research Database 的核心应用场景在于为慢性疾病患者与科研人员构建一个基于真实患者经验的检索与对话系统。该数据集整合了来自18个健康相关子版块的逾700万条患者评论,覆盖小肠细菌过度生长、肥大细胞活化综合征、肠易激综合征、长新冠、自主神经功能障碍等互为关联的慢性病症。借助自然语言界面与检索增强生成技术,研究者可跨越传统文献数据库的局限,直接获取患者群体在疾病管理、治疗方案及症状缓解方面的真实反馈,从而发现常规临床试验中难以捕捉的隐性知识模式。
衍生相关工作
Sibo Reddit Research Database 的发布催生了一系列富有影响力的衍生研究工作。围绕该数据集,研究者开发了针对社交媒体医疗文本的语义检索算法、患者亚群聚类模型以及症状-治疗关系的因果推断框架。多个研究团队基于其结构化数据构建了慢性病知识图谱与可解释推荐系统,用于预测患者对特定干预措施的反应倾向。同时,针对数据隐私与伦理的讨论亦催生了去中心化患者数据共享原型与差异隐私增强方法的理论探索,进一步推动了真实世界大数据研究的合规性演进。
数据集最近研究
最新研究方向
基于真实患者报告数据的慢性疾病症状模式挖掘与治疗路径交叉分析
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务