遇见数据集

sibo-research-db

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

SIBO Research DB 是一个专注于慢性健康问题的 Reddit 公开内容数据集,旨在为 AI 辅助的研究和对话式查询提供支持。该数据集汇集了来自 18 个特定健康主题 Reddit 社区(子版块)的讨论,涵盖小肠细菌过度生长(SIBO)、肠易激综合征(IBS)、肥大细胞激活综合征(MCAS)、长新冠(Long COVID)、微生物组(Microbiome)等多种慢性疾病和健康话题。数据集包含总计约 69.5 万条帖子和 720.5 万条评论,数据规模在百万到千万级别。数据以 SQLite 数据库文件形式提供,预置了全文搜索索引,便于直接查询。数据库结构清晰,包含 `posts`(帖子)和 `comments`(评论)两个主表,记录了发帖人、所属子版块、标题/正文、得分、创建时间、永久链接等丰富字段。该数据集特别设计用于与 AI 工具(如 Claude Code、Cursor 等)结合,允许用户以自然语言对话的方式,在海量患者自述的经验中寻找与自身症状相似的模式、尝试过的治疗方案或补充剂信息。需要强调的是,数据集内容均为患者自我报告的经验分享,并非临床医疗数据或医疗建议。其主要用途是帮助用户发现值得与专业医疗人员进一步探讨的线索和模式,而非用于自我诊断或治疗。数据集适用于文本检索、信息提取、患者报告结果分析以及基于真实世界经验的健康问答等研究场景。

SIBO Research DB is a public Reddit content dataset focused on chronic health issues, designed to support AI-assisted research and conversational queries. It aggregates discussions from 18 specific health-themed Reddit communities (subreddits), covering various chronic diseases and health topics such as Small Intestinal Bacterial Overgrowth (SIBO), Irritable Bowel Syndrome (IBS), Mast Cell Activation Syndrome (MCAS), Long COVID, and Microbiome. The dataset includes approximately 695,000 posts and 7.205 million comments, with a data scale in the millions to tens of millions range. Data is provided in SQLite database format with pre-built full-text search indexes for easy querying. The database has a clear structure, containing two main tables: `posts` and `comments`, which record rich fields such as author, subreddit, title/body, score, creation time, and permalink. The dataset is specifically designed for integration with AI tools (e.g., Claude Code, Cursor), allowing users to search through vast amounts of patient-reported experiences using natural language conversations to find patterns similar to their own symptoms, tried treatments, or supplement information. It is emphasized that the dataset content consists of patient self-reported experiences and is not clinical medical data or medical advice. Its primary purpose is to help users identify clues and patterns worth further discussion with healthcare professionals, rather than for self-diagnosis or treatment. The dataset is suitable for research scenarios such as text retrieval, information extraction, patient-reported outcome analysis, and health question-answering based on real-world experiences.

创建时间:
2026-05-26
原始信息汇总

数据集概述

该数据集名为 SIBO Research DB(SIBO Reddit Research Database),是一个专注于慢性疾病患者社群公开Reddit内容的SQLite数据库,旨在支持通过AI工具进行对话式查询,以发现症状相关的模式和治疗线索。

数据集分类与许可

  • 许可协议: MIT License
  • 任务类别: 文本检索、问答
  • 语言: 英语
  • 数据集规模: 1,000,000 ~ 10,000,000 条记录(约700万条评论)
  • 标签: reddit、健康、SIBO、MCAS、IBS、长新冠、微生物组、患者报告结局

数据来源与构成

  • 来源: 从公共Reddit存档 arctic-shift 抓取。
  • 子版块与数据量:
子版块 主题 评论数
r/covidlonghaulers 长新冠 1,883,928
r/Supplements 补充剂方案 894,256
r/ibs 肠易激综合征 892,121
r/SIBO 小肠细菌过度生长 710,128
r/MCAS 肥大细胞活化 558,683
r/dysautonomia POTS/自主神经紊乱 433,599
r/Microbiome 肠道微生物组 313,367
r/LongCovid 长新冠(备选社区) 257,465
r/Candida 念珠菌过度生长 251,539
r/FODMAPS 低FODMAP饮食 249,222
r/HistamineIntolerance 组胺不耐受 227,376
r/FoodAllergies 食物过敏 203,735
r/ToxicMoldExposure 霉菌病 188,293
r/GutHealth 肠道健康(综合) 57,892
r/Longcovidgutdysbiosis 长新冠+肠道重叠 36,437
r/FunctionalMedicine 功能医学 28,322
r/LeakyGutSyndrome 肠漏综合征 11,890
r/SiboSuccessStories 康复故事 7,301
  • 总量: 18个子版块,共695,050篇帖子,7,205,554条评论。
  • 时间覆盖: 大致从各子版块创建至2026年5月(r/ibs和r/Supplements限于2021年之后)。

文件与大小

文件 大小 说明
reddit.db 5.4 GB SQLite数据库,包含全文搜索索引,可直接使用。
reddit.db.zst 1.86 GB 同上数据库的压缩版本(比原文件小66%),需用zstd解压。
checksums.txt 530 B 上述两个文件的SHA-256校验值。

用户只需选择上述文件之一。

数据库结构与使用方法

  • 数据库类型: SQLite,包含FTS5全文搜索虚拟表。
  • 表结构:
    • posts 表: 字段包括 id, subreddit, author, title, selftext, score, num_comments, created_utc, permalink, link_flair_text, domain, is_self。
    • comments 表: 字段包括 id, subreddit, author, body, score, created_utc, link_id, parent_id, permalink。
  • 全文搜索: 通过 posts_fts(title, selftext)comments_fts(body) 实现。
  • 查询示例: 可使用Python的sqlite3模块直接进行SQL查询,例如查询与“prucalopride”和“tolerance”相关的评论。

安装与使用建议

  • 快速安装: 将GitHub仓库和Hugging Face数据集链接提供给Claude Code或Codex CLI等AI工具,工具会自动下载并安装5.4 GB数据库。
  • 最佳实践: 建议用户将个人医疗时间线文档与数据集一同提供给AI工具,以获得针对性分析,而非通用建议。GitHub仓库提供个人时间线模板。
  • 非AI使用: 可直接通过SQLite客户端查询数据库。

验证方法

下载后可使用以下命令验证数据完整性:

  • sqlite3 reddit.db "PRAGMA integrity_check;" 应输出 “ok”。
  • sqlite3 reddit.db "SELECT COUNT(*) FROM posts; SELECT COUNT(*) FROM comments;" 检查记录数。
  • shasum -a 256 reddit.db 并与 checksums.txt 对比。

重要声明

  • 非医疗建议: 该数据集基于患者自我报告的数据,非临床证据,仅用于发现模式和线索,不应作为诊断或治疗依据。
  • 版权声明: Reddit内容归原作者和Reddit所有,数据来自公共存档 arctic-shift,用于研究和教育目的。GitHub仓库中的代码采用MIT许可。
搜集汇总
数据集介绍
sibo-research-db 数据集图片
构建方式
该数据集源自公共Reddit存档arctic-shift,从中精准提取了18个与慢性疾病高度相关的子版块,覆盖从SIBO、IBS到长新冠、肥大细胞活化等多样主题。通过精心设计的抓取与注入脚本,将逾69万篇帖子和超过720万条评论系统化整合进一个统一的SQLite数据库中。数据库内建了基于FTS5引擎的全文搜索索引,分别针对帖子的标题与正文以及评论内容进行了优化,使其既能被AI工具以对话方式调用,也支持传统的结构化查询。
特点
本数据集的核心优势在于其庞大的规模与精准的垂直领域聚焦:包含了从病症讨论到康复故事的数百万条真实患者报告,为循证探索提供了丰富的非临床证据。数据跨越多个高度相关且常被学术研究忽视的罕见病与功能性疾病社区,覆盖时间跨度直至2026年。尤其值得瞩目的是,其设计鼓励将数据库与用户的个人医疗时间线进行关联分析,通过交叉比对数百万病例中的模式,生成高度个性化的洞察,而非泛泛的通用建议。
使用方法
使用者可借助Claude、Cursor等前沿AI工具,通过自然语言直接与数据库进行交互式问答。安装过程仅需三步:将GitHub与HuggingFace链接提供给AI,即可自动完成下载与配置。更进阶的使用方式是创建一份个人症状与治疗历史记录,通过环境变量使其与数据库一同被AI访问,从而获得针对个人病程的深度分析与建议。此外,该数据库亦支持直接以Python的sqlite3库进行编程式查询,利用内置的全文检索功能快速定位包含特定关键词的讨论,并可运行完整性检查以确保数据质量。
背景与挑战
背景概述
在慢性消化系统疾病与功能性肠病的研究领域,患者自我报告的真实世界数据对于揭示疾病异质性、评估干预措施有效性具有不可替代的价值,然而传统临床研究往往难以大规模获取此类非结构化、未经筛选的经验信息。为此,研究者toczix于2025年前后构建了SIBO Research DB(sibo-research-db),这是一个聚焦于小肠细菌过度生长(SIBO)、肠易激综合征(IBS)、肥大细胞激活综合征(MCAS)及长新冠(Long COVID)等慢性病社群的大规模Reddit文本数据库。该数据集从18个健康相关子版块中收集了逾695,000篇帖子和720万条评论,时间跨度涵盖各子版块建站之初至2026年5月,旨在为AI驱动的对话式检索与分析提供结构化基础。通过将分布在全球患者社群中的隐性知识转化为可查询的语料库,该项目显著拓宽了真实世界证据在功能性胃肠病与免疫失调交叉领域的研究边界。
当前挑战
该数据集的核心挑战在于应对多系统慢性疾病研究中的患者报告数据异质性与偏倚控制难题。具体而言,领域问题方面,SIBO及相关病症(如长新冠、组织胺不耐受)的病理机制复杂、症状非特异,患者主观描述的疗效与副作用信息混杂着个体差异、回忆偏倚及共病干扰,难以直接转化为可推广的临床结论,需要严谨的自然语言处理与主题建模策略才能提炼有效信号。构建过程中的挑战同样突出:从公开Reddit归档中抓取7百万条评论需处理数据污染(如广告、机器人发言)、去标识化伦理合规、跨子版块文本格式不一致以及大规模SQLite库的全文索引性能优化,此外还需在5.4 GB数据库内维持FTS5虚拟表的高效检索以支持实时问答,这对存储与查询效率提出了苛刻要求。
常用场景
经典使用场景
在慢性疾病与功能性胃肠病的交叉研究领域,sibo-research-db数据集以其独特的患者报告内容为核心,成为探索症状模式与治疗反馈的宝贵资源。该数据集汇聚了来自18个健康子论坛的超过700万条真实患者评论,覆盖了小肠细菌过度生长(SIBO)、肠易激综合征(IBS)、肥大细胞活化综合征(MCAS)、长新冠(Long COVID)以及肠道微生物组等广泛议题。最经典的使用场景是通过自然语言查询接口与数据库进行交互式对话,研究者可定向挖掘某一症状或治疗方案的集体经验。例如,输入特定药物名称如‘利福昔明’,即可快速检索到数千条相关患者的亲身描述,揭示其疗效、副作用及复发模式,这种模式极大提升了定性研究的效率与广度。
衍生相关工作
sibo-research-db的推出催生了若干富有影响力的衍生工作。数据集本身也常被用作文本检索与问答系统的评测基准,尤其在医学领域的弱监督训练中。一些研究者基于此数据开发了专用的症状语义表征模型,用于从患者叙述中自动提取关键临床表型。此外,该数据库支持了多项关于慢性病社交媒体言语模式分析的探索。受其启发,另一个关注度较高的方向是构建‘患者-药物-症状’的三元组知识图谱,以增强临床推理的可解释性。通过将数亿级别的文本特征与药物数据库、蛋白质相互作用网络进行对齐,这些衍生工作拓展了真实世界数据在精准医学中的深层应用。
数据集最近研究
最新研究方向
该数据集聚焦于慢性疾病(如SIBO、IBS、长新冠、MCAS等)患者在Reddit社区中的真实经验文本挖掘与对话式检索,代表了患者报告结局数据在AI辅助医疗决策中的前沿应用。通过整合逾七百万条评论与近七十万篇帖子,研究者得以利用自然语言处理和语义检索技术,从海量非结构化叙事中提取症状模式、治疗响应趋势及药物耐受性规律。这一方向呼应了精准医学时代对真实世界证据的迫切需求,打破了传统临床研究的数据壁垒,为探索复杂疾病(尤其是功能性胃肠病与免疫失调重叠综合征)的个性化干预策略提供了前所未有的数据基础。其核心影响在于将分散的、患者驱动的知识系统化,赋能临床工作者与研究者识别临床指南之外的有效疗法信号,从而加速假设生成与转化研究进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务