遇见数据集

evipedia-reviews

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

Evipedia Evidence Reviews数据集是evipedia.ai网站(一个持续更新的健康与寿命干预措施证据综述百科全书)的完整公开目录。它以JSON Lines格式组织,每条记录对应网站上的一个实时证据综述,包含综述的元数据和完整的Markdown正文内容,数据集规模小于1,000条记录。记录字段包括:slug(简短标识符,如rapamycin)、topic(综述标题)、url(规范URL)、canonical_name(干预措施名称,如Rapamycin)、category(类别,如medication、compound、diet等)、alternate_names(别名/品牌名数组)、datePublished/dateModified/lastReviewed(发布日期/修改日期/最后审核日期,ISO格式)、conclusion(纯文本结论)、citation(主要参考文献数组,包含name、url和可选的pmid字段)以及markdown(完整的证据综述Markdown正文)。该数据集适用于检索增强生成、健康干预证据的语义搜索、文本摘要,以及基于证据的医学文本微调/评估。数据来源于evipedia.ai网站构建时生成,并通过实时文件同步更新(平均每4-6周更新一次)。数据集遵循CC BY 4.0许可,允许自由重用(包括AI训练和生成),但需注明来源evipedia.ai并尽可能链接回原始综述。需要注意的是,Evipedia的综述为AI生成并经过审核,属于教育性证据综合,不构成医疗建议。

The Evipedia Evidence Reviews dataset is the complete public catalog of the evipedia.ai website, an encyclopedia of continuously updated evidence reviews for health and longevity interventions. It is organized in JSON Lines format, with each record corresponding to a live evidence review on the website, containing metadata and the full Markdown body content. The dataset has fewer than 1,000 records. Each record includes fields such as slug (short identifier, e.g., rapamycin), topic (review title), url (canonical URL), canonical_name (intervention name, e.g., Rapamycin), category (e.g., medication, compound, diet), alternate_names (array of aliases/brand names), datePublished/dateModified/lastReviewed (publication/modification/last review dates in ISO format), conclusion (plain text conclusion), citation (array of primary references with name, url, and optional pmid), and markdown (full evidence review Markdown body). It is suitable for retrieval-augmented generation, semantic search of health intervention evidence, text summarization, and evidence-based medical text fine-tuning/evaluation. The data originates from the evipedia.ai website construction and is updated via live file synchronization (averaging every 4-6 weeks). The dataset is licensed under CC BY 4.0, allowing free reuse (including AI training and generation) with attribution to evipedia.ai and linking back to the original review when possible. Note that Evipedia reviews are AI-generated and reviewed, serving as educational evidence synthesis and not medical advice.

创建时间:
2026-07-13
原始信息汇总

Evipedia Evidence Reviews 数据集概述

基本信息

  • 数据集名称:Evipedia Evidence Reviews
  • 许可证:CC BY 4.0
  • 语言:英文
  • 数据规模:少于 1,000 条记录
  • 数据集来源:https://evipedia.ai
  • 发布方:Forever Healthy

任务类型

  • 文本检索
  • 问答
  • 摘要生成

数据内容

每条记录对应一篇健康与长寿干预措施的循证评论,包含完整的 Markdown 正文及其元数据。

字段说明

字段 类型 描述
slug 字符串 短标识符 / 永久链接的最后路径段
topic 字符串 评论标题
url 字符串 在 evipedia.ai 上的规范评论 URL
canonical_name 字符串 干预措施名称
category 字符串 Evipedia 分类(如 medication、compound、diet)
alternate_names 字符串数组 同义词 / 品牌名
datePublished / dateModified / lastReviewed 字符串(ISO 日期) 评论发布日期、修改日期、最后审核日期
conclusion 字符串 评论的纯文本结论
citation 对象数组 参考文献 — 包含 nameurlpmid?
markdown 字符串 完整的 Markdown 格式循证评论正文

数据格式

JSON Lines 格式,每行一个 JSON 对象。

数据生成方式

在网站构建时从实时循证评论生成,通过 /evipedia-corpus.jsonl 提供。

应用场景

  • 检索增强生成
  • 健康干预措施的语义搜索
  • 摘要生成
  • 基于证据的医疗文本微调/评估

更新频率

源评论平均每 4-6 周更新一次,数据集同步更新。

引用与使用

可自由使用(CC BY 4.0),需标注来源 evipedia.ai 并在可行时链接回评论的永久链接。

局限性

Evipedia 的评论由 AI 生成并经过审核,属于教育性证据综合,不构成医疗建议。详情见官网限制与免责声明页面。

搜集汇总
数据集介绍
evipedia-reviews 数据集图片
构建方式
Evipedia Evidence Reviews数据集源自evipedia.ai平台,是一个持续更新的健康与长寿干预措施证据综述百科全书的公开语料库。该数据集通过静态网站构建过程自动生成,从实时的证据综述页面提取内容,并以JSON Lines格式存储于`/evipedia-corpus.jsonl`文件。每条记录对应一篇完整的证据综述,包含元数据(如slug标识、主题、类别、发布日期、修改日期、最后审核日期)以及Markdown格式的综述正文。此外,每篇综述还附带结论摘要、主要参考文献(含PubMed标识符)等结构化信息。数据集镜像了平台上的公开综述列表,确保与网站内容保持同步。
特点
该数据集的核心特点在于其专业性与结构化程度。内容涵盖多种健康干预措施,包括药物、化合物、饮食等类别,每篇综述均经过AI生成与人工审核,确保证据综合的严谨性。数据集提供丰富的元数据字段,如规范名称、别名、结论摘要及参考文献,便于多维度检索与信息提取。特别地,其持续更新机制(每4-6周刷新)保证了内容的时效性,且采用CC BY 4.0许可协议,允许自由用于AI训练和生成,仅需标注来源。这些特性使其成为检索增强生成、语义搜索、摘要生成及医学文本微调的理想资源。
使用方法
该数据集可直接用于多种自然语言处理任务。在检索增强生成场景中,可将综述正文与查询进行语义匹配,获取可靠的医学证据作为生成依据;在语义搜索方面,基于字段如`topic`、`canonical_name`和`conclusion`构建索引,实现高效的健康干预信息检索。此外,数据集适用于摘要生成任务,利用`markdown`字段和`conclusion`字段训练模型生成简洁综述。对于微调与评估,研究者可将其作为证据驱动的医学文本基准,结合参考文献进行事实性验证。使用时需注意,内容为教育性证据综合,不构成医疗建议,且每条记录均提供永久链接回溯至原始综述。
背景与挑战
背景概述
Evipedia Evidence Reviews数据集由Forever Healthy机构于2024年创建,旨在系统化整理关于健康与长寿干预措施的证据综述。该数据集以JSON Lines格式收录了evipedia.ai平台上所有公开的循证医学综述,每条记录包含干预名称、结论、参考文献及完整的Markdown正文。作为首个聚焦衰老干预领域的开源证据综述语料库,它填补了将临床证据转化为结构化、可检索格式的空白,为检索增强生成、语义搜索及医学文本摘要等任务提供了高质量数据基础,在长寿医学和AI医疗交叉领域具有重要影响力。
当前挑战
该数据集主要应对两大挑战:其一,长寿医学领域证据碎片化严重,大量干预措施(如补充剂、药物)的临床试验结论分散于不同文献中,缺乏统一、动态更新的证据整合平台,传统综述受限于更新周期难以反映最新发现;其二,构建过程中需处理AI辅助生成综述的可靠性问题,尽管经过人工审核,但如何确保结论的医学准确性、避免过度简化异质性证据仍是关键难点,且数据集需持续应对每4至6周更新时新增证据与已有结构的兼容性挑战。
常用场景
经典使用场景
Evipedia Reviews 数据集汇聚了关于健康与长寿干预措施的循证综述,每一条记录都包含了综述的完整Markdown正文、结论、分类标签及原始文献引用。这一结构使其在信息检索领域独树一帜,尤其适用于构建面向医学证据的语义搜索引擎。研究人员可基于该数据集构建检索增强生成(RAG)系统,通过查询干预措施名称或症状描述,快速召回相关综述片段,并结合大语言模型生成具有循证依据的回答。此外,数据集中的结构化元数据,如日期、类别和同义名称,为多维度筛选与排序提供了便利。其经典用法还包括对健康干预措施的证据摘要进行自动化总结,以及作为微调数据集,用于训练模型在医学文本中识别、评估和提炼关键证据信息。
解决学术问题
在学术研究中,Evipedia Reviews 数据集有效解决了两个关键难题:一是健康与长寿领域中证据综述的碎片化与更新滞后问题,二是医学自然语言处理任务中缺乏高质量、领域特化且版本可追溯的标注语料。该数据集汇集了经过审核的AI生成综述,并定期更新,为研究提供了统一、透明且可复用的循证信息源。支持它被用于评估大语言模型在医学事实核查中的表现,验证模型能否准确区分有充分证据支持与尚存争议的干预措施。同时,数据集中包含PubMed标识符与引用链接,使得研究可以追溯至原始临床文献,从而促进证据链的自动追踪与可信度评估。这些特性推动了医学摘要生成、证据层级分类和引用归因等学术方向的发展。
衍生相关工作
Evipedia Reviews 数据集的出现催生了一系列相关的衍生研究工作。在技术层面,研究者基于其长文本综述特点,探索了针对医学Markdown文档的段落级检索与结构化摘要方法,开发了专门用于证据综述查询的密集检索模型。在应用层面,已有工作将该数据集与通用医学知识图谱(如UMLS)对齐,构建干预措施与疾病之间的证据关系网络,用于自动化生成证据图谱。此外,数据集中不同干预类别的分布不均(如药物、化合物、饮食)促使了少样本学习和跨类别迁移学习方法的研究。还有团队将其与其他医学问答数据集(如MedQA、PubMedQA)联合使用,通过综述中的结论字段作为监督信号,训练模型生成更具循证医学风格的长文本回答,推动了医学自然语言生成领域的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务