遇见数据集

awesome-replicability-data

收藏
github2026-05-28 更新2026-06-04 收录
官方服务:

资源简介:

该仓库是一个精心策划的公开数据集合集,专门用于可重复性分析。它收集了多站点个体级可重复性研究、原始研究与可重复性研究的配对个体级数据集,以及可重复性研究的单侧配对数据集。合集涵盖成功和失败的研究,并包括处理脚本和相关工具,主题领域涉及科学可重复性、分布偏移和效应泛化。

This repository is a curated collection of public datasets specifically designed for reproducibility analysis. It collects individual-level datasets from multi-site reproducibility studies, paired individual-level datasets of original and reproducibility studies, and one-sided paired datasets for reproducibility studies. The collection covers both successful and failed studies, and includes processing scripts and related tools, with its thematic areas covering scientific reproducibility, distribution shift, and effect generalization.

创建时间:
2023-03-30
原始信息汇总

数据集概述

该仓库汇集了用于可重复性分析的公开数据集,专注于多站点个体层面复制研究原始研究与复制研究的配对个体层面数据集,以及仅包含复制研究个体层面数据的单侧配对。数据集收集不具选择性,只要可用,成功和失败的研究均包含在内。

数据集分类

数据集分为三大类:

  1. 多站点、多假设复制数据集

    • Pipeline 项目数据集: 由 25 个实验室复制 10 个关于道德判断效应的实验。关注平均处理效应的可重复性。
    • ManyLabs1 数据集: 由 36 个实验室复制心理学中的 13 个实验,共有超过 6000 名参与者。关注平均处理效应的可重复性。
  2. 完整的配对数据集

    • 涉及原始研究和复制研究均公开个体层面数据的 11 个研究对,例如:
      • 新冠疫情信息研究: 探究“助推”思考信息真实性对分享新冠新闻时真伪辨别能力的影响。
      • 共情与社会经济地位 (SES) 研究: 研究诱发共情对不同社会经济地位个体功利主义道德判断的影响。
      • 眼动脱敏与再加工 (EMDR) 与错误信息研究: 研究眼动对错误记忆易感性的影响。
      • 自我中心性与身心实践研究: 研究身心实践(如瑜伽、冥想)是否提高自我增强。
      • 排队设计与服务时间研究: 研究排队设计对服务系统工作人员生产力的影响。
      • 多实验室厌恶与道德判断研究: 研究味觉厌恶对道德判断的影响。
      • 疼痛与合作研究: 研究分享痛苦经历对群体间合作的影响。
      • 清洁与道德判断研究: 研究环境清洁度对道德判断的影响。
      • 谎言与外语研究: 研究使用外语对说谎行为的影响。
      • 多实验室自我损耗研究: 关于自我损耗效应的复制。
      • 诚实与时间压力研究: 研究时间压力对诚实行为的影响。
  3. 单侧数据集

    • 包含 4 个原始研究仅提供摘要统计,而复制研究提供个体层面数据的研究对,例如:
      • 气候变化错误信息研究
      • 疼痛耐受隐喻研究
      • 身体不满研究
      • 启动与锻炼研究

相关资源

  • 复现代码: 在单独的 GitHub 仓库 predictive-shift 中提供。
  • R 包: repDiagnosis R 包提供统计工具,用于估计配对复制研究中可观察分布转移的贡献。
  • 交互式诊断应用: 提供在线 R Shiny 应用,可在 在线 R Shiny 应用 中体验。
  • 示例诊断报告: 在 analysis.html 中提供了其他配对研究的分析报告。
搜集汇总
数据集介绍
awesome-replicability-data 数据集图片
构建方式
该数据集旨在为可重复性分析提供公开可用的个体层面数据,其构建方式遵循非选择性原则,广泛收录了多站点个体层面的重复研究、原始研究与重复研究配对的个体层面数据集,以及仅包含重复研究个体层面数据但原始研究提供丰富摘要统计的单侧数据集。数据来源涵盖心理学、管理学等多个领域的已发表研究,通过系统检索公开数据仓库(如OSF)和论文补充材料进行采集,并配以标准化的数据处理脚本,以确保数据的一致性和可复现性。
特点
该数据集的核心特点在于其包容性与结构化。它不仅纳入了成功与失败的重复研究,避免了选择性偏差,还通过清晰的分类体系(多站点多假设研究、完整配对研究、单侧研究)组织数据,便于用户根据研究需求灵活选用。每个数据集均包含详细的背景说明、样本量、变量定义及原始结果摘要,为用户提供了丰富的元信息。此外,部分数据集已预加载至配套的R包和交互式分析工具中,显著降低了使用门槛。
使用方法
用户可通过GitHub仓库直接访问并下载经过清洗的数据文件,或利用配套的R包‘repDiagnosis’加载配对数据集(如Covid信息研究、共情与SES研究、EMDR与错误记忆研究)进行分布偏移诊断。对于多站点研究,仓库提供了分析流程示例(如analysis.html)以指导用户进行效应估计和异质性探索。用户亦可结合在线Shiny应用,无需编程即可交互式地探索预加载数据集或上传自己的重复研究数据,从而评估结果的可推广性。
背景与挑战
背景概述
在科学研究的生态系统中,复制性研究扮演着验证与巩固知识基石的关键角色。然而,近年来心理学、经济学等领域的复制危机凸显了原始结果可复现性的严峻挑战,促使学界系统性地审视研究结果在不同情境下的稳健性。在此背景下,由Ying Jin、Kevin Guo及Dominik Rothenhäusler等研究人员于2023年创建的awesome-replicability-data数据集应运而生。该数据集由哈佛大学等机构主导,核心使命是系统性地收集并整理多站点、成对及单侧复制研究的个体层面数据,为量化分析复制研究中观测到的分布偏移及其对效应量泛化的影响提供了宝贵资源。其影响力在于,它不仅为非选择性收录成功与失败的复制研究设立了新标准,还直接支撑了《Diagnosing the role of observable distribution shift in scientific replications》等前沿论文,推动了复制性分析从定性讨论向定量诊断的范式转变。
当前挑战
该数据集所面临的挑战首先体现在其核心领域问题上:如何精准量化可观测分布偏移(如协变量差异、中介路径变化)在解释复制研究失败中的具体贡献,这要求超越传统的元分析方法,发展能剥离混杂因素的统计诊断工具。其次,在构建过程中,数据整合面临显著障碍,包括不同原始研究间变量命名与编码的不一致(如抑郁量表从BDI到BDI-II的变迁)、样本量的巨大差异(如从91人到1583人),以及部分研究仅提供摘要统计量而非完整个体数据,迫使团队开发处理脚本以统一格式。此外,多站点研究中实验协议的执行偏差、参与者群体的异质性,以及如何平衡数据公开性与隐私保护,均构成了数据标准化与质量控制的重大挑战。
常用场景
经典使用场景
在心理学与行为科学领域,该数据集的核心应用场景在于系统性地评估科学研究的可重复性。通过汇集多站点、配对及单侧复制研究中的个体层面数据,研究者能够对原始实验与复制实验之间的效应量差异进行量化比较。例如,利用Pipeline项目与ManyLabs1项目的数据,可以分析不同实验室在相同实验协议下产生的效应变异,从而揭示看似一致的实验设计背后可能隐藏的分布偏移。这为理解科学发现的可复制边界提供了实证基础。
衍生相关工作
基于该数据集,衍生出了一系列推动可重复性科学方法论的经典工作。Jin等人(2023)提出了诊断观测分布偏移在科学复制中作用的统计框架,并开发了repDiagnosis R包,实现了对配对复制研究中协变量差异与中介偏移的估计。后续工作(Jin等,2024)进一步拓展至效应泛化预测,提出了超越重加权的协变量偏移分析方法。此外,在线Shiny应用使得非统计专业的研究者也能交互式地诊断自身研究的可复制性,降低了方法学的使用门槛。
数据集最近研究
最新研究方向
在科学可重复性危机持续引发广泛关注的背景下,awesome-replicability-data数据集聚焦于通过多站点、个体层面的复制研究数据,系统剖析观测分布偏移在科学复制中的关键作用。该领域的前沿研究正从传统的单一复制验证转向对复制失败原因的诊断性分析,尤其是利用大型多假设复制项目(如Pipeline项目和ManyLabs 1项目)来量化协变量差异、中介偏移等分布因素对效应泛化的预测性影响。近期热点事件包括心理学、医学等领域大规模复制计划的推进,以及统计方法学上从单纯重加权到预测性偏移分析的范式转变。该数据集通过整合成功与失败的复制研究,为理解科学发现的稳健性提供了实证基础,推动了对研究结果泛化条件的理论深化,其意义在于促进跨学科合作与透明化科学实践的落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务