遇见数据集

Next Steps Core dataset

收藏
arXiv2026-07-24 更新2026-07-27 收录
数据链接:
官方服务:

资源简介:

Next Steps Core数据集是由伦敦大学学院纵向研究中心创建的纵向队列研究数据集,旨在为健康和社会科学研究提供经过清洗、可直接用于分析的标准化数据。该数据集源自英国'Next Steps'纵向研究,涵盖从14岁至32岁多个波次的调查数据,包含102个衍生变量,涉及人口统计、教育、健康和社会经济等多个领域,数据经过专业研究人员处理并独立验证。数据集通过整合多波次原始调查变量构建而成,采用'宽格式'存储,既包含随时间变化的动态指标,也涵盖固定特征。该数据集主要用于评估大型语言模型在敏感数据治理受限环境下的数据准备能力,为解决纵向研究中的数据清洗、变量构建和多数据集合并等瓶颈问题提供基准测试框架。

The Next Steps Core Dataset is a longitudinal cohort study dataset developed by the Centre for Longitudinal Studies, University College London, designed to provide cleaned, analysis-ready standardized data for health and social science research. Derived from the UK's 'Next Steps' longitudinal study, this dataset covers multi-wave survey data collected from participants aged 14 to 32, and includes 102 derived variables spanning demographics, education, health, socioeconomics and other domains. The data has been processed and independently validated by professional researchers. Constructed by integrating multi-wave original survey variables, the dataset is stored in 'wide format', incorporating both time-varying dynamic indicators and fixed participant characteristics. This dataset is primarily intended to evaluate the data preparation capabilities of Large Language Models (LLMs) in environments with restricted sensitive data governance, and provides a benchmark framework for addressing bottleneck issues in longitudinal research such as data cleaning, variable construction, and multi-dataset merging.

创建时间:
2026-07-24
原始信息汇总

数据集名称

Next Steps Longitudinal Dataset(纵向追踪数据集)

数据集概览

  • 提供机构:伦敦大学学院纵向研究中心(Centre for Longitudinal Studies, UCL)
  • 当前状态:工作进展中(Work in Progress)
  • 核心目的:通过R脚本将Next Steps研究的多轮次数据整合为一个清洗后的单一数据集,方便研究者直接开展分析,无需重复编码。

变量域及示例

变量域 示例变量
人口学信息 性别、民族、语言、性取向、伴侣关系、所在地区
教育 学历、父母学历
社会经济 个人经济活动状况、父母经济活动状况、个人社会经济分类(NSSEC)、父母社会经济分类(NSSEC)、住房所有权、家庭收入、多重剥夺指数(IMD)
身心健康 心理困扰、生活满意度、自残、焦虑、抑郁、孤独感、长期疾病、自评健康
人体测量 体重、身高、身体质量指数(BMI)
行为 吸烟、饮酒、药物使用、锻炼、缺课、与警方接触、遭受欺凌

数据来源

  • 原始数据集可通过英国数据服务(UK Data Service)下载(Next Steps系列,ID: 2000030)。
  • 本仓库衍生的变量数据集完成后将另行存放。

使用方式

  1. 准备原始数据:从UK Data Service下载Next Steps研究(Study 5545,最终用户许可版本)的Stata格式(.dta)文件,解压后将文件夹或文件放置于 data/UKDA-5545-stata/.../safeguarded_eul/ 路径下。
  2. 运行完整流程:在项目根目录运行 build-core-dataset.R 脚本,即可生成衍生数据集并输出至 data/derived/ 文件夹。
  3. 查看特定变量:可单独查看 R/ 文件夹下的领域脚本(如 R/02-education.R 对应教育变量),但运行前需先执行 R/00-load-raw-data.R 加载原始数据。

版本控制

  • 代码基于 R v4.5.2 运行,R包版本通过 renv 管理。
  • 若需以相同包版本重现代码,需先安装 renv 包,并在项目根目录运行 renv::restore()

仓库结构

. ├── build-core-dataset.R # 主脚本:从原始数据生成衍生数据集 ├── R/ # 领域专用脚本,由主脚本调用 │ ├── 00-load-raw-data.R # 加载原始.dta文件 │ ├── 01-demographic.R │ ├── 02-education.R │ ├── 03-socioeconomic.R │ ├── 04-health.R │ ├── 05-anthropometric.R │ ├── 06-behaviour.R │ └── helpers.R # 共享的重新编码辅助函数 ├── data/ │ ├── UKDA-5545-stata/.../safeguarded_eul/ # 放置原始.dta文件 │ └── derived/ # 输出衍生数据集 ├── renv.lock # R包版本锁定文件 └── .Rprofile # 会话启动时自动激活renv

许可与反馈

  • 代码许可:MIT许可(详见仓库中的 LICENSE 文件)。
  • 数据许可:衍生数据集使用仍需遵守Next Steps的最终用户许可条款。
  • 反馈与未来计划:欢迎用户反馈,计划在未来版本中扩展数据集。联系邮箱:clsdata@ucl.ac.uk。
搜集汇总
数据集介绍
Next Steps Core dataset 数据集图片
构建方式
在定量健康与社会科学领域,数据准备工作常因重复性劳动成为研究瓶颈。为应对这一挑战,Next Steps Core dataset基于英国纵向队列研究Next Steps构建,由经验丰富的研究人员手工清洗并经过独立代码审查,形成了包含六轮调查数据的“宽格式”研究就绪数据集。研究者从该数据集中提取了20个典型的数据准备任务,每个任务均包括输入数据文件、JSON格式元数据、自然语言提示以及由人工生成的标准答案脚本与输出数据集,为评估大语言模型在纵向数据准备中的表现提供了可靠的基准。
使用方法
研究者可通过开源框架RRBench(https://github.com/UCL-ARC/RRBench)使用该数据集。使用时,大语言模型以AI代理形式接收任务提示与元数据,在本地封闭环境中自主生成并执行R脚本,最终产出清洗后的数据集。评估过程通过自动化Python流程将生成数据与标准答案进行逐单元格比对,计算完整性与正确性指标,并支持下游回归分析验证。该框架设计为可移植结构,支持研究者根据自身数据与任务需求进行适配,尤其适用于受数据治理限制的研究环境。
背景与挑战
背景概述
Next Steps Core数据集由英国伦敦大学学院(UCL)的纵向研究中心(Centre for Longitudinal Studies)与高级研究计算中心(Centre for Advanced Research Computing)的研究人员于2026年前后创建,旨在为纵向队列研究中的数据处理瓶颈提供标准化基准。该数据集源自英国Next Steps纵向研究,涵盖了从14岁至32岁多波次的调查数据,经过经验丰富的研究者精心清洗与独立代码复核,形成了可复现的‘金标准’数据集。其核心研究问题在于评估开源权重的大语言模型在本地无云端依赖的环境下,能否自动完成包括类别统一、多波合并等复杂的数据准备任务。该数据集与配套的RRBench框架一同发布,填补了现有软件工程基准(如HumanEval)在纵向健康与社会科学数据专用领域测评的空白,对推动隐私约束下的AI辅助研究具有重要的示范意义。
当前挑战
该数据集所解决的领域挑战主要源于纵向调查数据准备过程的复杂性与人为错误的普遍性。传统上,研究者需耗费大量时间进行变量查找、编码重映射、缺失值处理及跨波次数据集合并,此类工作重复性高且易出错,已有研究发现经济学与政治学期刊中四分之一的论文存在编码错误。在构建过程中,研究者面临的核心挑战包括:需精确解析带有特定编码框架的调查元数据,处理跨波次分类体系不一致问题(如就业状态的统一),以及构建如BMI等复合指标时需严格遵守领域定义。此外,在仅依赖本地硬件的前提下,模型需平衡参数规模与推理性能,部分轻量级模型因无法稳定输出符合工具调用格式的响应而完全失败,而较优模型在处理依赖特定调查元数据的复杂任务(如住房产权、家庭收入)时仍显不足,这突显了在数据隐私与计算资源双重约束下实现高保真自动化的艰巨性。
常用场景
经典使用场景
在量化健康与社会科学领域,纵向队列研究的数据准备是一个公认的瓶颈环节,涉及变量查找、类别统一、多波次合并、派生指标构建等高度重复且易出错的任务。Next Steps Core dataset正是为此而生,它作为经过资深研究者精心清洗、并以独立代码评审验证的‘金标准’数据集,为评估大语言模型在真实纵向数据准备任务中的自动化能力提供了权威的基准。该数据集源自英国Next Steps队列研究,涵盖从人口学、教育、健康到社会经济地位等多领域的变量,其经典使用场景是作为评估AI智能体在无需人类干预的情况下,能否自主理解元数据、编写并执行R代码、完成从原始调查数据到研究就绪格式的完整转化。
解决学术问题
该数据集的核心贡献在于填补了现有基准测试(如SWE-bench、HumanEval)在领域专精能力评估上的空白,解决了两个关键学术问题:一是缺乏针对纵向健康与社会调查数据准备(尤其是R语言环境)的标准化评测框架;二是缺乏衡量本地化部署的开源大语言模型在数据治理受限场景下实际效能的工具。通过提供包含20个不同复杂度任务(如跨波次元数据整合、分类体系压缩、多层派生逻辑推导)的评测体系,该数据集使研究者能够量化模型在理解特定调查元数据、避免‘静默错误’(看似合理但实质错误的数据转换)上的真实能力,从而为安全环境下AI辅助数据准备的可行性与局限性提供了实证基础。
实际应用
在实际应用中,Next Steps Core dataset的核心价值在于为数据治理严格的科研环境提供了AI辅助数据准备的技术验证方案。例如,在可信研究环境或本地化部署场景中,研究人员可以利用该数据集的评测框架,测试不同规模的开源模型(如运行于消费级硬件的Qwen、Gemma系列)能否在不将敏感个体数据传输至外部云服务的前提下,完成复杂的变量派生与数据清洗任务。这直接服务于流行病学、社会统计学等领域的日常数据分析流程,有望将研究者从大量重复性的数据厨余工作中解放出来,将精力重新投入到更富创造性的多队列比较或跨学科分析中。同时,该框架也为机构投资本地化计算基础设施(如支持大参数量模型运行的GPU)提供了可量化的绩效参考。
数据集最近研究
最新研究方向
当前,Next Steps Core数据集在人工智能辅助纵向数据预处理领域的前沿研究中扮演着关键角色。该数据集作为一项经过严格人工审核与验证的地面真值基准,被用于系统评估开源权重大型语言模型在本地化、隐私保护环境下的数据清洗与变量衍生能力。研究聚焦于模型在理解复杂调查元数据、执行多波次类别协调及层次化逻辑推导等高频瓶颈任务上的自主表现,揭示了参数规模与任务完成率的正向关联,并指出了元数据复杂度对模型性能的显著制约。该工作为在严格数据治理框架下部署AI代理进行重复性数据预处理提供了可复现的评估框架与实证依据,具有推动人群健康与社会科学研究范式革新的重要潜力。
相关研究论文
  • 1
    Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks伦敦大学学院·高级计算研究中心; 伦敦大学学院·纵向研究中心; 布里斯托大学·英国纵向链接合作组织 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务