control-pretraining-datasets
收藏资源简介:
该数据集是Geodesic Research构建的“控制预训练数据集”集合,旨在为强化学习、AI对齐与评估等任务提供文本数据。数据集包含六个子集:arxiv_papers(来自arXiv论文,约47.9万样本)、combined(组合数据,约6.7万样本)、ea_forum(来自EA论坛,约8.8千样本)、lesswrong(来自LessWrong论坛,约5.1万样本)、lesswrong_plus(扩展版LessWrong,约6.7万样本)、stampy(来自Stampy,约6.8千样本)。每个样本包含文本(text)、来源(source)、来源ID(source_id)、URL(url)、日期(date)等字段,其中arxiv_papers还包含类别(categories)。所有数据均为英文,经过不同的预处理流水线(如过滤、映射、聚合等)生成。该数据集适合用于预训练语言模型、控制实验或对齐研究。
This dataset is a collection of control-pretraining-datasets built by Geodesic Research, aimed at providing text data for tasks such as reinforcement learning, AI alignment, and evaluation. It contains six subsets: arxiv_papers (from arXiv papers, ~479k samples), combined (combined data, ~67k samples), ea_forum (from EA Forum, ~8.8k samples), lesswrong (from LessWrong, ~51k samples), lesswrong_plus (extended LessWrong, ~67k samples), and stampy (from Stampy, ~6.8k samples). Each sample includes fields such as text, source, source_id, url, and date, with arxiv_papers also including categories. All data are in English, generated through different preprocessing pipelines (e.g., filtering, mapping, aggregation). This dataset is suitable for pretraining language models, control experiments, or alignment research.




