Sandbox Alignment Data|模型反馈数据集|交互优化数据集
收藏Stable Alignment 数据集概述
数据集简介
Stable Alignment 项目旨在提供一种优于RLHF的对齐学习方法,具有高效的数据学习和易于扩展部署的特点。该方法通过直接训练模拟社交游戏中的交互数据,避免了训练额外奖励模型可能带来的优化问题。
数据集内容
- 社交模拟代码:用于在沙盒环境中运行社交模拟。
- 169K 交互数据:用于对齐训练的交互数据。
- 训练代码:使用稳定对齐方法进行训练的代码。
- So(cially)-Good 语言模型:训练好的语言模型。
数据统计
sandbox_v1.json
| 数据类型 / 社交代理类型 | text-davinci-002 | text-davinci-003 | ChatGPT | 总计 |
|---|---|---|---|---|
| 对齐模仿 | 9.8k | 10k | 10k | 29.8k |
| 自我批评 | 17k | 20k | 20k | 57k |
| 重新对齐 | 3.3k | 3k | 0.7k | 7k |
| 总计 | 30.1k | 33k | 30.7k | 93.8k |
sandbox_v2.json
| 数据类型 / 社交代理类型 | text-davinci-002 | text-davinci-003 | GPT4 | 总计 |
|---|---|---|---|---|
| 对齐模仿 | 18.2k | 10.4k | 20.2k | 48.8k |
| 自我批评 | 36.3k | 18.3k | 40k | 94.6k |
| 重新对齐 | 18.2k | 3.4k | 4.0k | 25.6k |
| 总计 | 72.7k | 32.1k | 64.2k | 169k |
训练方法
使用 torchrun 命令进行训练,支持多GPU训练,训练参数包括模型路径、数据路径、训练轮数、批量大小等。
模型发布
- better-base:基于LLaMA训练的模型,使用AlpacaDataCleaned和codealpaca数据集。
- hh-rlhf-sft:在better-base基础上使用Anthropic HH-RLHF数据集进行监督微调的模型。
- socially-good-lm:在hh-rlhf-sft基础上使用稳定对齐方法训练的社会对齐语言模型。
引用
如果使用本数据集或代码,请引用以下论文: bibtex @misc{liu2023sociallyaligned, title={Training Socially Aligned Language Models in Simulated Human Society}, author={Ruibo Liu and Ruixin Yang and Chenyan Jia and Ge Zhang and Denny Zhou and Andrew M. Dai and Diyi Yang and Soroush Vosoughi}, year={2023}, eprint={2305.16960}, archivePrefix={arXiv}, primaryClass={cs.CL} }

flames-and-smoke-datasets
该仓库总结了多个公开的火焰和烟雾数据集,包括DFS、D-Fire dataset、FASDD、FLAME、BoWFire、VisiFire、fire-smoke-detect-yolov4、Forest Fire等数据集。每个数据集都有详细的描述,包括数据来源、图像数量、标注信息等。
github 收录
Wind Turbine Data
该数据集包含风力涡轮机的运行数据,包括风速、风向、发电量等参数。数据记录了多个风力涡轮机在不同时间点的运行状态,适用于风能研究和风力发电系统的优化分析。
www.kaggle.com 收录
AIS数据集
该研究使用了多个公开的AIS数据集,这些数据集经过过滤、清理和统计分析。数据集涵盖了多种类型的船舶,并提供了关于船舶位置、速度和航向的关键信息。数据集包括来自19,185艘船舶的AIS消息,总计约6.4亿条记录。
github 收录
双色球开奖号码数据集
双色球开奖号码数据集从2003001-2025011
魔搭社区 收录
云浮市人口状况表信息
该数据包含了2022年至今云浮市人口状况表,指云浮市政务服务数据管理局对该信息的变动情况进行跟踪、采集、预测、分析、公布等活动。
开放广东 收录
