dikw/hh_rlhf_cn
收藏资源简介:
--- license: llama2 --- --- license: bsd --- ## hh-rlhf中文翻译版本 基于Anthropic论文Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback 开源的helpful 和harmless数据,使用翻译工具进行了翻译。 hh_rlhf_train.jsonl 合并中英文训练集数据 清洗过后17万条 hh_rlhf_test.jsonl 合并中英文测试集数据 清洗过后9千条 harmless_base_cn_train.jsonl 42394条 harmless_base_cn_test.jsonl 2304条 helpful_base_cn_train.jsonl 43722条 helpful_base_cn_test.jsonl 2346条 ## 实验报告 相关rlhf实验报告:https://zhuanlan.zhihu.com/p/652044120
许可证:Llama2 --- 许可证:BSD --- ## hh-rlhf 中文翻译版本 本数据集基于Anthropic公司发表的论文《基于人类反馈强化学习训练乐于助人且无害的助手(Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback)》所开源的乐于助人(helpful)与无害(harmless)数据集,通过翻译工具完成汉化。 其中: - hh_rlhf_train.jsonl:合并中英双语的训练集数据,经清洗后共计17万条 - hh_rlhf_test.jsonl:合并中英双语的测试集数据,经清洗后共计9千条 - harmless_base_cn_train.jsonl:包含42394条数据 - harmless_base_cn_test.jsonl:包含2304条数据 - helpful_base_cn_train.jsonl:包含43722条数据 - helpful_base_cn_test.jsonl:包含2346条数据 ## 实验报告 相关人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)实验报告:https://zhuanlan.zhihu.com/p/652044120
hh-rlhf中文翻译版本
数据集概述
- 数据来源:基于Anthropic论文《Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback》开源的helpful和harmless数据。
- 数据处理:使用翻译工具进行了翻译。
数据文件
- 训练集:
hh_rlhf_train.jsonl:合并中英文训练集数据,清洗过后17万条。harmless_base_cn_train.jsonl:42394条。helpful_base_cn_train.jsonl:43722条。
- 测试集:
hh_rlhf_test.jsonl:合并中英文测试集数据,清洗过后9千条。harmless_base_cn_test.jsonl:2304条。helpful_base_cn_test.jsonl:2346条。




