cc-2021-rewritten
收藏资源简介:
该数据集是一个用于语言模型训练或评估的大规模文本数据集,特别侧重于对话生成与响应比较任务。数据集包含217,507个训练样本,总大小约为2.51 GB。每个样本由多个结构化字段组成:original字段可能代表原始输入或上下文文本;prompt字段是一个复杂结构,包含多轮对话历史(chat_turns字符串列表)、是否使用多轮对话的标志(use_multiturn布尔值)、示例列表(当前为空)以及元数据(其中包含提示类型PROMPT_TYPE)。此外,样本提供了两个模型生成的候选响应(response_0和response_1),一个最终响应(final_response),以及生成这些响应的模型名称(generator_model)和生成参数(generation_params)。数据集结构暗示其可能用于训练或评估对话系统、进行响应偏好学习(例如,从多个候选中选择或生成最佳响应)、或作为强化学习从人类反馈(RLHF)流程中的比较数据。数据集仅提供训练集分割,适用于模型微调、偏好对齐或对话生成质量评估等场景。
This dataset is a large-scale text dataset for language model training or evaluation, with a particular focus on dialogue generation and response comparison tasks. It contains 217,507 training samples with a total size of approximately 2.51 GB. Each sample consists of multiple structured fields: the original field may represent the original input or context text; the prompt field is a complex structure containing multi-turn dialogue history (a list of strings in chat_turns), a flag indicating whether multi-turn dialogue is used (a boolean use_multiturn), an example list (currently empty), and metadata (including the prompt type PROMPT_TYPE). Additionally, each sample provides two model-generated candidate responses (response_0 and response_1), a final response (final_response), along with the model names (generator_model) and generation parameters (generation_params) used to generate these responses. The dataset structure suggests it may be used for training or evaluating dialogue systems, conducting response preference learning (e.g., selecting or generating the best response from multiple candidates), or serving as comparative data in the Reinforcement Learning from Human Feedback (RLHF) process. The dataset only includes a training split and is suitable for scenarios such as model fine-tuning, preference alignment, or dialogue generation quality assessment.
- 数据集名称:cc-2021-rewritten
- 数据集地址:https://huggingface.co/datasets/G-reen/cc-2021-rewritten
- 基本信息:
- 下载大小:1,544,527,599 字节(约1.54 GB)
- 数据集大小:2,507,961,569 字节(约2.51 GB)
- 包含样本数:217,507 条
- 数据划分:仅包含训练集(train)
- 数据文件格式:路径为
data/train-* - 数据特征:
original(字符串):原始文本prompt(结构化字段):chat_turns(字符串列表):对话轮次use_multiturn(布尔值):是否使用多轮对话examples(空列表):示例metadata(结构化字段):PROMPT_TYPE(字符串):提示类型
response_0(字符串):响应0response_1(字符串):响应1final_response(字符串):最终响应generator_model(字符串):生成模型generation_params(字符串):生成参数




