BeyondDialogue
收藏资源简介:
Beyond Dialogue Role-Playing Dataset是一个全面的数据集,旨在推动角色扮演模型研究。该数据集包含从小说中提取的真实角色对话数据,以及超越简单对话交换的复杂推理任务。数据集支持中文和英文,包含多个配置文件,每个配置文件对应不同的数据文件。数据集的统计信息显示,该数据集具有多语言、多轮对话的特点,并且角色和对话会话数量丰富。
The Beyond Dialogue Role-Playing Dataset is a comprehensive dataset designed to advance research on role-playing models. This dataset contains real character dialogue data extracted from novels, as well as complex reasoning tasks that go beyond simple conversational exchanges. It supports both Chinese and English, and includes multiple configuration files, each corresponding to a distinct data file. Statistical analyses of the dataset reveal that it features multilingual and multi-turn dialogues, with a rich number of characters and conversational sessions.
Beyond Dialogue Role-playing Dataset
概述
Beyond Dialogue Role-Playing Dataset 是一个全面的角色扮演模型研究数据集,包含以下特点:
- 真实角色对话数据:从小说中提取的真实对话,包含角色之间丰富的上下文交互。
- 超越对话的对齐推理任务:除了对话,数据集还包括对齐推理任务,挑战模型进行复杂的推理,超越简单的对话交换。
数据文件结构
- 角色扮演数据
RPA_CN_SFT.json和RPA_EN_SFT.json:包含中英文的对齐角色扮演对话。RP_CN_SFT.json和RP_EN_SFT.json:包含中英文的非对齐角色扮演对话。
- 对齐任务
CSERP_CN_SFT.json和CSERP_EN_SFT.json:包含中英文的角色、风格、情感、关系和个性维度的对齐推理任务。
- 对话块
ChunkDialogues_CN和ChunkDialogues_EN:包含中英文的角色资料和对话,以及对话源块。
数据集统计
- 从123本中英文小说或剧本中提取了280个中文角色和31个英文角色。
- 总共获得了3,552个场景对话会话,包含23,247个对话轮次。
下载
可以通过以下代码从Hugging Face Datasets Hub下载数据集: bash git lfs install git clone https://huggingface.co/datasets/yuyouyu/BeyondDialogue
python from datasets import load_dataset
dataset = load_dataset("yuyouyu/BeyondDialogue")
引用
如果使用此数据集,请引用以下论文: bibtex @article{yu2024beyond, title = {BEYOND DIALOGUE: A Profile-Dialogue Alignment Framework Towards General Role-Playing Language Model}, author = {Yu, Yeyong and Yu, Runsheng and Wei, Haojie and Zhang, Zhanqiu and Qian, Quan}, year = {2024}, journal = {arXiv preprint arXiv:2408.10903} }




