遇见数据集

OmniAICreator/Japanese-Roleplay-Dialogues

收藏
Hugging Face2024-06-08 更新2024-06-22 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: filtered path: Japanese-Roleplay-Dialogues-Filtered.jsonl - split: original path: Japanese-Roleplay-Dialogues-Original.jsonl license: apache-2.0 task_categories: - text-generation language: - ja tags: - roleplay size_categories: - 10K<n<100K --- # Japanese-Roleplay-Dialogues This is a dialogue corpus collected from Japanese role-playing forum (commonly known as "なりきりチャット(narikiri chat)"). Each record corresponds to a single thread. For the `original` version, no filtering has been applied. For the `filtered` version, the following filtering and cleaning conditions have been applied: - If the number of unique `poster` in the `posts` of each record is 1 or less, delete the entire record. - If the length of the `posts` is 10 or less, delete the entire record. - Normalize poster names by removing all whitespace characters (both full-width and half-width spaces) and anonymizing them. - Retain only records where the top two posters account for 90\% or more of the total posts. - Remove posts from posters other than the top two posters. - Among the top two posters, neither should account for more than 60\% of their combined posts. (i.e., each of the top two posters should account for at least 40\% of their combined posts). - Remove initial consecutive posts from the same poster until a different poster appears. - Remove final consecutive posts from the same poster until a different poster appears. - Merge consecutive posts from the same poster into a single post, separated by line breaks. Not all dialogues are purely role-playing. Some records include initial discussions about the settings, or they may continue from other threads. This dataset is intended for use in machine learning applications only.

--- 配置项: - 配置名称:default 数据文件: - 拆分集:filtered 文件路径:Japanese-Roleplay-Dialogues-Filtered.jsonl - 拆分集:original 文件路径:Japanese-Roleplay-Dialogues-Original.jsonl 许可证:Apache-2.0 任务类别: - 文本生成 语言: - 日语(ja) 标签: - 角色扮演 规模类别: - 10K < 样本量 < 100K --- # 日语角色扮演对话语料库(Japanese-Roleplay-Dialogues) 本数据集为从日语角色扮演论坛(常被称为「なりきりチャット(narikiri chat)」)采集的对话语料库,每条记录对应一个独立讨论串。 针对`original`(原始版)版本,未经过任何过滤处理。 针对`filtered`(过滤版)版本,已执行以下过滤与清洗规则: - 若单条记录的`posts`(对话内容)中唯一`poster`(发帖者)数量≤1,则删除整条记录; - 若`posts`总长度≤10,则删除整条记录; - 标准化发帖者名称:移除所有空白字符(含全角、半角空格)并进行匿名化处理; - 仅保留前两名发帖者的发言占总发言量≥90%的记录; - 删除除前两名发帖者之外的所有发言内容; - 两名发帖者的发言占合并总发言量的比例均不得超过60%(即每名发帖者的发言占比均应≥40%); - 移除开头连续的同发帖者发言,直至出现不同发帖者的发言为止; - 移除结尾连续的同发帖者发言,直至出现不同发帖者的发言为止; - 将同发帖者的连续发言合并为单条发言,以换行符分隔。 并非所有对话均为纯粹的角色扮演内容,部分记录包含前置的设定讨论环节,或承接自其他讨论串。 本数据集仅可用于机器学习相关应用场景。

提供机构:
OmniAICreator
原始信息汇总

日本角色扮演对话数据集

概述

该数据集是从日本角色扮演论坛(通常称为“なりきりチャット(narikiri chat)”)收集的对话语料库。每个记录对应一个单独的帖子。

配置

  • 默认配置
    • 分割
      • filtered:路径为 Japanese-Roleplay-Dialogues-Filtered.jsonl
      • original:路径为 Japanese-Roleplay-Dialogues-Original.jsonl

许可

  • 该数据集使用 apache-2.0 许可证。

任务类别

  • 文本生成

语言

  • 日语

标签

  • 角色扮演

大小类别

  • 10K<n<100K

数据处理

  • 原始版本:未进行过滤。
  • 过滤版本:应用了以下过滤和清洗条件:
    • 如果每个记录中的 posts 的唯一 poster 数量为1或更少,则删除整个记录。
    • 如果 posts 的长度为10或更少,则删除整个记录。
    • 通过删除所有空白字符(包括全角和半角空格)并匿名化来规范化发布者名称。
    • 仅保留前两名发布者占总帖子数90%或以上的记录。
    • 删除前两名发布者以外的帖子。
    • 在前两名发布者中,任何一个都不能占其合计帖子的60%以上(即,前两名发布者中的每一个应至少占其合计帖子的40%)。
    • 删除同一发布者的初始连续帖子,直到出现不同的发布者。
    • 删除同一发布者的最终连续帖子,直到出现不同的发布者。
    • 将同一发布者的连续帖子合并为一个帖子,用换行符分隔。

备注

  • 并非所有对话都是纯粹的角色扮演。一些记录包括关于设置的初始讨论,或者可能从其他帖子继续。
  • 该数据集仅用于机器学习应用。
搜集汇总
数据集介绍
构建方式
该数据集源自日本角色扮演论坛(通称“なりきりチャット”)的对话语料,每个记录对应一个完整的帖子线程。构建过程分为原始版与过滤版:原始版未施加任何筛选;过滤版则实施了一系列严格的清洗策略,包括剔除发帖者唯一或帖子数量不足十则的记录,对发帖者名称进行标准化与匿名化处理,仅保留前两名发帖者占比总帖数90%以上的线程,并确保这两名发帖者的发帖比例介于40%至60%之间,同时移除首尾连续来自同一发帖者的帖子,并将同一发帖者的连续帖子合并为一条,以换行分隔。
使用方法
该数据集专为机器学习应用设计,适用于文本生成任务,尤其是角色扮演对话的模型训练与评估。使用时可通过HuggingFace加载,默认配置包含'filtered'与'original'两个子集,分别对应经过清洗与未经处理的版本。研究者可根据需求选择合适子集,将数据用于微调语言模型、生成角色扮演对话或分析日语角色扮演语域特征。数据以JSONL格式存储,便于解析与集成至常见深度学习框架。
背景与挑战
背景概述
在自然语言处理领域,对话系统与角色扮演数据的结合正逐渐成为研究热点,尤其在多轮交互与人格模拟方面展现出独特价值。OmniAICreator/Japanese-Roleplay-Dialogues数据集由研究团队于近期创建,源自日本流行的“なりきりチャット”(角色扮演聊天)论坛,旨在为文本生成任务提供高质量的多角色对话语料。该数据集包含原始与过滤两个版本,过滤版本通过严格的清洗流程确保对话的多样性与互动性,如保留双角色主导的会话、消除单方独白等。其核心研究问题聚焦于如何利用真实论坛数据训练模型理解角色扮演中的语境、身份切换与叙事逻辑。作为少有的日语角色扮演对话资源,该数据集为低资源语言的角色生成、情感对话及多轮交互研究提供了重要基准,推动了跨文化对话建模的发展。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:角色扮演对话不仅要求模型理解语义,还需捕捉角色身份、情感动态与叙事一致性,这与常规问答或闲聊任务截然不同,增加了生成式模型在人格模拟与上下文依赖方面的难度。构建过程中,原始数据包含大量非角色扮演内容(如设定讨论)或单方连续发言,过滤算法虽通过角色比例、发言长度等规则优化数据质量,但可能剔除具有潜在价值的边缘案例,导致数据多样性受限。此外,对话中隐含的论坛文化背景(如匿名昵称、跨线程关联)难以完全清洗,可能引入噪声或偏见,影响模型泛化能力与训练稳定性。
常用场景
经典使用场景
Japanese-Roleplay-Dialogues数据集源自日本角色扮演论坛(俗称“なりきりチャット”),其经典使用场景聚焦于文本生成任务中的多轮对话建模,尤其在角色扮演对话的语境理解与生成方面。该数据集提供了过滤版和原始版两种配置,过滤版通过严格的清洗规则(如剔除发言者单一或对话轮次过少的记录、标准化匿名化发言者名称、保留双人主导对话等)确保了对话的高质量与角色互动均衡性,从而为训练能够捕捉角色一致性、语言风格模仿及情境化回复的生成模型提供了理想语料。研究者常利用此数据集微调预训练语言模型,使其在角色扮演场景中生成自然流畅、符合角色设定的对话内容。
解决学术问题
该数据集有效解决了学术研究中角色扮演对话数据稀疏与质量参差不齐的难题。在自然语言处理领域,多轮对话生成模型常因缺乏真实、多样化的角色互动数据而难以模拟人际交流中的角色切换与身份维持机制。OmniAICreator/Japanese-Roleplay-Dialogues通过提供经过精细过滤的日文角色扮演对话,为探究对话系统中的角色一致性、情感表达连贯性以及上下文依赖的回复生成提供了基准资源。其意义在于推动了非英语语种下角色扮演对话生成的研究,丰富了跨文化对话系统的理论构建,并为评估模型在限定角色关系下的对话表现提供了标准化测试平台。
实际应用
在实际应用层面,该数据集可被部署于虚拟角色交互系统、游戏NPC对话生成、以及社交机器人中的个性化聊天模块。例如,在电子游戏中,基于此数据集训练的模型能够生成符合特定角色性格与背景的对话,提升玩家的沉浸式体验;在虚拟助手或娱乐型聊天机器人中,它有助于实现更生动的角色扮演功能,使用户获得更具互动性的交流感受。此外,该数据集还可用于开发日语学习辅助工具,通过角色扮演场景帮助学习者练习语境化表达,从而将学术研究成果转化为提升人机交互质量与教育效能的实用产品。
数据集最近研究
最新研究方向
在自然语言处理与角色扮演对话系统的交叉领域中,Japanese-Roleplay-Dialogues数据集为日文角色扮演对话生成提供了宝贵的训练资源。该语料库源自日本流行的“なりきりチャット”论坛,经过精细过滤后保留了高质量的双人互动对话,特别关注了对话者身份平衡与对话长度等关键特征。当前前沿研究方向聚焦于利用此类数据增强大型语言模型在角色一致性、情感连贯性和情境适应性方面的表现,尤其是在日文虚拟角色交互场景中。该数据集的出现填补了非英语角色扮演对话资源的空白,推动了多语言、多模态对话系统的发展,并为研究对话中的意图识别、人格模拟及社会互动动态提供了实证基础,对构建更具沉浸感和文化敏感性的AI角色具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务