PersonaChat-Mapping
收藏资源简介:
该数据集包含一系列人物角色的描述文本,并提供了这些描述的迭代修订版本。具体而言,每个数据样本包含四个核心字段:一个唯一的角色标识符(persona-id)、该角色的原始描述文本(persona_original)、经过一次修订后的描述文本(persona_revised),以及进一步修订和增强后的描述文本(enhanced_persona_revised)。数据集规模为21,061个样本,仅包含训练集划分。从数据结构推断,该数据集可能旨在支持与角色构建、角色描述的自然语言生成、文本修订、内容增强或对比学习相关的任务与研究。
This dataset contains a series of persona description texts and provides iterative revised versions of these descriptions. Specifically, each data sample includes four core fields: a unique persona identifier (persona-id), the original description text of the persona (persona_original), a revised description text after one revision (persona_revised), and a further revised and enhanced description text (enhanced_persona_revised). The dataset consists of 21,061 samples and includes only a training set partition. Based on the data structure, it is inferred that this dataset may aim to support tasks and research related to persona construction, natural language generation for persona descriptions, text revision, content enhancement, or contrastive learning.
数据集概述:PersonaChat-Mapping
-
数据集名称:PersonaChat-Mapping
-
数据集地址:https://huggingface.co/datasets/visual-memory/PersonaChat-Mapping
-
数据集规模:
- 总大小:约 28.58 MB
- 下载大小:约 13.31 MB
- 训练集样本数:21,061 条
-
数据特征:每条数据包含以下字段:
persona-id(字符串):人物形象唯一标识符persona_original(字符串):原始人物形象描述persona_revised(字符串):修订后的人物形象描述enhanced_persona_revised(字符串):增强修订版人物形象描述
-
数据划分:
- 仅包含单一分区:训练集(
train)
- 仅包含单一分区:训练集(
-
配置文件:
- 默认配置(
default),数据文件路径为data/train-*
- 默认配置(




