PersonaChat-Mapping_1k-ERNIE-enhanced
收藏资源简介:
该数据集包含1991个样本,每个样本由以下字段组成:人物角色ID(persona-id)、原始人物角色描述(persona_original)、修订后的人物角色描述(persona_revised)、增强修订后的人物角色描述(enhanced_persona_revised)以及对应的人物角色图像(persona-image)。数据集仅提供训练集拆分,适用于多模态学习、文本到图像生成、图像描述或人物角色分析等任务。
This dataset contains 1,991 samples, each consisting of the following fields: persona-id, persona_original (original persona description), persona_revised (revised persona description), enhanced_persona_revised (enhanced revised persona description), and persona-image (corresponding persona image). The dataset only provides a training set split and is suitable for tasks such as multimodal learning, text-to-image generation, image captioning, or persona analysis.
PersonaChat-Mapping_1k-ERNIE-enhanced 数据集概述
该数据集是一个用于人格画像增强与映射任务的英文数据集,基于 PersonaChat 构建,并通过 ERNIE 模型对人格描述进行了增强处理。数据集总量约 1,991 条训练样本,总大小约 3.24 GB(包含图像数据)。
数据字段说明
| 字段名 | 数据类型 | 描述 |
|---|---|---|
persona-id |
string | 人格画像的唯一标识符 |
persona_original |
string | 原始人格描述文本 |
persona_revised |
string | 修订后的人格描述文本 |
enhanced_persona_revised |
string | 经 ERNIE 增强后的修订人格描述 |
persona-image |
image | 与人格画像对应的图像数据 |
数据划分
- 训练集(train):包含 1,991 个样本,占总数据集全部内容
- 数据下载大小约 3.22 GB,解压后数据集总大小约 3.24 GB
用途说明
该数据集适用于以下研究与应用场景:
- 人格画像的自动映射与对齐
- 对话系统中个性化响应生成
- 基于 ERNIE 的文本增强效果评估
- 多模态(文本 + 图像)人格建模研究





