Synthetic-Persona-Chat-Mapping_1k-Qwen-original
收藏资源简介:
该数据集包含1994个样本,每个样本由四个字段组成:persona-id(角色标识符)、description(角色描述文本)、enhanced_description(增强后的角色描述文本)以及persona-image(角色图像)。数据集仅包含训练集,总大小约2.85GB。该数据集可用于角色生成、角色描述文本增强、文本到图像生成等任务,支持多模态学习与语言模型训练。
This dataset contains 1994 samples, each consisting of four fields: persona-id (character identifier), description (character description text), enhanced_description (enhanced character description text), and persona-image (character image). The dataset only includes a training set with a total size of approximately 2.85GB. It can be used for tasks such as character generation, character description text enhancement, text-to-image generation, and supports multimodal learning and language model training.
Synthetic-Persona-Chat-Mapping_1k-Qwen-original 数据集概述
基本信息
- 数据集地址:
https://huggingface.co/datasets/visual-memory/Synthetic-Persona-Chat-Mapping_1k-Qwen-original - 数据集大小:约 2.85 GB(下载大小)至 2.85 GB(数据集总大小)
- 数据分割:仅包含
train分割,共 1,994 条样本
数据特征
该数据集包含以下 4 个特征字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
persona-id |
string | 人物角色标识符 |
description |
string | 人物角色的原始描述 |
enhanced_description |
string | 增强后的人物角色描述 |
persona-image |
image | 与人物角色关联的图像 |
数据配置
- 配置名称:
default - 数据文件路径:
data/train-*(支持通配符匹配多个文件)
数据用途
该数据集专注于合成人物角色与聊天映射任务,结合了文本描述(原始描述与增强描述)和图像数据,可用于多模态对话系统、人物角色建模、图文关联分析等研究方向。数据集的命名提及“Qwen-original”,暗示其可能基于 Qwen 模型生成或用于 Qwen 相关的训练/评估任务。




