ConvAI2-Mapping_1k-ERNIE-original
收藏资源简介:
该数据集包含1712个训练样本,每个样本由四个字段组成:persona-id(人物画像标识符)、persona_revised(修订后的人物画像文本)、enhanced_persona_revised(增强后的修订人物画像文本)以及persona-image(对应的人物画像图像)。数据以图像和文本形式呈现,可能用于多模态人物画像生成、文本到图像或图像到文本的相关任务。
This dataset contains 1712 training samples, each consisting of four fields: persona-id (persona identifier), persona_revised (revised persona text), enhanced_persona_revised (enhanced revised persona text), and persona-image (corresponding persona image). The data is presented in both image and text forms, potentially for multimodal persona generation, text-to-image, or image-to-text related tasks.
ConvAI2-Mapping_1k-ERNIE-original 数据集概述
基本信息
该数据集名为ConvAI2-Mapping_1k-ERNIE-original,托管于 Hugging Face 平台,地址为 https://huggingface.co/datasets/visual-memory/ConvAI2-Mapping_1k-ERNIE-original。
数据特征
数据集包含以下四个字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
persona-id |
string | 人物角色标识 |
persona_revised |
string | 修订后的人物角色描述 |
enhanced_persona_revised |
string | 增强并修订后的人物角色描述 |
persona-image |
image | 人物角色对应的图像 |
数据划分
- 训练集(train):
- 样本数量:1712 条
- 数据大小:约 3.04 GB(3,040,050,196 字节)
数据集规模
- 下载大小:约 3.036 GB(3,035,932,956 字节)
- 总数据集大小:约 3.04 GB(3,040,050,196 字节)
文件结构
- 数据配置文件名为
default - 训练数据文件存放在
data/train-*路径下(通配符表示多个分片文件)
数据集用途推测
该数据集结合了人物角色文本描述(原始、修订、增强版本)与其对应图像,可能用于多模态对话系统、人物角色建模、图文匹配或视觉-语言预训练等相关任务的研究与开发。数据集名称中的 "Mapping_1k" 表明其涉及 1000 级别规模的人物角色映射任务,并结合了 ERNIE 模型(百度开发的预训练语言模型)的原始处理方式。





