PAD3-Dataset-Revisi-Fixed-TRL
收藏资源简介:
PAD3数据集(修订版,TRL格式)是一个用于图像年龄评级分类的对话式数据集,采用TRL(Transformer Reinforcement Learning)或SFT(Supervised Fine-Tuning)聊天格式。数据集基于Apache-2.0许可证发布,主要语言为印尼语。数据内容包括metadata.jsonl文件(每行存储一个TRL聊天记录)和images文件夹(按年龄评级子文件夹组织图像,如“Semua_Umur”、“7_”、“13_”、“15_”、“18_”和“Konten_Terlarang”,以遵守每文件夹文件数限制)。每条聊天记录遵循多轮对话结构:系统角色提供上下文指令,用户角色输入文本和图像路径(图像为相对路径),助手角色输出JSON格式的评级结果(如“15+”)和描述。该数据集适用于图像-文本到文本任务,旨在训练视觉语言模型(VLM)进行内容年龄评级分类,支持强化学习和监督微调场景。
The PAD3 dataset (revised version, TRL format) is a conversational dataset for image age rating classification, using TRL (Transformer Reinforcement Learning) or SFT (Supervised Fine-Tuning) chat formats. It is released under the Apache-2.0 license, with Indonesian as the primary language. The data includes a metadata.jsonl file (each line storing a TRL chat record) and an images folder (organizing images into subfolders by age rating, such as Semua_Umur, 7_, 13_, 15_, 18_, and Konten_Terlarang, to comply with file-per-folder limits). Each chat record follows a multi-turn dialogue structure: the system role provides contextual instructions, the user role inputs text and image paths (images as relative paths), and the assistant role outputs JSON-formatted rating results (e.g., 15+) and descriptions. This dataset is suitable for image-text-to-text tasks, aiming to train visual language models (VLM) for content age rating classification, supporting reinforcement learning and supervised fine-tuning scenarios.
数据集概述:PAD3 Dataset Revisi Fixed (TRL)
- 数据集名称:PAD3 Dataset Revisi Fixed (TRL)
- 许可证:Apache-2.0
- 语言:印尼语(id)
- 任务类别:图像到文本(image-text-to-text)
- 标签:trl、sft、vlm、content-rating
- 配置:默认配置(default),包含一个训练集(train),数据文件为
metadata.jsonl
数据集用途
该数据集用于对图像进行年龄分级分类,采用对话式(TRL / SFT)格式。
数据结构
数据集目录结构如下:
metadata.jsonl:每行包含一条 TRL 对话记录。images/:图像文件夹,按分级标签分为子文件夹:Semua_Umur/(所有年龄)7_/(7岁以上)13_/(13岁以上)15_/(15岁以上)18_/(18岁以上)Konten_Terlarang/(禁止内容) 每个子文件夹中的图像文件以数字编号命名(如000000.jpg),以避免超过每文件夹10,000文件限制。
记录格式(JSONL)
metadata.jsonl 每条记录的 JSON 结构如下:
- messages(列表):包含三个消息对象:
- role: "system":系统提示信息。
- role: "user":用户输入,包含文本(type: "text")和图像(type: "image"),图像路径相对于仓库根目录。
- role: "assistant":助手回复,内容为 JSON 字符串,包含
rating(年龄分级)和description(描述)字段。




