anonymous-dataset-submission
收藏资源简介:
该数据集是NeurIPS 2026匿名提交的一部分,包含媒体文件,旨在支持多模态任务。数据集分为两个部分:release_curated_balanced_v0是一个包含500条记录的公开平衡子集,paper_locked_v1_metadata包含2000条记录,用于论文推理基准。数据集注重平衡指令载体(如文本、清晰图像、自然图像、清晰音频、嘈杂自然音频)、广泛的模态特征和任务家族,以及无硬性措辞/评分问题的行。重要字段包括signature(输出模态签名)、instruction_carrier(指令载体)、canonical_instruction_text(指令内容)等。数据集适用于文本生成、图像到文本、文本到图像、自动语音识别和文本到音频等多种任务。
This dataset is part of an anonymous NeurIPS 2026 submission, incorporates media files, and is designed to facilitate multimodal task research. It is divided into two core components: release_curated_balanced_v0 is a public balanced subset containing 500 records, while paper_locked_v1_metadata includes 2,000 records and functions as the reasoning benchmark for the accompanying submission paper. The dataset prioritizes balancing diverse instruction carriers (e.g., text, clear images, natural images, clean audio, and noisy natural audio), covering a broad spectrum of modal features and task families, and ensuring all entries are free from rigid wording or scoring issues. Key fields in the dataset include signature (output modality signature), instruction_carrier (instruction carrier), canonical_instruction_text (instruction content), among others. This dataset is applicable to a variety of tasks including text generation, image-to-text, text-to-image, automatic speech recognition, and text-to-audio.




