align-anything
收藏资源简介:
Align-Anything 400K 是一个综合性的多模态对齐数据集,提供细粒度的偏好标注和语言反馈。该数据集包含多种配置,如文本到视频、文本到图像、文本到音频等,每个配置都有特定的特征和分割。数据集旨在提供跨不同模态的一致高质量数据,并包含详细的偏好标注和语言反馈,以支持全面的评估和改进。数据集分为三部分:Any-to-Any、Any-to-Text 和 Any-to-Image,分别代表不同类型的输入-输出模态转换。数据集采用 CC-BY-NC-4.0 许可证,主要使用英语语言。
Align-Anything 400K is a comprehensive multimodal alignment dataset that provides fine-grained preference annotations and linguistic feedback. This dataset includes multiple setups, such as text-to-video, text-to-image, text-to-audio and more, each with distinct characteristics and predefined data splits. The dataset aims to deliver consistent high-quality data across diverse modalities, and contains detailed preference annotations and linguistic feedback to support comprehensive evaluation and improvement. It is divided into three parts: Any-to-Any, Any-to-Text, and Any-to-Image, which respectively represent different types of input-output modality conversion tasks. The dataset is released under the CC-BY-NC-4.0 license and is primarily in English.
数据集概述:Align-Anything 400K
数据集信息
配置名称:example_tv2t
- 特征:
prompt: stringvideo_path: stringresponse_1: stringresponse_2: stringmodel_1: stringmodel_2: stringp_response: int64prompt_following_rate_1: int64prompt_following_rate_2: int64p_rationale_1: stringp_rationale_2: stringo_response: int64objective_rules_rate_1: int64objective_rules_rate_2: int64o_rationale_1: stringo_rationale_2: stringc_response: int64clarity_rate_1: int64clarity_rate_2: int64c_rationale_1: stringc_rationale_2: stringi_response: int64information_richness_rate_1: int64information_richness_rate_2: int64i_rationale_1: stringi_rationale_2: strings_response: int64safety_rate_1: int64safety_rate_2: int64s_rationale_1: strings_rationale_2: stringtext_critique_1: stringtext_critique_2: stringoverall_response: int64overall_textfeedback: string
- 分割:
example
配置名称:example_ti2t
- 特征:
question: stringimage: imageresponse_1: stringresponse_2: stringres_1_from: stringres_2_from: stringp_response: int64prompt_following_rate_1: int64prompt_following_rate_2: int64p_rationale_1: stringp_rationale_2: stringo_response: int64objective_rules_rate_1: int64objective_rules_rate_2: int64o_rationale_1: stringo_rationale_2: stringc_response: int64clarity_rate_1: int64clarity_rate_2: int64c_rationale_1: stringc_rationale_2: stringi_response: int64information_richness_rate_1: int64information_richness_rate_2: int64i_rationale_1: stringi_rationale_2: strings_response: int64safety_rate_1: int64safety_rate_2: int64s_rationale_1: strings_rationale_2: stringtext_critique_1: stringtext_critique_2: stringoverall_response: int64overall_textfeedback: string
- 分割:
example
配置名称:example_ti2ti
- 特征:
question: stringinput_image: imagetext_response_1: stringimage_response_1: imageres_1_from: stringtext_response_2: stringimage_response_2: imageres_2_from: stringp_response: stringprompt_following_rate_1: stringprompt_following_rate_2: stringp_rationale_1: stringp_rationale_2: stringo_response: stringobjective_rules_rate_1: stringobjective_rules_rate_2: stringo_rationale_1: stringo_rationale_2: stringca_response: stringca_rate_1: stringca_rate_2: stringca_rationale_1: stringca_rationale_2: stringi_response: stringinformation_richness_rate_1: stringinformation_richness_rate_2: stringi_rationale_1: stringi_rationale_2: strings_response: stringsafety_rate_1: stringsafety_rate_2: strings_rationale_1: strings_rationale_2: stringc_response: stringconsistency_rate_1: stringconsistency_rate_2: stringc_rationale_1: stringc_rationale_2: stringimage_critique_1: stringtext_critique_1: stringimage_critique_2: stringtext_critique_2: stringoverall_response: stringoverall_textfeedback: string
- 分割:
example
配置名称:example_t2t
- 特征:
question: stringresponse_1: stringresponse_2: stringp_response: int64prompt_following_rate_1: int64prompt_following_rate_2: int64p_rationale_1: stringp_rationale_2: stringo_response: int64objective_rules_rate_1: int64objective_rules_rate_2: int64o_rationale_1: stringo_rationale_2: stringc_response: int64clarity_rate_1: int64clarity_rate_2: int64c_rationale_1: stringc_rationale_2: stringi_response: int64information_richness_rate_1: int64information_richness_rate_2: int64i_rationale_1: stringi_rationale_2: strings_response: int64safety_rate_1: int64safety_rate_2: int64s_rationale_1: strings_rationale_2: stringtext_critique_1: stringtext_critique_2: stringoverall_response: int64overall_textfeedback: string
- 分割:
example
配置名称:example_ta2t
- 特征:
prompt: stringcase: stringaudio_path: audiocaption: stringresponse_1: stringres_1_from: stringresponse_2: stringres_2_from: stringprompt_sha256: stringp_response: int64prompt_following_rate_1: int64prompt_following_rate_2: int64p_rationale_1: stringp_rationale_2: stringo_response: int64objective_rules_rate_1: int64objective_rules_rate_2: int64o_rationale_1: stringo_rationale_2: stringc_response: int64clarity_rate_1: int64clarity_rate_2: int64c_rationale_1: stringc_rationale_2: stringi_response: int64information_richness_rate_1: int64information_richness_rate_2: int64i_rationale_1: stringi_rationale_2: strings_response: int64safety_rate_1: int64safety_rate_2: int64s_rationale_1: strings_rationale_2: stringtext_critique_1: stringtext_critique_2: stringoverall_response: int64overall_textfeedback: string
- 分割:
example
配置名称:example_t2v
- 特征:
prompt: stringvideo_1: stringvideo_2: stringvideo_1_model: stringvideo_2_model: stringp_video: int64prompt_following_rate_1: int64prompt_following_rate_2: int64p_rationale_1: stringp_rationale_2: stringo_audio: int64video_objective_reality_rate_1: int64video_objective_reality_rate_2: int64o_rationale_1: stringo_rationale_2: stringa_video: int64aesthetic_rate_1: int64aesthetic_rate_2: int64a_rationale_1: stringa_rationale_2: stringi_video: int64information_richness_rate_1: int64information_richness_rate_2: int64i_rationale_1: stringi_rationale_2: stringt_video: int64temporal_consistency_rate_1: int64temporal_consistency_rate_2: int64t_rationale_1: stringt_rationale_2: stringc_video: int64content_coherence_rate_1: int64content_coherence_rate_2: int64c_rationale_1: stringc_rationale_2: stringm_video: int64motion_naturalness_rate_1: int64motion_naturalness_rate_2: int64m_rationale_1: stringm_rationale_2: strings_video: int64safety_rate_1: int64safety_rate_2: int64s_rationale_1: strings_rationale_2: stringtext_1_feedback: stringtext_2_feedback: stringoverall_image: int64overall_textfeedback: stringrefine_prompt: stringreasoning: string
- 分割:
example
配置名称:example_t2i
- 特征:
prompt: stringimage_1: imageimage_1_model: stringimage_2: imageimage_2_model: stringp_image: int64prompt_following_rate_1: int64prompt_following_rate_2: int64p_rationale_1: stringp_rationale_2: stringo_image: int64objective_rules_rate_1: int64objective_rules_rate_2: int64o_rationale_1: stringo_rationale_2: stringa_image: int64aesthetics_rate_1: int64aesthetics_rate_2: int64a_rationale_1: stringa_rationale_2: stringi_image: int64information_richness_rate_1: int64information_richness_rate_2: int64i_rationale_1: stringi_rationale_2: strings_image: int64safety_rate_1: int64safety_rate_2: int64s_rationale_1: strings_rationale_2: stringtext_1_feedback: stringtext_2_feedback: stringoverall_image: int64overall_textfeedback: string
- 分割:
example
配置名称:example_t2a
- 特征:
prompt: stringresponse_1: audioresponse_2: audiores_1_from: stringres_2_from: stringp_audio: int64prompt_following_rate_1: int64prompt_following_rate_2: int64p_rationale_1: stringp_rationale_2: stringo_audio: int64audio_quality_rate_1: int64audio_quality_rate_2: int64o_rationale_1: stringo_rationale_2: stringa_audio: int64consistency_rate_1: int64consistency_rate_2: int64a_rationale_1: stringa_rationale_2: stringi_audio: int64information_richness_rate_1: int64information_richness_rate_2: int64i_rationale_1: stringi_rationale_2: strings_audio: int64safety_rate_1: int64safety_rate_2: int64s_rationale_1: strings_rationale_2: stringtext_1_feedback: stringtext_2_feedback: stringoverall_audio: int64overall_textfeedback: stringrefine_prompt: stringreasoning: string
- 分割:
example
配置名称:text-to-audio
- 分割:
train
配置名称:text-to-image
- 分割:
trainval
配置名称:text-to-video
- 分割:
train
配置名称:text-to-text
- 分割:
trainval
配置名称:text-audio-to-text
- 分割:
trainval
配置名称:text-image-to-text
- 分割:
trainval
配置名称:text-video-to-text
- **




