choiqs/IF-Datasets-Tulu-IFEval
收藏资源简介:
--- dataset_info: features: - name: id dtype: string - name: prompt dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string - name: constraints list: string - name: instruction_id_list_ifeval list: string - name: kwargs_ifeval list: - name: num_highlights dtype: int64 - name: relation dtype: string - name: num_words dtype: int64 - name: num_placeholders dtype: int64 - name: prompt_to_repeat dtype: string - name: num_bullets dtype: int64 - name: section_spliter dtype: string - name: num_sections dtype: int64 - name: capital_relation dtype: string - name: capital_frequency dtype: int64 - name: keywords list: string - name: num_paragraphs dtype: int64 - name: language dtype: string - name: let_relation dtype: string - name: letter dtype: string - name: let_frequency dtype: int64 - name: end_phrase dtype: string - name: forbidden_words list: string - name: keyword dtype: string - name: frequency dtype: int64 - name: num_sentences dtype: int64 - name: postscript_marker dtype: string - name: first_word dtype: string - name: nth_paragraph dtype: int64 - name: dataset_source dtype: string splits: - name: train num_bytes: 71028755 num_examples: 29480 - name: val num_bytes: 1204693 num_examples: 500 - name: test num_bytes: 295589 num_examples: 541 download_size: 65783025 dataset_size: 72529037 configs: - config_name: default data_files: - split: train path: data/train-* - split: val path: data/val-* - split: test path: data/test-* ---
数据集信息: 特征字段: - 名称:id (标识符) 数据类型:字符串 - 名称:prompt (提示词) 数据类型:字符串 - 名称:messages (对话消息) 数据类型:列表,列表元素为包含以下子字段的对象: - 名称:content (内容) 数据类型:字符串 - 名称:role (角色) 数据类型:字符串 - 名称:constraints (约束条件) 数据类型:字符串列表 - 名称:instruction_id_list_ifeval 数据类型:字符串列表 - 名称:kwargs_ifeval 数据类型:列表,列表元素为包含以下子字段的对象: - 名称:num_highlights (高亮项数量) 数据类型:64位整型 - 名称:relation (关联关系) 数据类型:字符串 - 名称:num_words (单词数量) 数据类型:64位整型 - 名称:num_placeholders (占位符数量) 数据类型:64位整型 - 名称:prompt_to_repeat (待重复提示词) 数据类型:字符串 - 名称:num_bullets (项目符号数量) 数据类型:64位整型 - 名称:section_spliter (段落分隔符) 数据类型:字符串 - 名称:num_sections (段落数量) 数据类型:64位整型 - 名称:capital_relation (大小写关联规则) 数据类型:字符串 - 名称:capital_frequency (大小写出现频率) 数据类型:64位整型 - 名称:keywords (关键词) 数据类型:字符串列表 - 名称:num_paragraphs (段落数量) 数据类型:64位整型 - 名称:language (语言) 数据类型:字符串 - 名称:let_relation (字母关联规则) 数据类型:字符串 - 名称:letter (字母) 数据类型:字符串 - 名称:let_frequency (字母出现频率) 数据类型:64位整型 - 名称:end_phrase (结尾短语) 数据类型:字符串 - 名称:forbidden_words (禁用词) 数据类型:字符串列表 - 名称:keyword (关键词) 数据类型:字符串 - 名称:frequency (出现频率) 数据类型:64位整型 - 名称:num_sentences (句子数量) 数据类型:64位整型 - 名称:postscript_marker (后记标记) 数据类型:字符串 - 名称:first_word (首单词) 数据类型:字符串 - 名称:nth_paragraph (第N段落) 数据类型:64位整型 - 名称:dataset_source (数据集来源) 数据类型:字符串 数据集划分: - 划分名称:train(训练集) 字节大小:71028755 样本数量:29480 - 划分名称:val(验证集) 字节大小:1204693 样本数量:500 - 划分名称:test(测试集) 字节大小:295589 样本数量:541 下载总大小:65783025 数据集总大小:72529037 配置项: - 配置名称:default 数据文件: - 划分:train 路径:data/train-* - 划分:val 路径:data/val-* - 划分:test 路径:data/test-*



