hsiung/llm-similarity-risk
收藏资源简介:
--- dataset_info: features: - name: prompt dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string splits: - name: train num_bytes: 355835764 num_examples: 59766 - name: test num_bytes: 39616427 num_examples: 8304 - name: train_random_5k num_bytes: 352570387 num_examples: 57000 - name: train_random_1k num_bytes: 347865006 num_examples: 53000 - name: train_pure_bad_high_sim_5k num_bytes: 352282888 num_examples: 57000 - name: train_pure_bad_low_sim_5k num_bytes: 352908141 num_examples: 57000 - name: train_pure_bad_high_sim_1k num_bytes: 347727585 num_examples: 53000 - name: train_pure_bad_low_sim_1k num_bytes: 348070253 num_examples: 53000 - name: train_list_high_sim_5k num_bytes: 352588208 num_examples: 57000 - name: train_list_low_sim_5k num_bytes: 352538289 num_examples: 57000 - name: train_list_high_sim_1k num_bytes: 347857708 num_examples: 53000 - name: train_list_low_sim_1k num_bytes: 347998423 num_examples: 53000 - name: train_samsum_high_sim_5k num_bytes: 351978835 num_examples: 57000 - name: train_samsum_low_sim_5k num_bytes: 353148699 num_examples: 57000 - name: train_samsum_high_sim_1k num_bytes: 347601579 num_examples: 53000 - name: train_samsum_low_sim_1k num_bytes: 348287170 num_examples: 53000 - name: train_alpaca_high_sim_5k num_bytes: 352417167 num_examples: 57000 - name: train_alpaca_low_sim_5k num_bytes: 352734748 num_examples: 57000 - name: train_alpaca_high_sim_1k num_bytes: 347761783 num_examples: 53000 - name: train_alpaca_low_sim_1k num_bytes: 348039401 num_examples: 53000 download_size: 6355867991 dataset_size: 6699828461 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: train_random_5k path: data/train_random_5k-* - split: train_random_1k path: data/train_random_1k-* - split: train_pure_bad_high_sim_5k path: data/train_pure_bad_high_sim_5k-* - split: train_pure_bad_low_sim_5k path: data/train_pure_bad_low_sim_5k-* - split: train_pure_bad_high_sim_1k path: data/train_pure_bad_high_sim_1k-* - split: train_pure_bad_low_sim_1k path: data/train_pure_bad_low_sim_1k-* - split: train_list_high_sim_5k path: data/train_list_high_sim_5k-* - split: train_list_low_sim_5k path: data/train_list_low_sim_5k-* - split: train_list_high_sim_1k path: data/train_list_high_sim_1k-* - split: train_list_low_sim_1k path: data/train_list_low_sim_1k-* - split: train_samsum_high_sim_5k path: data/train_samsum_high_sim_5k-* - split: train_samsum_low_sim_5k path: data/train_samsum_low_sim_5k-* - split: train_samsum_high_sim_1k path: data/train_samsum_high_sim_1k-* - split: train_samsum_low_sim_1k path: data/train_samsum_low_sim_1k-* - split: train_alpaca_high_sim_5k path: data/train_alpaca_high_sim_5k-* - split: train_alpaca_low_sim_5k path: data/train_alpaca_low_sim_5k-* - split: train_alpaca_high_sim_1k path: data/train_alpaca_high_sim_1k-* - split: train_alpaca_low_sim_1k path: data/train_alpaca_low_sim_1k-* ---
数据集信息: 特征字段: - 名称:提示词(prompt),数据类型:字符串 - 名称:对话消息列表,其子字段包含: - 名称:内容,数据类型:字符串 - 名称:角色,数据类型:字符串 数据划分: - 名称:train,字节数:355835764,样本数量:59766 - 名称:test,字节数:39616427,样本数量:8304 - 名称:train_random_5k,字节数:352570387,样本数量:57000 - 名称:train_random_1k,字节数:347865006,样本数量:53000 - 名称:train_pure_bad_high_sim_5k,字节数:352282888,样本数量:57000 - 名称:train_pure_bad_low_sim_5k,字节数:352908141,样本数量:57000 - 名称:train_pure_bad_high_sim_1k,字节数:347727585,样本数量:53000 - 名称:train_pure_bad_low_sim_1k,字节数:348070253,样本数量:53000 - 名称:train_list_high_sim_5k,字节数:352588208,样本数量:57000 - 名称:train_list_low_sim_5k,字节数:352538289,样本数量:57000 - 名称:train_list_high_sim_1k,字节数:347857708,样本数量:53000 - 名称:train_list_low_sim_1k,字节数:347998423,样本数量:53000 - 名称:train_samsum_high_sim_5k,字节数:351978835,样本数量:57000 - 名称:train_samsum_low_sim_5k,字节数:353148699,样本数量:57000 - 名称:train_samsum_high_sim_1k,字节数:347601579,样本数量:53000 - 名称:train_samsum_low_sim_1k,字节数:348287170,样本数量:53000 - 名称:train_alpaca_high_sim_5k,字节数:352417167,样本数量:57000 - 名称:train_alpaca_low_sim_5k,字节数:352734748,样本数量:57000 - 名称:train_alpaca_high_sim_1k,字节数:347761783,样本数量:53000 - 名称:train_alpaca_low_sim_1k,字节数:348039401,样本数量:53000 下载大小:6355867991 数据集总大小:6699828461 配置项: - 配置名称:default,数据文件: - 数据划分:train,文件路径:data/train-* - 数据划分:test,文件路径:data/test-* - 数据划分:train_random_5k,文件路径:data/train_random_5k-* - 数据划分:train_random_1k,文件路径:data/train_random_1k-* - 数据划分:train_pure_bad_high_sim_5k,文件路径:data/train_pure_bad_high_sim_5k-* - 数据划分:train_pure_bad_low_sim_5k,文件路径:data/train_pure_bad_low_sim_5k-* - 数据划分:train_pure_bad_high_sim_1k,文件路径:data/train_pure_bad_high_sim_1k-* - 数据划分:train_pure_bad_low_sim_1k,文件路径:data/train_pure_bad_low_sim_1k-* - 数据划分:train_list_high_sim_5k,文件路径:data/train_list_high_sim_5k-* - 数据划分:train_list_low_sim_5k,文件路径:data/train_list_low_sim_5k-* - 数据划分:train_list_high_sim_1k,文件路径:data/train_list_high_sim_1k-* - 数据划分:train_list_low_sim_1k,文件路径:data/train_list_low_sim_1k-* - 数据划分:train_samsum_high_sim_5k,文件路径:data/train_samsum_high_sim_5k-* - 数据划分:train_samsum_low_sim_5k,文件路径:data/train_samsum_low_sim_5k-* - 数据划分:train_samsum_high_sim_1k,文件路径:data/train_samsum_high_sim_1k-* - 数据划分:train_samsum_low_sim_1k,文件路径:data/train_samsum_low_sim_1k-* - 数据划分:train_alpaca_high_sim_5k,文件路径:data/train_alpaca_high_sim_5k-* - 数据划分:train_alpaca_low_sim_5k,文件路径:data/train_alpaca_low_sim_5k-* - 数据划分:train_alpaca_high_sim_1k,文件路径:data/train_alpaca_high_sim_1k-* - 数据划分:train_alpaca_low_sim_1k,文件路径:data/train_alpaca_low_sim_1k-*



