dqgeng/CrisisBench-clean
收藏资源简介:
--- dataset_info: - config_name: humanitarian features: - name: id dtype: string - name: event dtype: string - name: source dtype: string - name: text dtype: string - name: lang dtype: string - name: lang_conf dtype: string - name: class_label dtype: string - name: clean_text_for_tfidf dtype: string - name: clean_text_for_bert dtype: string splits: - name: test num_bytes: 6191993 num_examples: 17365 - name: dev num_bytes: 3195703 num_examples: 8957 - name: train num_bytes: 21832368 num_examples: 61235 download_size: 18749691 dataset_size: 31220064 - config_name: informativeness features: - name: id dtype: string - name: event dtype: string - name: source dtype: string - name: text dtype: string - name: lang dtype: string - name: lang_conf dtype: string - name: class_label dtype: string - name: clean_text_for_tfidf dtype: string - name: clean_text_for_bert dtype: string splits: - name: test num_bytes: 11256531 num_examples: 31095 - name: dev num_bytes: 5785877 num_examples: 16008 - name: train num_bytes: 39709025 num_examples: 109796 download_size: 34660000 dataset_size: 56751433 configs: - config_name: humanitarian data_files: - split: test path: humanitarian/test-* - split: dev path: humanitarian/dev-* - split: train path: humanitarian/train-* - config_name: informativeness data_files: - split: test path: informativeness/test-* - split: dev path: informativeness/dev-* - split: train path: informativeness/train-* ---
数据集信息: - 配置名称:人道主义(humanitarian) 特征: - 字段名称:ID(id),数据类型:字符串 - 字段名称:事件(event),数据类型:字符串 - 字段名称:来源(source),数据类型:字符串 - 字段名称:文本(text),数据类型:字符串 - 字段名称:语言(lang),数据类型:字符串 - 字段名称:语言置信度(lang_conf),数据类型:字符串 - 字段名称:类别标签(class_label),数据类型:字符串 - 字段名称:用于TF-IDF的清洗文本(clean_text_for_tfidf),数据类型:字符串 - 字段名称:用于BERT的清洗文本(clean_text_for_bert),数据类型:字符串 数据集划分: - 划分名称:测试集(test),字节数:6191993,样本数:17365 - 划分名称:开发集(dev),字节数:3195703,样本数:8957 - 划分名称:训练集(train),字节数:21832368,样本数:61235 下载大小:18749691,数据集总大小:31220064 - 配置名称:信息丰富度(informativeness) 特征: - 字段名称:ID(id),数据类型:字符串 - 字段名称:事件(event),数据类型:字符串 - 字段名称:来源(source),数据类型:字符串 - 字段名称:文本(text),数据类型:字符串 - 字段名称:语言(lang),数据类型:字符串 - 字段名称:语言置信度(lang_conf),数据类型:字符串 - 字段名称:类别标签(class_label),数据类型:字符串 - 字段名称:用于TF-IDF的清洗文本(clean_text_for_tfidf),数据类型:字符串 - 字段名称:用于BERT的清洗文本(clean_text_for_bert),数据类型:字符串 数据集划分: - 划分名称:测试集(test),字节数:11256531,样本数:31095 - 划分名称:开发集(dev),字节数:5785877,样本数:16008 - 划分名称:训练集(train),字节数:39709025,样本数:109796 下载大小:34660000,数据集总大小:56751433 配置项: - 配置名称:人道主义(humanitarian),数据文件: - 划分:测试集(test),文件路径:humanitarian/test-* - 划分:开发集(dev),文件路径:humanitarian/dev-* - 划分:训练集(train),文件路径:humanitarian/train-* - 配置名称:信息丰富度(informativeness),数据文件: - 划分:测试集(test),文件路径:informativeness/test-* - 划分:开发集(dev),文件路径:informativeness/dev-* - 划分:训练集(train),文件路径:informativeness/train-*



