monology/jigsaw_test_pred
收藏资源简介:
--- dataset_info: features: - name: comment_text dtype: string - name: toxic dtype: class_label: names: '0': 'false' '1': 'true' - name: severe_toxic dtype: class_label: names: '0': 'false' '1': 'true' - name: obscene dtype: class_label: names: '0': 'false' '1': 'true' - name: threat dtype: class_label: names: '0': 'false' '1': 'true' - name: insult dtype: class_label: names: '0': 'false' '1': 'true' - name: identity_hate dtype: class_label: names: '0': 'false' '1': 'true' - name: prediction_hate dtype: float64 - name: prediction_nsfw dtype: float64 splits: - name: test num_bytes: 29265611 num_examples: 63978 download_size: 17145033 dataset_size: 29265611 configs: - config_name: default data_files: - split: test path: data/test-* ---
数据集信息: 特征字段: - 评论文本(comment_text):数据类型为字符串 - 恶意(toxic):数据类型为分类标签(class_label),类别映射为:'0'对应"否(false)",'1'对应"是(true)" - 严重恶意(severe_toxic):数据类型为分类标签(class_label),类别映射为:'0'对应"否(false)",'1'对应"是(true)" - 淫秽(obscene):数据类型为分类标签(class_label),类别映射为:'0'对应"否(false)",'1'对应"是(true)" - 威胁(threat):数据类型为分类标签(class_label),类别映射为:'0'对应"否(false)",'1'对应"是(true)" - 侮辱(insult):数据类型为分类标签(class_label),类别映射为:'0'对应"否(false)",'1'对应"是(true)" - 身份仇恨(identity_hate):数据类型为分类标签(class_label),类别映射为:'0'对应"否(false)",'1'对应"是(true)" - 仇恨预测得分(prediction_hate):数据类型为float64 - 不适内容预测得分(prediction_nsfw):数据类型为float64 数据集划分: - 测试集(test):占用字节数为29265611,样本总量为63978 下载大小:17145033字节 数据集总大小:29265611字节 配置项: - 默认配置(default):数据文件配置为:测试集划分对应的数据文件路径为 data/test-*
数据集概述
特征信息
- comment_text: 类型为字符串。
- toxic: 类型为类别标签,标签名称为 false 和 true。
- severe_toxic: 类型为类别标签,标签名称为 false 和 true。
- obscene: 类型为类别标签,标签名称为 false 和 true。
- threat: 类型为类别标签,标签名称为 false 和 true。
- insult: 类型为类别标签,标签名称为 false 和 true。
- identity_hate: 类型为类别标签,标签名称为 false 和 true。
- prediction_hate: 类型为浮点数。
- prediction_nsfw: 类型为浮点数。
数据分割
- test: 包含 63978 个样本,总字节数为 29265611。
数据集大小
- 下载大小: 17145033 字节。
- 数据集大小: 29265611 字节。
配置信息
- default: 包含测试数据文件,路径为
data/test-*。



