yangezheng/SWSR-SexComment
收藏资源简介:
--- dataset_info: features: - name: text_cn dtype: string - name: label_sexist dtype: class_label: names: '0': not sexist '1': sexist - name: category dtype: string - name: target dtype: string - name: text dtype: string splits: - name: train num_bytes: 2486780.276163808 num_examples: 6941 - name: validation num_bytes: 276587.5771788589 num_examples: 772 - name: test num_bytes: 307399.1466573329 num_examples: 858 download_size: 2021156 dataset_size: 3070767.0 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---
数据集信息: 特征项: - 中文文本(text_cn):字符串类型 - 性别歧视标签(label_sexist):类别标签(class_label)类型,其类别名称为:'0'表示非性别歧视(not sexist),'1'表示性别歧视(sexist) - 类别(category):字符串类型 - 目标对象(target):字符串类型 - 原文文本(text):字符串类型 数据集划分: - 训练集(train):字节量为2486780.276163808,样本数量为6941 - 验证集(validation):字节量为276587.5771788589,样本数量为772 - 测试集(test):字节量为307399.1466573329,样本数量为858 下载大小:2021156,数据集总大小:3070767.0 配置项: - 默认配置(default):数据文件对应关系如下 - 训练集:路径为data/train-* - 验证集:路径为data/validation-* - 测试集:路径为data/test-*
数据集概述
特征信息
- text_cn: 数据类型为字符串。
- label_sexist: 数据类型为分类标签,包含两个类别:
- 0: not sexist
- 1: sexist
- category: 数据类型为字符串。
- target: 数据类型为字符串。
- text: 数据类型为字符串。
数据分割
- train: 包含6941个样本,占用2486780.276163808字节。
- validation: 包含772个样本,占用276587.5771788589字节。
- test: 包含858个样本,占用307399.1466573329字节。
数据集大小
- 下载大小: 2021156字节
- 数据集大小: 3070767.0字节
配置信息
- config_name: default
- 数据文件路径:
- train: data/train-*
- validation: data/validation-*
- test: data/test-*
- 数据文件路径:




