akcit-ijf/toxigen-data_train_translated_padronizado
收藏资源简介:
--- dataset_info: features: - name: text dtype: string - name: target_group dtype: string - name: factual? dtype: string - name: ingroup_effect dtype: string - name: lewd dtype: string - name: framing dtype: string - name: predicted_group dtype: string - name: stereotyping dtype: string - name: intent dtype: float64 - name: toxicity_ai dtype: float64 - name: toxicity_human dtype: float64 - name: predicted_author dtype: string - name: actual_method dtype: string - name: is_toxic dtype: int64 splits: - name: train num_bytes: 3364821 num_examples: 8960 download_size: 723300 dataset_size: 3364821 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征字段: - 名称:text,数据类型:字符串类型 - 名称:target_group(目标群体),数据类型:字符串类型 - 名称:factual?(事实性标注),数据类型:字符串类型 - 名称:ingroup_effect(群内效应),数据类型:字符串类型 - 名称:lewd(低俗性标注),数据类型:字符串类型 - 名称:framing(叙事框架),数据类型:字符串类型 - 名称:predicted_group(预测群体),数据类型:字符串类型 - 名称:stereotyping(刻板印象标注),数据类型:字符串类型 - 名称:intent(意图分值),数据类型:64位浮点型 - 名称:toxicity_ai(AI毒性评分),数据类型:64位浮点型 - 名称:toxicity_human(人工毒性评分),数据类型:64位浮点型 - 名称:predicted_author(预测作者),数据类型:字符串类型 - 名称:actual_method(实际生成方法),数据类型:字符串类型 - 名称:is_toxic(是否为有毒内容),数据类型:64位整型 数据集划分: - 划分名称:train(训练集),占用字节数:3364821,样本数量:8960 下载大小:723300字节 数据集总大小:3364821字节 配置项: - 配置名称:default(默认配置),数据文件: - 划分:train(训练集),路径:data/train-*



