RiTA-nlp/UINAUIL
收藏资源简介:
--- license: cc-by-nc-sa-4.0 language: - it size_categories: - 1K<n<10K pretty_name: UINAUIL dataset_info: - config_name: haspeede2 features: - name: id dtype: int32 - name: full_text dtype: string - name: hs dtype: int16 - name: stereotype dtype: int16 - name: source dtype: string splits: - name: train num_examples: 6839 - name: test num_examples: 1763 - config_name: ironita features: - name: id dtype: string - name: text dtype: string - name: irony dtype: int8 - name: sarcasm dtype: int8 - name: topic dtype: string splits: - name: train num_examples: 3977 - name: test num_examples: 872 - config_name: sentipolc features: - name: twitterid dtype: string - name: text dtype: string - name: subj dtype: int8 - name: opos dtype: int8 - name: oneg dtype: int8 - name: iro dtype: int8 - name: lpos dtype: int8 - name: lneg dtype: int8 - name: top dtype: int8 splits: - name: train num_examples: 7410 - name: test num_examples: 2000 configs: - config_name: haspeede2 data_files: - split: train path: haspeede2/taskAB_development.tsv - split: test path: haspeede2/taskAB_reference_test.tsv - config_name: ironita data_files: - split: train path: ironita/train.tsv - split: test path: ironita/test.tsv - config_name: sentipolc data_files: - split: train path: sentipolc/train.tsv - split: test path: sentipolc/test.tsv ---
许可证:CC BY-NC-SA 4.0(知识共享署名-非商业性使用-相同方式共享4.0国际许可协议) 语言:意大利语 样本规模区间:1000 < 样本数量 < 10000 美观命名:UINAUIL 数据集信息如下: 1. 配置项haspeede2 特征字段包括: - 标识符(id):数据类型为int32(32位整数) - 完整文本(full_text):数据类型为string(字符串) - 仇恨言论标签(hs):数据类型为int16(16位整数) - 刻板印象标签(stereotype):数据类型为int16(16位整数) - 来源(source):数据类型为string(字符串) 数据集拆分: - 训练集:共6839条样本 - 测试集:共1763条样本 2. 配置项ironita 特征字段包括: - 标识符(id):数据类型为string(字符串) - 文本(text):数据类型为string(字符串) - 反讽标签(irony):数据类型为int8(8位整数) - 讽刺标签(sarcasm):数据类型为int8(8位整数) - 主题(topic):数据类型为string(字符串) 数据集拆分: - 训练集:共3977条样本 - 测试集:共872条样本 3. 配置项sentipolc 特征字段包括: - 推特标识符(twitterid):数据类型为string(字符串) - 文本(text):数据类型为string(字符串) - 主观性标签(subj):数据类型为int8(8位整数) - 正向子任务极性标签(opos):数据类型为int8(8位整数) - 负向子任务极性标签(oneg):数据类型为int8(8位整数) - 反讽标签(iro):数据类型为int8(8位整数) - 正向词级极性标签(lpos):数据类型为int8(8位整数) - 负向词级极性标签(lneg):数据类型为int8(8位整数) - 主题标签(top):数据类型为int8(8位整数) 数据集拆分: - 训练集:共7410条样本 - 测试集:共2000条样本 数据集配置对应数据文件路径如下: - 配置项haspeede2: 训练集数据路径:haspeede2/taskAB_development.tsv(制表符分隔值文件) 测试集数据路径:haspeede2/taskAB_reference_test.tsv(制表符分隔值文件) - 配置项ironita: 训练集数据路径:ironita/train.tsv(制表符分隔值文件) 测试集数据路径:ironita/test.tsv(制表符分隔值文件) - 配置项sentipolc: 训练集数据路径:sentipolc/train.tsv(制表符分隔值文件) 测试集数据路径:sentipolc/test.tsv(制表符分隔值文件)
数据集概述
基本信息
- 许可证: cc-by-nc-sa-4.0
- 语言: 意大利语 (it)
- 大小: 1K<n<10K
- 别名: UINAUIL
数据集配置
-
配置名称: haspeede2
- 特征:
- id: int32
- full_text: string
- hs: int16
- stereotype: int16
- source: string
- 分割:
- 训练集: 6839 样本
- 测试集: 1763 样本
- 数据文件:
- 训练集: haspeede2/taskAB_development.tsv
- 测试集: haspeede2/taskAB_reference_test.tsv
- 特征:
-
配置名称: ironita
- 特征:
- id: string
- text: string
- irony: int8
- sarcasm: int8
- topic: string
- 分割:
- 训练集: 3977 样本
- 测试集: 872 样本
- 数据文件:
- 训练集: ironita/train.tsv
- 测试集: ironita/test.tsv
- 特征:
-
配置名称: sentipolc
- 特征:
- twitterid: string
- text: string
- subj: int8
- opos: int8
- oneg: int8
- iro: int8
- lpos: int8
- lneg: int8
- top: int8
- 分割:
- 训练集: 7410 样本
- 测试集: 2000 样本
- 数据文件:
- 训练集: sentipolc/train.tsv
- 测试集: sentipolc/test.tsv
- 特征:



