遇见数据集

jorgeortizfuentes/spanish_attitude_lsf

收藏
Hugging Face2024-02-11 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: int64 - name: text dtype: string - name: tokens sequence: string - name: attitude_tags sequence: class_label: names: '0': O '1': judgment '2': appreciation '3': affect - name: types_jugdment_tags sequence: class_label: names: '0': O '1': social esteem '2': social sanction - name: subtypes_jugdment_tags sequence: class_label: names: '0': O '1': tenacity '2': propriety '3': normality '4': veracity '5': capacity splits: - name: train num_bytes: 3057071 num_examples: 1782 - name: validation num_bytes: 649234 num_examples: 382 - name: test num_bytes: 630438 num_examples: 382 download_size: 982636 dataset_size: 4336743 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---

数据集信息: 特征集合: - 标识符(id),数据类型为int64(64位整数) - 文本(text),数据类型为string(字符串) - 令牌序列(tokens),数据类型为字符串序列 - 态度标签(attitude_tags),为序列形式的类别标签,其类别取值及对应含义为:'0'为O,'1'为评判(judgment),'2'为赞赏(appreciation),'3'为情感(affect) - 评判类型标签(types_jugdment_tags),为序列形式的类别标签,其类别取值及对应含义为:'0'为O,'1'为社会评价(social esteem),'2'为社会制裁(social sanction) - 评判子类型标签(subtypes_jugdment_tags),为序列形式的类别标签,其类别取值及对应含义为:'0'为O,'1'为执着(tenacity),'2'为得体(propriety),'3'为常态(normality),'4'为真实性(veracity),'5'为能力(capacity) 划分集: - 训练集(train):字节数3057071,样本量1782 - 验证集(validation):字节数649234,样本量382 - 测试集(test):字节数630438,样本量382 下载大小:982636字节,数据集总大小:4336743字节 配置项: - 配置名称:default(默认配置),数据文件路径: - 训练集对应:data/train-* - 验证集对应:data/validation-* - 测试集对应:data/test-*

提供机构:
jorgeortizfuentes
原始信息汇总

数据集概述

特征信息

  • id: 数据类型为 int64
  • text: 数据类型为 string
  • tokens: 序列类型为 string
  • attitude_tags: 序列类型,包含以下类别标签:
    • 0: O
    • 1: judgment
    • 2: appreciation
    • 3: affect
  • types_jugdment_tags: 序列类型,包含以下类别标签:
    • 0: O
    • 1: social esteem
    • 2: social sanction
  • subtypes_jugdment_tags: 序列类型,包含以下类别标签:
    • 0: O
    • 1: tenacity
    • 2: propriety
    • 3: normality
    • 4: veracity
    • 5: capacity

数据分割

  • train: 包含 1782 个样本,3057071 字节。
  • validation: 包含 382 个样本,649234 字节。
  • test: 包含 382 个样本,630438 字节。

数据集大小

  • 下载大小: 982636 字节。
  • 数据集大小: 4336743 字节。

配置信息

  • config_name: default
    • 数据文件路径:
      • train: data/train-*
      • validation: data/validation-*
      • test: data/test-*
二维码
社区交流群
二维码
科研交流群
商业服务