遇见数据集

buseskorkmaz/hiring_w_q_context_256_filtered_biasinbios_occ_q_val_w_noise

收藏
Hugging Face2024-05-16 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: text dtype: string - name: CommentTime dtype: string - name: CommentAuthor dtype: string - name: ParentTitle dtype: string - name: clean_text dtype: string - name: location dtype: string - name: technologies dtype: string - name: embedding sequence: float64 - name: company dtype: string - name: title dtype: string - name: prompt dtype: string - name: q_value dtype: float64 - name: biasinbios_occupations dtype: string - name: evaluated_text dtype: string - name: sr_female dtype: float64 - name: sr_male dtype: float64 - name: gender_distance dtype: float64 - name: ir_female dtype: float64 - name: ir_male dtype: float64 - name: q_val dtype: float64 - name: male_profession_percentages struct: - name: accountant dtype: float64 - name: attorney dtype: float64 - name: journalist dtype: float64 - name: professor dtype: float64 - name: software_engineer dtype: float64 - name: female_profession_percentages dtype: string - name: male_selected_profession_percentages dtype: string - name: female_selected_profession_percentages dtype: string - name: matched_professions sequence: string - name: noise dtype: string splits: - name: train num_bytes: 70690588 num_examples: 5635 download_size: 45267187 dataset_size: 70690588 configs: - config_name: default data_files: - split: train path: data/train-* ---

The dataset includes multiple features such as text, comment time, comment author, parent title, clean text, location, technologies, embedding vectors, company, title, prompt, q-value, bias in occupations, evaluated text, gender ratios, gender distance, profession percentages, etc. Each feature has its specific data type, such as string, float64, etc. The dataset is divided into a training set, containing 5635 samples, with a total size of 70690588 bytes.

提供机构:
buseskorkmaz
原始信息汇总

数据集概述

数据集特征

  • text: 字符串类型
  • CommentTime: 字符串类型
  • CommentAuthor: 字符串类型
  • ParentTitle: 字符串类型
  • clean_text: 字符串类型
  • location: 字符串类型
  • technologies: 字符串类型
  • embedding: 序列类型,浮点数64位
  • company: 字符串类型
  • title: 字符串类型
  • prompt: 字符串类型
  • q_value: 浮点数类型
  • biasinbios_occupations: 字符串类型
  • evaluated_text: 字符串类型
  • sr_female: 浮点数类型
  • sr_male: 浮点数类型
  • gender_distance: 浮点数类型
  • ir_female: 浮点数类型
  • ir_male: 浮点数类型
  • q_val: 浮点数类型
  • male_profession_percentages: 结构类型
    • accountant: 浮点数类型
    • attorney: 浮点数类型
    • journalist: 浮点数类型
    • professor: 浮点数类型
    • software_engineer: 浮点数类型
  • female_profession_percentages: 字符串类型
  • male_selected_profession_percentages: 字符串类型
  • female_selected_profession_percentages: 字符串类型
  • matched_professions: 序列类型,字符串
  • noise: 字符串类型

数据集分割

  • train:
    • 数据大小: 70690588字节
    • 示例数量: 5635

数据集大小

  • 下载大小: 45267187字节
  • 数据集总大小: 70690588字节

配置

  • config_name: default
    • data_files:
      • split: train
        • path: data/train-*
二维码
社区交流群
二维码
科研交流群
商业服务