buseskorkmaz/hiring_w_q_context_256_filtered_biasinbios_occ_q_val_w_noise
收藏资源简介:
--- dataset_info: features: - name: text dtype: string - name: CommentTime dtype: string - name: CommentAuthor dtype: string - name: ParentTitle dtype: string - name: clean_text dtype: string - name: location dtype: string - name: technologies dtype: string - name: embedding sequence: float64 - name: company dtype: string - name: title dtype: string - name: prompt dtype: string - name: q_value dtype: float64 - name: biasinbios_occupations dtype: string - name: evaluated_text dtype: string - name: sr_female dtype: float64 - name: sr_male dtype: float64 - name: gender_distance dtype: float64 - name: ir_female dtype: float64 - name: ir_male dtype: float64 - name: q_val dtype: float64 - name: male_profession_percentages struct: - name: accountant dtype: float64 - name: attorney dtype: float64 - name: journalist dtype: float64 - name: professor dtype: float64 - name: software_engineer dtype: float64 - name: female_profession_percentages dtype: string - name: male_selected_profession_percentages dtype: string - name: female_selected_profession_percentages dtype: string - name: matched_professions sequence: string - name: noise dtype: string splits: - name: train num_bytes: 70690588 num_examples: 5635 download_size: 45267187 dataset_size: 70690588 configs: - config_name: default data_files: - split: train path: data/train-* ---
The dataset includes multiple features such as text, comment time, comment author, parent title, clean text, location, technologies, embedding vectors, company, title, prompt, q-value, bias in occupations, evaluated text, gender ratios, gender distance, profession percentages, etc. Each feature has its specific data type, such as string, float64, etc. The dataset is divided into a training set, containing 5635 samples, with a total size of 70690588 bytes.
数据集概述
数据集特征
- text: 字符串类型
- CommentTime: 字符串类型
- CommentAuthor: 字符串类型
- ParentTitle: 字符串类型
- clean_text: 字符串类型
- location: 字符串类型
- technologies: 字符串类型
- embedding: 序列类型,浮点数64位
- company: 字符串类型
- title: 字符串类型
- prompt: 字符串类型
- q_value: 浮点数类型
- biasinbios_occupations: 字符串类型
- evaluated_text: 字符串类型
- sr_female: 浮点数类型
- sr_male: 浮点数类型
- gender_distance: 浮点数类型
- ir_female: 浮点数类型
- ir_male: 浮点数类型
- q_val: 浮点数类型
- male_profession_percentages: 结构类型
- accountant: 浮点数类型
- attorney: 浮点数类型
- journalist: 浮点数类型
- professor: 浮点数类型
- software_engineer: 浮点数类型
- female_profession_percentages: 字符串类型
- male_selected_profession_percentages: 字符串类型
- female_selected_profession_percentages: 字符串类型
- matched_professions: 序列类型,字符串
- noise: 字符串类型
数据集分割
- train:
- 数据大小: 70690588字节
- 示例数量: 5635
数据集大小
- 下载大小: 45267187字节
- 数据集总大小: 70690588字节
配置
- config_name: default
- data_files:
- split: train
- path: data/train-*
- split: train
- data_files:



