cultural-benchmark-annotations
收藏资源简介:
该数据集是一个用于评估文化相关基准测试或数据集的元分析数据集,系统收集了关于各类文化基准测试的元数据,旨在量化分析这些数据集在文化代表性、数据质量、标注实践、理论基础和透明度等方面的表现。它包含两个样本,每个样本由85个字段构成,涵盖核心维度:基准标识与引用信息、文化代表性指标(如语言、地理区域、方言等)、文化主题覆盖度(如价值观、宗教、社会规范等)、数据创建与处理流程、标注者相关信息、文化定义与理论基础、偏见意识与公平性以及透明度。数据集还包括大量评分字段,用于量化打分并计算总分,适用于研究文化数据集的质量评估、公平性审计、元分析以及促进AI领域更具文化包容性的数据实践。
This dataset is a meta-analytical resource designed for evaluating culture-related benchmarks or datasets. It systematically collects metadata across various cultural benchmarks, aiming to quantitatively assess their performance across dimensions including cultural representativeness, data quality, annotation practices, theoretical foundations and transparency. The dataset contains two samples, each composed of 85 fields covering core dimensions: benchmark identification and citation information, cultural representativeness metrics (e.g., language, geographic regions, dialects, etc.), cultural topic coverage (e.g., values, religion, social norms, etc.), data creation and processing workflows, annotator-related information, cultural definitions and theoretical foundations, bias awareness and fairness, and transparency. Additionally, the dataset includes numerous scoring fields for quantitative scoring and total score calculation, making it applicable to research on quality assessment of cultural datasets, fairness auditing, meta-analysis, and promoting culturally inclusive data practices in the AI field.
数据集概述
该数据集是一个用于评估自然语言处理基准测试中文化表示质量的标注数据集。
基本信息
- 数据集名称: cultural-benchmark-annotations
- 数据集规模: 包含2个训练样本,总大小为4823字节,下载大小为75356字节。
- 配置: 仅包含一个名为
default的默认配置。
数据结构
数据集中的每个样本包含大量特征,这些特征被组织成多个维度,用于评估基准测试的文化相关属性。主要特征类别包括:
- 基准测试元数据: 包括基准测试ID (
benchmark_id)、论文引用 (paper_citation)、时间戳 (timestamp_utc)。 - 语言与地理表示: 涵盖语言列表 (
rep_lang_languages_list)、大洲列表 (rep_continents_list)、国家列表 (rep_countries_list)、方言 (rep_dialects)、文字 (rep_scripts) 以及代表性不足的群体标记和列表 (rep_underserved_groups_flag,rep_underserved_groups_list)。 - 文化主题: 包含多个具体的文化主题维度及其评分,例如价值观 (
cult_values)、宗教 (cult_religion)、社会规范 (cult_social_norms)、叙事 (cult_narratives)、流行文化 (cult_popculture)、符号 (cult_symbols)、仪式 (cult_rituals)、服饰 (cult_clothing)、饮食常规 (cult_food_routines)、节日 (cult_holidays),以及主题数量、平衡性和来源信息。 - 数据来源与创建过程: 包括问题类型 (
data_question_types)、文档处理过程 (data_doc_process_documented)、数据创建模式和方法 (data_creation_mode,data_creation_methods)、数据源来源 (data_source_origin_documented)、数据过滤 (data_filtering_cleaned)、文化相关性过滤 (cultural_relevance_filter)。 - 标注者信息: 涉及标注者参与情况 (
annotators_involved)、选择标准、文化相关性、多样性维度、招聘渠道、报酬公平性及指南可用性等。 - 文化定义与偏差: 包含文化定义的存在与否和深度 (
culture_definition_exists,culture_definition_depth)、概念基础 (culture_conceptual_basis)、偏差意识与缓解措施 (bias_awareness,bias_mitigation_measures)、公平性与包容性报告 (fairness_inclusivity_reporting)。 - 评分与加分项:
- 原始评分:
raw_score,max_score,normalized_score。 - 地理覆盖评分: 基于语言 (
grambank_coverage)、位置 (location_differentiation)、大洲 (continent_count)、国家 (country_count)、地区 (regions)、方言 (dialect_points)、文字 (script_points) 等。 - 文化主题评分: 每个文化主题维度(如
cult_values_points,cult_religion_points等)都有独立的评分。 - 数据与标注过程评分: 针对数据创建、来源、过滤、质量控制、标注者招募、多样性等环节均有评分。
- 加权总分: 包括
weighted_total及六个维度的加权分数 (dim1_weighted至dim6_weighted)。
- 原始评分:
使用目的
该数据集主要用于对现有的自然语言处理基准测试进行文化表示质量的评估和评分,通过多维度指标量化基准测试在语言多样性、文化主题覆盖、数据创建流程、标注者背景等方面的表现。




