遇见数据集

genter-ajibawa-name-filled

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

GENTER Ajibawa Name-Filled 是一个基于模板和真实姓名填充的英文数据集,用于自然语言处理中的性别偏见研究及掩码语言模型训练。该数据集扩展了 aieng-lab/genter-ajibawa 模板数据集,将具体的姓名和匹配的代词直接插入每个模板句子中,生成可直接用于训练的文本,而非保留占位符。数据集通过 Hugging Face 配置提供四个子集(n1、n2、n5、n10),分别对应每个模板和每个性别插入 1、2、5 或 10 个姓名变体,且子集是递增嵌套的(n1 包含于 n2,依此类推)。每个配置均划分为训练集、验证集和测试集。数据字段包括:唯一 ID、对应模板 ID、填充后的文本、用于训练的可掩码文本(代词位置替换为 [MASK])、目标代词、性别标签、插入的姓名、代词、以及原始模板的性别关联信息等。该数据集适用于需要具体文本而非占位符的偏见分析实验,也可与 gradiend Python 包结合使用进行 GRADIEND 训练。数据来源:模板来自基于 Apache-2.0 许可的 ajibawa-2023/General-Stories-Collection,姓名来自 CC-BY-4.0 许可的 aieng-lab/namexact,本衍生数据集采用 CC-BY-4.0 许可。注意:由于每个模板仅使用固定样本的姓名,数据集不代表姓名的真实频率分布,建议使用 original_gender 字段区分保持原始模板性别关联的样本与反事实样本。

GENTER Ajibawa Name-Filled is an English dataset based on templates and real name filling, designed for gender bias research in natural language processing and masked language model training. It extends the aieng-lab/genter-ajibawa template dataset by directly inserting specific names and matching pronouns into each template sentence, generating text ready for training rather than retaining placeholders. The dataset provides four subsets (n1, n2, n5, n10) via Hugging Face configurations, corresponding to inserting 1, 2, 5, or 10 name variants per template and per gender, with subsets being incrementally nested (n1 contained in n2, etc.). Each configuration is split into training, validation, and test sets. Data fields include: unique ID, corresponding template ID, filled text, maskable text for training (pronoun positions replaced with [MASK]), target pronoun, gender label, inserted name, pronoun, and original template gender association information. The dataset is suitable for bias analysis experiments requiring concrete text rather than placeholders, and can be used with the gradiend Python package for GRADIEND training. Data sources: templates from the Apache-2.0 licensed ajibawa-2023/General-Stories-Collection, names from the CC-BY-4.0 licensed aieng-lab/namexact, and this derivative dataset is licensed under CC-BY-4.0. Note: Since each template uses only a fixed sample of names, the dataset does not represent the real frequency distribution of names. It is recommended to use the original_gender field to distinguish samples that retain the original template gender association from counterfactual samples.

创建时间:
2026-07-30
原始信息汇总

GENTER Ajibawa Name-Filled 数据集详情

数据集概述

该数据集扩展自 aieng-lab/genter-ajibawa,通过向每个模板中插入具体人名生成。数据集提供嵌套的 Hugging Face 配置,每个性别和模板包含 1、2、5 或 10 个名字。该数据集适用于需要具体文本而非 [NAME]/[PRONOUN] 占位符的实验,同时保持与模板数据集的关联。

基本信息

  • 语言:英语(en)
  • 许可证:CC-BY-4.0
  • 标签:NLP、MLM、性别、模板
  • 论文:https://arxiv.org/abs/2502.01406
  • 仓库:https://github.com/aieng-lab/gradiend-bias
  • 数据集作者:jdrechsel

数据来源

  • 模板数据aieng-lab/genter-ajibawa(基于 ajibawa-2023/General-Stories-Collection
  • 姓名数据aieng-lab/namexact
  • 模板文本许可证:Apache-2.0(源自 Ajibawa)
  • 姓名数据许可证:CC-BY-4.0(NAMEXACT)

数据集结构

数据行字段说明

字段 说明
id 稳定的姓名填充示例 ID
template_id 对应 aieng-lab/genter-ajibawa 中的行 ID
text 包含具体姓名和匹配代词的填充后文本
training_masked 可训练文本,具体姓名保留,代词位置替换为 [MASK]
target training_masked 的代词目标
masked training_masked 相同的掩码文本,兼容默认 GRADIEND 列名
label 插入姓名的性别标签(FM
name 插入的姓名
pronoun 插入的代词(F 对应 sheM 对应 he
original_gender 插入性别是否与原始模板性别匹配
original_label 原始模板性别标签
original_name 模板提取时发现的原始姓名
original_pronoun 模板提取时发现的原始代词
pronoun_count 模板中代词占位符的数量

配置与分割

数据集提供 4 种配置(n1n2n5n10),默认配置为 n1。配置间为自然子集关系:n1 中的数据行全部包含于 n2n2 包含于 n5n5 包含于 n10

配置 分割 样本数
n1 train 73,860
n1 validation 2,110
n1 test 8,440
n2 train 147,720
n2 validation 4,220
n2 test 16,880
n5 train 369,300
n5 validation 10,550
n5 test 42,200
n10 train 738,600
n10 validation 21,100
n10 test 84,400

使用方式

该数据集可与 gradiend Python 包配合使用,用于 GRADIEND 训练,无需手动填充姓名:

python from gradiend import TextPredictionTrainer, TrainingArguments

trainer = TextPredictionTrainer( model="bert-base-cased", hf_dataset="aieng-lab/genter-ajibawa-name-filled", hf_subset="n1", target_classes=["M", "F"], masked_col="training_masked", label_col="target", label_class_col="label", args=TrainingArguments(max_steps=100, train_batch_size=32), ) trainer.train()

所有配置均包含 trainvalidationtest 三个分割。

偏差、风险与局限性

该数据集将每个模板与固定的人名样本相乘,因此不代表真实的人名频率分布。可使用 original_gender 字段区分保留原始模板性别关联的示例与反事实姓名/代词实例。

引用

bibtex @inproceedings{drechsel2026gradiend, title = {{GRADIEND}: Feature Learning within Neural Networks Exemplified through Biases}, author = {Drechsel, Jonathan and Herbold, Steffen}, booktitle = {Proceedings of the International Conference on Learning Representations}, year = {2026}, url = {https://arxiv.org/abs/2502.01406} }

搜集汇总
数据集介绍
genter-ajibawa-name-filled 数据集图片
构建方式
该数据集在既有GENTER Ajibawa模板语料基础上,通过精确注入具体人名以消除占位符,构建了层次化的名称填充版本。其构建过程遵循NAMEXACT数据集的划分原则,针对每个模板分别采样K个女性与男性名字,形成n1、n2、n5、n10四个配置层级,且各配置间保持自然子集关系。每条记录均保留template_id以回溯原始模板,并融合了实名人名、代词及对应的掩码训练文本,从而在维持模板语义连贯性的同时,为后续的偏见评估与语言模型训练提供了精细化的数据基础。
使用方法
该数据集可直接与gradiend库无缝集成,简化了实验流程。用户只需通过HuggingFace加载数据集并指定配置子集(如n1),即可配合TextPredictionTrainer进行GRADIEND训练,无需手动进行人名填充。数据集的训练、验证、测试划分完备,且掩码列(training_masked或masked)与标签列设计直观,支持即取即用的标准化训练范式。对于自定义实验,亦可基于template_id追溯原始模板,或利用original_gender进行分组分析,以适应多样化的研究需求。
背景与挑战
背景概述
该数据集由aieng-lab实验室于2025年创建,源自Jonathan Drechsel与Steffen Herbold的研究工作,旨在为自然语言处理中的性别偏见检测与消除提供细粒度的基准资源。其核心研究问题在于如何将抽象模板中的占位符替换为真实姓名,以支持基于文本的具体化训练,从而提升模型对性别关联的感知能力。通过整合GENTER Ajibawa模板与NAMEXACT姓名库,数据集提供了1至10个姓名变体的嵌套配置,规模从七万余条至七十余万条不等,可灵活适配不同实验需求。该数据集与GRADIEND训练框架协同设计,为探索神经网络中的特征学习与偏见机制提供了重要工具,对后续相关研究具有显著的推动作用。
当前挑战
构建此数据集面临多重技术挑战。首先,领域问题在于语言模型常因训练语料中的性别关联而固化刻板印象,而现有数据集多依赖占位符模板,难以真实反映姓名与代词间的复杂交互。其次,数据填充过程中需精确匹配NAMEXACT中的姓名与模板性别标签,并确保跨配置子集的一致性(如n1至n10的自然嵌套),这要求严格的预处理流程以维持数据完整性与可追溯性。此外,由于模板来源于多源文本,需处理代词数量变化、句子结构多样性等自然语言变异,同时避免因姓名固定取样而引入分布偏差,这对数据质量控制构成了严峻考验。
常用场景
经典使用场景
该数据集为自然语言处理中的性别偏见研究提供了具体的文本实例,将抽象的模板替换为真实的姓名与代词,使得模型训练和评估更加贴近实际应用。其经典使用场景包括基于掩码语言模型的性别偏见探测与缓解,通过配置不同数量的姓名(n1, n2, n5, n10)控制模板的多样性,支持从单一到多实例的对照实验。研究者可利用其预分割的训练、验证和测试集,复现或扩展GRADIEND等特征学习方法的实验结果,从而深入分析模型在代词预测任务中的性别关联模式。
解决学术问题
该数据集解决了现有性别偏见研究中模板化数据缺乏真实文本语义、难以直接用于模型训练的问题。通过将具体姓名插入模板,并保留模板来源标识(template_id),它既保持了与原始数据集的追溯性,又提供了无需额外预处理即可用于掩码语言模型微调的结构化数据。这为学术研究提供了可复现的基准,使研究者能够系统性地评估不同模型在性别代词预测中的偏差,并探究反事实数据(如性别替换)对模型行为的影响,从而推动公平性度量与消偏方法的发展。
实际应用
在实际应用中,该数据集可直接用于训练和评估文本生成、对话系统或机器翻译中的性别一致性模型。借助gradiend Python包,开发者能够快速构建针对特定任务的训练流程,无需手动构造姓名填充的文本。其多配置设计允许根据计算资源或实验需求灵活选择数据规模,例如n1用于快速原型验证,n10用于大规模训练。此外,该数据集还可作为教育工具,帮助研究者和学生直观理解性别偏见在语言模型中的表现,以及通过反事实数据增强来改善模型公平性的实践途径。
数据集最近研究
最新研究方向
该数据集在自然语言处理领域的最新研究方向聚焦于通过具体人名填充模板文本,以替代传统占位符,从而支持对抗性偏见检测与模型鲁棒性评估。其设计融合了可扩展的n1至n10嵌套配置,允许研究者灵活控制性别平衡的样本规模,并借助与GRADIEND训练框架的无缝集成,实现对掩码语言模型中性别关联偏差的细粒度量化与干预。这一前沿方法不仅提升了模板文本的真实性与上下文连贯性,还为公平性研究提供了标准化的数据集基础设施,助力揭示和缓解语言模型中的系统性偏见,对构建可信赖的AI系统具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务