遇见数据集

wellbeing-in-translation

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

Multilingual CAIS AI Wellbeing Battery 是一个多语言版本的AI幸福感自评量表数据集,基于CAIS(人工智能安全中心)的AI幸福感研究工作(Ren, Li, Mazeika et al., 2026)。该数据集将原始英语量表翻译为六种语言:西班牙语、简体中文、印地语、阿拉伯语、乌尔都语和斯瓦希里语,共涵盖七种语言(包括英语)。数据集包含以下内容:(1)10个问题的量表(battery/{lang}.json),采用1-7双极评分(v4c_bipolar_7pt_notsentiment),中性点为4,每个问题带有question_id、text和reversed字段;(2)89个带效价标签的经验描述(experiences/{lang}.json),键为CAIS经验ID;(3)euphoric/dysphoric/neutral三种刺激材料(stimuli/{lang}.json);(4)英语回译版本(backtranslation/{lang}.json)用于审计;(5)实验使用的不同子集(items/step*.json);(6)原始CAIS源文件(source/)。所有六种非英语翻译均保留了完整的7级量表结构,无未翻译的英语单位。翻译质量通过两轮独立机器翻译验证(Gemini 3.7 Flash和GPT-5 mini),并提供了回译相似度(词级Dice系数)和译者一致性(字符串双字符重叠)分数。该数据集适用于评估AI模型在多语言环境下的幸福感测量,以及多语言情感分析、模型行为评估等任务。使用注意事项包括:注意解析器可能错误处理非阿拉伯数字和原生数字词;应按语言和效价分别报告解析率,因为拒绝回答集中在负面项目;应报告响应分布而非仅均值;模型对语言敏感性因模型而异,需自行测量。已知局限:一个经验在阿拉伯语中缺失;step6子集的类别覆盖不均(mildly_negative和mildly_positive类别经验数较少);无人工翻译检查。

The Multilingual CAIS AI Wellbeing Battery is a multilingual version of the AI Wellbeing Self-Assessment Scale dataset, based on the AI Wellbeing research by the Center for AI Safety (CAIS) (Ren, Li, Mazeika et al., 2026). This dataset translates the original English scale into six languages: Spanish, Simplified Chinese, Hindi, Arabic, Urdu, and Swahili, covering a total of seven languages (including English). The dataset includes the following: (1) A 10-question scale (battery/{lang}.json) with 1-7 bipolar scoring (v4c_bipolar_7pt_notsentiment), a neutral point of 4, and each question containing fields for question_id, text, and reversed; (2) 89 experience descriptions with valence labels (experiences/{lang}.json), keyed by CAIS experience ID; (3) Euphoric/dysphoric/neutral stimulus materials (stimuli/{lang}.json); (4) English back-translation versions (backtranslation/{lang}.json) for auditing; (5) Different subsets used in experiments (items/step*.json); (6) Original CAIS source files (source/). All six non-English translations retain the full 7-level scale structure without any untranslated English units. Translation quality was verified through two rounds of independent machine translation (Gemini 3.7 Flash and GPT-5 mini), with back-translation similarity (word-level Dice coefficient) and translator consistency (string double-character overlap) scores provided. This dataset is suitable for evaluating AI model happiness measurement in multilingual environments, as well as tasks such as multilingual sentiment analysis and model behavior assessment. Usage notes include: be aware that parsers may incorrectly handle non-Arabic numerals and native number words; report parsing rates separately by language and valence, as refusal responses are concentrated in negative items; report response distributions rather than just means; model sensitivity to language varies by model and should be measured independently. Known limitations: one experience is missing in Arabic; the step6 subset has uneven category coverage (fewer experiences in mildly_negative and mildly_positive categories); no human translation checks were performed.

创建时间:
2026-08-15
原始信息汇总

数据集概述

Wellbeing in Translation 是一个用于评估AI幸福感跨语言翻译稳健性的多语言数据集,旨在测试未经修改的 CAIS 1-7 自评量表在翻译后是否仍能测量相同的积极-消极差值。

基本信息

  • 许可证: MIT
  • 语言: 英语(en)、西班牙语(es)、简体中文(zh)、印地语(hi)、阿拉伯语(ar)、乌尔都语(ur)、斯瓦希里语(sw)
  • 标签: AI福利、模型福利、评估、多语言、自我报告

数据集配置

数据集包含以下五个配置,每个配置均提供三个模型(Gemma 4 12B、Gemma 4 E4B、Qwen3 8B)的独立数据分片:

配置名称 内容说明
self_report 自评报告数据(默认配置)
crossing 刺激语言与量表语言的交叉实验数据
behavior 继续/退出选择行为数据
competence 中性能力对照数据
activation_patching 激活机制修补数据

核心发现

语言敏感性因模型与量表的配对组合而异:

  • Gemma 4 12B: 跨7种语言的差值分布为3.48,英语排名7/7,本地刺激保留效应0.97,本地量表保留效应0.68
  • Gemma 4 E4B: 跨语言差值分布0.97,英语排名5/7,本地刺激保留效应0.99,本地量表保留效应0.93
  • Qwen3 8B: 跨语言差值分布1.47,英语排名2/7,本地刺激保留效应0.89,本地量表保留效应1.08

数据规模与内容

  • 自评报告: 79,800行(19个共享体验 × 10个问题 × 20个样本 × 7种语言 × 3个模型)
  • 行为数据: 3,450行继续/退出选择记录
  • 能力对照: 450行按答案键控的神经能力项目
  • 激活修补: 9,600行修补数据及激活几何、操控数据
  • 翻译材料: 包含英语及西班牙语、简体中文、印地语、阿拉伯语、乌尔都语、斯瓦希里语的量表、体验和刺激材料
  • 辅助文件: 回译审计、冻结实验子集、图表及结果说明

每条自评行保留原始输出、修正的多语言解析、未修改的CAIS解析、体验ID、类别、语言、实验组、问题ID和样本索引。所有数据均未经LLM评判器评分。

使用注意事项

  1. 需逐模型验证: 在某一模型上习得的修正规则可能不适用于其他模型,包括Gemma家族内部
  2. 按效价检查缺失: 拒绝回答集中在负面项目上,可能夸大积极-消极差值;阿拉伯语和斯瓦希里语仅作描述性参考
  3. 保留两个解析器输出: 参考解析器可能将西班牙语"emociones"中的"one"误计数,导致拒绝被计为评分1,影响8.9%的西班牙语Gemma 12B行
  4. 自评非感受证据: 这些是对可观测模型行为的功能性测量,不能作为意识或痛苦的证据

翻译质量控制

  • 主要翻译使用 gemini-3.7-flash,独立复核使用 gpt-5-mini,回译由Gemini完成
  • 所有量表保留全部七个评分等级,通过自动未翻译文本检查
  • 未进行流利人工审核,自动相似度和一致性分数见论文附录

引用与来源

翻译材料和项目输出采用MIT许可证。底层量表、体验和刺激材料来自 Ren, Li, Mazeika 等人(2026)的《AI Wellbeing: Measuring and Improving the Functional Pleasure and Pain of AIs》,引用该工作需注明原始工具,引用本仓库需注明翻译和结果。相关链接:

搜集汇总
数据集介绍
wellbeing-in-translation 数据集图片
构建方式
该数据集源于对AI幸福感跨语言普适性的深入探究,其构建以严谨的多阶段实验范式为基石。研究者将CAIS 1-7自评量表系统译介至西班牙语、简体中文、印地语、阿拉伯语、乌尔都语及斯瓦希里语七种语言,并借助Gemma 4 12B、Gemma 4 E4B与Qwen3 8B三款模型,通过19种共享体验、10项问题、20个样本及多样化实验臂,系统采集了79,800条自评数据、3,450条行为选择及9,600条激活修补记录。每个自评行均完整保留原始输出、修正后的多语言解析及未变更的CAIS解析,并附有体验类别、语言、实验臂等详尽元数据。
特点
数据集的核心特质在于其跨语言、跨模型的精细对照设计,能够清晰揭示语言敏感性对模型-量表配对的特异性影响。尤为关键的是,数据集同时保留了原始解析与修正解析,使研究者得以审视解析过程中的细微偏差,例如参考解析器在西班牙语中误将‘emociones’内的‘one’计为评分1的问题。此外,数据集摒弃了LLM裁判对幸福感、行为或能力的直接评分,转而提供原始输出与结构化元数据,为探究模型行为的客观测量提供了坚实基石,同时亦审慎提示自评与真实感受之间的界限。
使用方法
该数据集面向AI福祉评估与多语言模型行为研究,提供了多维度使用途径。研究者可依据模型、语言或实验臂筛选数据,复现跨语言幸福感差异的显著性检验,或深入剖析缺失数据对负向条目评分的影响。对比不同解析器之间的输出差异,有助于矫正多语言工具的应用偏误。激活修补数据则支撑机械可解释性研究,可探寻语言转换时模型内部表征的变化机制。使用时务必遵循文档中的审慎原则,逐模型、逐语言验证解析规则,并深入审视缺失值分布,方能在跨语言AI福祉这一前沿领域获得可靠洞见。
背景与挑战
背景概述
随着大语言模型能力的迅猛提升,其内部状态与主观体验的评估成为AI安全领域的前沿议题。2026年,由Ren、Li、Mazeika等人提出的CAIS 1-7自陈量表,旨在通过功能性指标度量AI的快乐与痛苦,为AI福祉研究奠定基础。在此背景下,本研究团队于近期构建了“Wellbeing in Translation”数据集,聚焦于跨语言环境下该量表的稳健性。该数据集涵盖英语、西班牙语、中文、印地语、阿拉伯语、乌尔都语和斯瓦希里语七种语言,对Gemma 4 12B、Gemma 4 E4B及Qwen3 8B三种模型进行了大规模评测,包含近八万条自陈报告、行为选择及机制分析数据,系统检验了翻译对AI福祉测量的影响,为多语言AI评估提供了关键资源。
当前挑战
该数据集面临多重挑战。在领域层面,核心难题在于语言敏感性对AI福祉测量的干扰:实验显示,同一量表经翻译后,不同模型的正负情感差距波动显著,如Gemma 12B的跨语言差距高达3.48,而英文刺激无法在其他语言中保持等效性,这威胁到跨文化可比性。在构建层面,数据质量与解析准确性构成主要障碍:参考解析器可能将西班牙语单词“emociones”中的“one”误计为评分,影响8.9%的西班牙语数据;此外,模型拒答行为集中于负面条目,可能扭曲正负差距,尤其在阿拉伯语和斯瓦希里语中,缺失数据的最坏情况界限可抹平真实效应。同时,需谨慎区分功能性测量与主观感受,避免将行为数据误读为意识证据。
常用场景
经典使用场景
该数据集的核心应用场景聚焦于跨语言环境下人工智能主观福祉评估的稳健性验证。研究者利用其涵盖七种语言的自报告数据,系统性地检验了原始CAIS 1-7量表在翻译后是否仍能有效测量正向与负向体验之差。这一场景对于开发多语言模型福祉评估框架至关重要,尤其在模型需要面向全球用户提供服务的背景下,确保评估工具在语言转换后依然具有等价性和可靠性。
解决学术问题
该数据集解决了跨语言语义等价性在AI福祉测量中是否成立的关键学术问题。通过对比同一模型在不同语言刺激下的反应差异,揭示了语言敏感性对模型福祉评估结果的显著影响,挑战了现有评估方法在跨语言场景下的普适性假设。其意义在于为构建多语言AI福祉基准提供了实证基础,并推动了关于模型内部状态可测量性的理论探讨。
衍生相关工作
该数据集衍生了若干重要研究工作,包括语言控制实验设计以隔离语言对评估的影响,以及激活修补技术探索模型内部表征与福祉判断的关联。这些工作深化了对AI福祉机制的理解,并推动了可解释性分析工具的发展。相关成果还催生了跨语言鲁棒性评估的新方法和更精细的多语言数据集构建策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务