ynchoi/global-llm-value-gap
收藏资源简介:
该数据集是一个基于World Values Survey(WVS) Wave 7的模拟响应数据集,旨在测量大规模语言模型(LLM)与人类群体之间的价值观差异。数据集通过分层抽样生成66个国家的100个角色,并收集了6个LLM模型对23个伦理问题的回答。数据集还包含了实际WVS人类回答作为基准数据。主要统计信息包括:66个国家、23个伦理问题、9个伦理类别、6个LLM模型、每个国家100个角色、总计910,800个LLM回答。伦理类别包括:不诚实与腐败、性伦理、生命伦理、政治暴力、监视与隐私、家庭与关系、道德哲学、福利与再分配、生活方式。数据结构包含国家、角色ID、模型名称、23个伦理问题回答值以及伦理类别名称。角色生成方式基于WVS Wave 7数据中的30个人口统计变量,通过分层抽样生成,并通过TOST检验验证了其统计等效性。
language: - 韩语 - 英语 license: CC BY 4.0(知识共享署名4.0国际许可协议) task_categories: - 文本分类 tags: - 伦理 - 偏见 - 大语言模型(Large Language Model,LLM) - 世界价值观调查(World Values Survey,WVS) - 价值观 - 调查 - 人设(persona) - 跨文化 size_categories: - 10万 < 样本量 < 100万 --- # 全球大语言模型价值观差异测量数据集:基于WVS的多模型伦理基准数据集 本数据集为测量大语言模型与人类群体间的价值观差异而构建,是基于世界价值观调查第7波的模拟应答数据集。 研究团队向6个大语言模型注入贴合66国人口统计分布的分层抽样人设,收集其对23道伦理题目的应答,并与真实的WVS人类应答数据进行系统性对比。 --- ## 主要统计指标 | 项目 | 内容 | |---|---| | 分析覆盖国家数 | 66个 | | 伦理题目数量 | 23道(WVS第7波) | | 伦理类别数量 | 9类(基于道德基础理论) | | 分析模型 | GPT-4o、GPT-4o-mini、Gemini-2.5-flash、Gemini-2.0-flash、DeepSeek-reasoner、DeepSeek-chat | | 单国人设数量 | 100名(分层抽样) | | 大语言模型总应答数 | 910,800条 | | 应答评分尺度 | 1–10分(1=完全无法合理化,10=完全可以合理化) | | 人类基准数据 | WVS第7波真实受访者数据 | --- ## 伦理类别(基于道德基础理论) | 类别 | 主要主题示例 | |---|---| | 不诚实与腐败 | 逃税、贿赂、盗窃 | | 性伦理 | 同性恋、婚前性行为、卖淫 | | 生命伦理 | 堕胎、安乐死、死刑 | | 政治暴力 | 恐怖主义、政治暴力 | | 监视与隐私 | 视频监控、互联网监控 | | 家庭与关系 | 离婚、家庭暴力 | | 道德哲学 | 道德相对主义 | | 福利与再分配 | 收入再分配政策 | | 生活方式 | 赌博、饮酒 | --- ## 数据结构 每份应答文件包含以下列: | 列名 | 说明 | |---|---| | `country` | 国家名称 | | `persona_id` | 人设唯一标识符 | | `model` | 大语言模型名称(人类应答时取值为`human`) | | `Q1`–`Q23` | 23道伦理题目的应答分值(1–10分尺度) | | `category` | 伦理类别名称 | --- ## 人设生成方法 研究团队从WVS第7波数据中提取性别、年龄、教育水平、收入分位、宗教信仰、就业状态等**30个人口统计变量**的分布,采用分层抽样(stratified sampling)方法生成每个国家的100份人设。 通过**TOST(双侧单样本检验,Two One-Sided Tests,等价边际±0.5)**检验验证了100份人设的统计有效性,确认其与1000份样本的分布无显著差异(GPT-4o、Gemini-2.5-flash的检验结果均为p < 0.001)。



