遇见数据集

CULTURECONVERSE-DS

收藏
arXiv2026-08-28 更新2026-09-01 收录
官方服务:

资源简介:

CULTURECONVERSE-DS是一个多语言、多轮模拟数据集,旨在评估大语言模型在文化情境下的辅助对话能力。该数据集由多家机构联合创建,涵盖东亚和东南亚10个地区、58个亚群体身份及7个领域,总对话数达288,905条。通过种子-蓝图-分片-模拟-评估五阶段流水线生成,并利用维基百科文化知识和禁忌库进行增强。数据集旨在从静态知识回忆转向动态交互式文化辅助评估,并可用于微调模型以提升其在文化相关任务上的泛化能力。

创建时间:
2026-08-28
原始信息汇总

CultureConverse 数据集概述

基本信息

  • 数据集名称: CultureConverse
  • 所属机构: Social-AI-Studio
  • 数据集主页: (https://github.com/Social-AI-Studio/CultureConverse)
  • 数据集语言: 支持英语及人物角色的母语(针对东亚和东南亚地区)
  • 数据集下载地址: 可通过 Hugging Face 仓库 Incomple/CultureConverse-DS 下载(例如 global_english 配置的 train 分割)

数据集内容

  • 规模: 包含 7,308 个冻结的评估场景(蓝色蓝图和分片各 7,308 个),覆盖东亚和东南亚地区的多轮文化场景对话。
  • 数据用途: 用于评估和生成多轮、具有文化背景的助手对话。
  • 数据构成:
    • data/blueprints/: 7,308 个冻结的评估蓝图(角色分离、基于知识库的场景)
    • data/shards/: 7,308 个对应的冻结评估分片(渐进式逐轮交互计划)
    • cultural_kb/taboo_index/: 包含 962 条禁忌知识库索引
    • 另提供一个由维基百科衍生的文化知识库(需单独下载,详见 cultural_kb/README.md

评估指标

  • 3H: 有用性(Helpfulness)、诚实性(Honesty)、无害性(Harmlessness),每项评分 1–5 分
  • TDQ: 自然度(Naturalness)、场景合理性(Scenario plausibility)、文化典型性(Cultural typicality),每项评分 1–5 分
  • Clean rate: 无触发陷阱、禁忌或文化失误的片段所占比例

工作流程

  1. 评估助手: 使用 7,308 个冻结的短上下文场景进行评估,可用英语或人物角色的母语。
  2. 生成新数据: 通过模板生成 → 模板挑战标注 → 种子生成 → 蓝图生成 → 分片生成 → 模拟交互 → 评估 的流水线实现。

技术要点

  • 环境要求: Python 3.10 或更高版本
  • 模型接口: 使用 OpenRouter API(OpenAI Python SDK 指向 OpenRouter 基础 URL),也支持通用的 OpenAI 兼容端点和旧版 Azure 端点
  • 可用模式:
    • eval 模式:用于基准评估
    • gold 模式:为助手提供预言性指导,仅用于生成训练轨迹

成本参考

  • 离线验证和单元测试: 0 次模型调用,费用 $0
  • 单次测试性 API 调用: 1 次小调用,$0(受可用性限制)
  • 单个场景 + 单次无害性评分: 数次模拟调用 + 1 次评审调用,通常费用较小
  • 十个场景 + 3H+TDQ 评估: 数十至数百次调用,费用依模型而定
  • 全量评估(7,305 个场景、六项指标、一种语言): 43,830 次评审调用,历史运行时间约 52 分钟,历史费用约 $142–$148(现行 OpenRouter 定价可能有变动)

数据导出

支持将合适的 Gold 模式数据行导出为聊天训练 JSONL 格式(例如按平均 3H 评分≥4.0 筛选),用于微调训练。

搜集汇总
数据集介绍
CULTURECONVERSE-DS 数据集图片
构建方式
CULTURECONVERSE-DS的构建遵循一套五阶段生成流程,从种子定义出发,经由蓝图生成、碎片分解、对话模拟至最终评估,形成一条完整的生产链路。首先,研究团队在十個东亚与东南亚区域中,以58个交叉性亚群身份、三个年龄层与两种性别组合构建了包含348种人设的宇宙,并基于七个领域、42个子领域设计了420个文化中立模板。随后,通过检索180,992篇区域标记的维基百科文章与962条结构化禁忌条目,将抽象种子实例化为包含公开情境、私人信息与评估引擎上下文的蓝图。蓝图进一步被分解为3至5个有序对话碎片,每个碎片内置用户目标、语言指令及成败转换条件,以实现信息的渐进式透露。最终,通过模拟器角色执行对话生成,同时结合英语与本土语言模式,产出14,610条评估对话与274,295条训练轨迹,每条均附带多维评分记录,确保数据可溯源性与透明度。
使用方法
CULTURECONVERSE-DS既可充当评估基准,也可作为微调语料库。评测时,研究者可调用14,610条评估对话,在固定的人设与场景种子下,以盲测方式运行目标助手模型,并通过LLM法官依据3H与TDQ指标进行自动打分。已筛选的27,860条完美得分轨迹可作为监督微调训练集,实验证明其能有效提升模型的域内援助质量,并迁移至文化常识问答、区域知识与安全分类等外部基准。数据集提供英语与九种本土语言的双语模式,支持跨语言能力分析,同时可通过身份、年龄、性别等切片进行细致的公平性评估。配套发布的代码库与详尽文档,便于用户复现流程、定制场景或将其集成至自定义的文化智能评估框架。
背景与挑战
背景概述
CULTURECONVERSE-DS数据集由新加坡科技设计大学等多所机构的研究人员于2025年创建,旨在突破现有文化评估局限于单轮事实回忆的范式。该数据集通过构建一个可扩展的多语言多轮对话仿真框架,覆盖东亚和东南亚10个地区、58个子群体身份及7个日常领域,核心研究问题在于评估大语言模型在部分信息条件下逐步推断隐性文化约束并提供实用协助的能力。其首创的'渐进披露'机制与信息不对称设计,为文化能力评估提供了动态、交互的新维度,对推动文化感知型AI系统的发展具有重要影响力。
当前挑战
该领域面临的核心挑战在于,现有文化评估多采用静态问答形式,难以捕捉多轮对话中的上下文维持与隐性规范推断,导致模型在真实求助场景中常产生流利但社交不当的建议。构建过程中,研究团队需精心设计包含公共、私密与评判者三重信息层的复杂场景蓝图,并确保模拟用户与评判模型的文化指令准确无误,同时平衡不同子群体间的表征公平性,避免文化本质主义倾向。此外,大语言模型作为模拟器与评判者,存在行为模式趋同和评判偏差风险,需通过人类标注验证其可靠性。
常用场景
经典使用场景
CULTURECONVERSE-DS数据集的核心用途在于构建与评估多轮、多语言的文化接地助理对话系统。它通过模拟东亚与东南亚十个地区、五十八个亚群体身份及七个领域的求助场景,为大型语言模型提供了一种动态交互的评估框架。相较传统静态问答或多选题形式,该数据集着重考察模型在部分信息可见条件下推断隐性文化约束并给出得体建议的能力。其标准评估单元为完整的多轮对话片段,要求助理在渐进式信息揭示中维持上下文、规避文化禁忌,从而真实反映现实世界中文化敏感场景下的求助与协助互动。
解决学术问题
该数据集有效回应了文化评估中三大关键学术难题:其一,突破国别标签的平面化局限,通过细粒度亚群体身份揭示国内文化差异及模型表现的不均衡性;其二,超越单轮非交互式评测,引入多轮情境维持与上下文跟踪,弥补模型在长对话中性能衰退的评估空缺;其三,摒弃知识型选择题对文化能力的静态化约简,转向实用性知识在具体任务中的动态运用。此外,其自动化评估框架与人工评定高度一致,为可扩展、可复现的文化对话评估提供了方法论支撑,推动了从事实回想到情境行为的范式转变。
实际应用
在实际部署中,CULTURECONVERSE-DS可用于训练与优化面向多元文化用户的AI助理,使其在婚礼策划、节日安排、饮食禁忌、家庭礼仪等日常场景中提供精准且尊重文化习俗的建议。该数据集亦适用于跨文化沟通辅助工具的开发,帮助侨居或旅居人士理解并适应当地规范;同时可用于内容安全审核系统,提升对地区性禁忌、仇恨言论及不适当建议的识别能力。其多语言覆盖特性更有助于服务低资源语言社区,促进AI服务的公平性与包容性,减少因文化误解而引发的用户疏离与信任缺失。
数据集最近研究
最新研究方向
CULTURECONVERSE-DS数据集的最新研究聚焦于将文化评估从静态的单轮事实回忆转向动态的多轮互动辅助。该数据集通过模拟东亚和东南亚10个地区、58个子群体身份以及7个领域的文化情境对话,创新性地引入了渐进式信息披露机制,要求模型在部分可观测条件下推断隐含的文化约束。研究前沿涉及利用大规模黄金轨迹数据进行微调,以提升模型在跨领域文化基准和安全性分类任务上的泛化能力。此外,该数据集还推动了公平性分析,揭示了模型在不同地域和亚群体间的性能差异,为构建更具文化敏感性和公平性的AI系统提供了重要支撑。
相关研究论文
  • 1
    CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia新加坡科技设计大学; 新加坡科技研究局; 洛桑联邦理工学院; 微软亚洲研究院; 成均馆大学; 文莱大学; 中国石油大学(华东); 南洋理工大学; 京都大学; 建国大学; Upstage AI; 高丽大学; 德拉萨大学; 雅典耀马尼拉大学; AI新加坡; 不列颠哥伦比亚大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务