遇见数据集

LKValues

收藏
arXiv2026-07-23 更新2026-07-24 收录
数据链接:
官方服务:

资源简介:

LKValues是由天津大学等机构联合创建的首个针对斯里兰卡社会价值观对齐的资源套件,旨在解决大型语言模型在多元文化社会中的文化偏见问题。该数据集包含约15万条双语(僧伽罗语-英语)场景化指令实例,数据来源于2009年至2023年的斯里兰卡新闻语料,并基于对205名受访者的三语调查所提炼的40项多数认可的社会价值观进行标注。其构建过程融合了国际价值框架与本地化LLM辅助启发,通过人工引导的流程进行场景提取和质量验证。该数据集主要用于支持低资源、国家特定的价值观对齐研究,助力模型在斯里兰卡语境下进行文化敏感的微调和评估。

LKValues is the first resource suite targeting social value alignment for Sri Lanka, co-developed by Tianjin University and other institutions. It aims to address the cultural bias issues of large language models (LLMs) in multicultural societies. The dataset contains approximately 150,000 bilingual (Sinhala-English) contextual instruction instances, with data sourced from Sri Lankan news corpora spanning 2009 to 2023. It is annotated with 40 widely recognized social values extracted from a trilingual survey involving 205 respondents. Its construction process incorporates international value frameworks and localized LLM-assisted heuristics, with scene extraction and quality validation conducted via human-guided workflows. This dataset is primarily used to support low-resource, country-specific value alignment research, and to facilitate culturally sensitive fine-tuning and evaluation of models in the Sri Lankan context.

创建时间:
2026-07-23
原始信息汇总

数据集概述

LKValues 是一个基于调查的僧伽罗语-英语双语资源套件,旨在研究大型语言模型与斯里兰卡社会价值观的对齐。

核心资源

LKValues 包含两个主要资源:

  • LKvaluesIT:一个用于价值观引导生成的双语指令微调数据集。
  • LKvaluesBench:一个用于价值观敏感判断的双语基准测试集。

LKvaluesIT

  • 数据来源:基于2009年至2023年间斯里兰卡新闻。
  • 数据格式:每条样本包含一个简短场景、一个目标社会价值观、一段基于价值观的解释,以及英语和僧伽罗语对齐版本。
  • 数据规模
    • 训练集:英语和僧伽罗语各120,000条。
    • 验证集:英语和僧伽罗语各15,000条。
    • 测试集:英语和僧伽罗语各15,000条。
    • 总计约150,000个对齐的双语对。
  • 用途:用于价值观引导生成和双语指令微调。

LKvaluesBench

  • 数据规模:包含1,000个对齐的僧伽罗语和英语条目。
  • 数据格式:每条包含一个问题或场景、Statement_AStatement_B、一个从 ABBOTH0 中选择的黄金标签,以及一个映射的主要社会价值观。
  • 构成
    • 491条人工策划的条目(改编自SinhalaMMLU)。
    • 509条基于场景的条目(经过人在回路验证生成)。

40种社会价值观

该资源基于一项面向205名斯里兰卡受访者、同时使用僧伽罗语、泰米尔语和英语进行的调查。从51个候选构念中,根据多数认可度保留了40种社会价值观,涵盖家庭、尊重、同情、责任、正义、多元文化、韧性、环保、问责、教育、灵性、政治自由等社会与公民议题。完整的价值观清单、定义及认可统计数据位于 data/metadata/value_inventory.csv

数据集结构

仓库结构如下(部分路径已转为绝对地址):

text LKValues/ ├── README.md ├── DATA_CARD.md ├── CITATION.cff ├── LICENSE-DATA ├── LICENSE-CODE │ ├── data/ │ ├── lkvalues_it/ │ │ ├── train/ │ │ ├── validation/ │ │ └── test/ │ │ │ ├── lkvalues_bench/ │ │ ├── lkvaluesbench_en.jsonl │ │ └── lkvaluesbench_si.jsonl │ │ │ └── metadata/ │ ├── value_inventory.csv │ ├── dataset_statistics.json │ └── data_schema.md │ ├── examples/ │ ├── lkvalues_it_examples.jsonl │ └── lkvalues_bench_examples.jsonl │ ├── prompts/ │ ├── value_tagging_prompt.txt │ ├── scenario_extraction_prompt.txt │ └── benchmark_evaluation_prompts.txt │ ├── scripts/ │ ├── load_dataset.py │ ├── validate_schema.py │ └── evaluation/ │ └── docs/ ├── annotation_guidelines.md ├── dataset_construction.md ├── survey_instrument/ └── release_notes.md

用途与限制

  • 预期用途:多语言NLP研究、低资源语言评估、文化基础模型分析、价值观对齐研究、指令微调和基准测试。
  • 重要限制
    • 调查样本在人口统计学上并不平衡。
    • 基于多数认可的方法可能低估少数群体的价值观。
    • 当前数据集仅涵盖僧伽罗语和英语,泰米尔语仅用于调查阶段。
    • 新闻来源和模型辅助处理流程可能引入偏见。
    • LKvaluesIT目前侧重于正面的价值观支持解释。
    • 该基准测试应作为研究工具,而非斯里兰卡的规范性标准。

许可与引用

  • 数据集与文档许可:Creative Commons Attribution 4.0 International。
  • 代码许可:详见 LICENSE-CODE
  • 相关论文LKValues: Aligning Large Language Models with Sri Lankan Societal Values,arXiv链接:https://arxiv.org/abs/2607.20410(即将上线)。
搜集汇总
数据集介绍
LKValues 数据集图片
构建方式
LKValues数据集基于一项覆盖僧伽罗语、泰米尔语和英语的三语调查构建,该调查整合了国际价值框架与大型语言模型(LLM)辅助生成的斯里兰卡本土价值主张,共收集205份有效问卷。经多数认可阈值筛选,最终确定40项斯里兰卡社会价值。以此为基础,研究团队从2009至2023年的斯里兰卡英文新闻语料中,通过关键词匹配与LLM过滤,提取价值相关文本,并转化为中立、可泛化的场景化指令实例,形成涵盖约15万条中英双语实例的指令数据集LKvaluesIT。同时,从SinhalaMMLU数据集中筛选并改编价值敏感的多选题,辅以人工验证的新增场景,构建了包含1000条实例的评估基准LKvaluesBench。整个流程采用人工引导、LLM参与的迭代机制,并经过多组斯里兰卡标注员的一致性检验。
特点
LKValues具备鲜明的本土化与双语特性。其价值体系经由三语调查从斯里兰卡多元社会群体中直接提炼,确保了文化根基的在地性。数据集覆盖40项经多数民众认可的社会价值,兼具广度与共识度。指令数据基于本土新闻源,场景贴近斯里兰卡社会现实,具有高度情境真实性。评估基准则采用双陈述判断任务,要求模型在‘仅A’、‘仅B’、‘两者皆可’与‘皆不可’间做出选择,提升了评估的精细度与挑战性。此外,资源以中英双语呈现,便于评估模型在低资源语言僧伽罗语中的价值对齐表现,并揭示了模型规模与时效性并不必然保障文化敏感性。
使用方法
LKValues包含训练与评估两大模块,使用方法明确。指令数据集LKvaluesIT可用于对大型语言模型进行监督微调,以增强其对斯里兰卡社会价值的场景化解释能力。研究建议将LKvaluesIT与通用僧伽罗语指令数据混合训练,以平衡价值对齐与通用指令遵循能力。评估基准LKvaluesBench则用于测试模型在双语环境下的价值敏感性判断能力,通过控制提示语框架(斯里兰卡特定提示与普世价值提示),可诊断模型受语言与文化框架影响的程度。该数据集已在GitHub公开,支持研究者复现针对低资源、国家特定场景的多元价值对齐流程。
背景与挑战
背景概述
在大型语言模型(LLM)价值对齐的研究领域中,主流范式长期受西方文化框架主导,导致模型在多语言、多文化社会如斯里兰卡中难以准确理解和表达当地特有的社会价值观。针对这一空白,由天津大学、梅西大学、莫拉图瓦大学等机构的研究人员于2026年共同构建了LKValues数据集,旨在为斯里兰卡社会价值观的对齐提供首个基于调查的资源体系。该研究通过三语(僧伽罗语、泰米尔语、英语)问卷调查205名受访者,融合国际价值框架与大模型辅助挖掘,确立40项获多数认可的斯里兰卡社会价值观。LKValues包含15万条基于新闻的僧伽罗语-英语指令语料库LKvaluesIT及1000条评估基准LKvaluesBench,为低资源语言与文化背景下的价值对齐提供了可复现的范式,显著推动了区域化、多元化的LLM价值观研究。
当前挑战
LKValues面临的挑战主要体现在两个层面。在领域问题层面,当前LLM在低资源语言与文化特定场景下的价值对齐存在系统性缺失,模型在非西方社会环境中往往表现出与当地规范相悖的推理偏差,尤其难以处理僧伽罗语语境下基于斯里兰卡独特宗教、历史与社会结构所塑造的多元价值观。在构建过程中,研究团队需克服多重困难:三语调查问卷的设计需同时兼顾国际标准框架的兼容性与本地文化概念的可操作性,确保51项候选价值观能够被205名受访者准确理解并回应;从2009年至2023年的73,068篇斯里兰卡新闻中提取与文化紧密相关的中性化场景,需经过严格的双轮价值标注与LLM辅助过滤,并在去匿名化与版权约束下仅发布衍生语料;最终生成的双语指令数据集需通过人工验证与多群体审查,确保标注一致性(Fleiss' κ达0.81)与翻译语义保留(回译相似度0.86),整个过程体现了低资源语境下文化接地资源构建的高度复杂性。
常用场景
经典使用场景
LKValues数据集的核心用途在于为大型语言模型提供斯里兰卡社会价值观的对齐资源,尤其适用于评估和微调模型在斯里兰卡语境的价值观敏感判断能力。该数据集包含150K条基于僧伽罗语与英语新闻的指令实例,以及1K条价值观敏感评估基准,研究者可利用这些数据测试模型在斯里兰卡特有文化规范下的价值取向一致性,例如家庭、尊重、非暴力等40项多数人认可的社会价值观。通过这一资源,学术界能够系统性地衡量模型在不同语言(英语与僧伽罗语)和价值类别上的表现,从而揭示跨文化价值观对齐中的薄弱环节。
解决学术问题
LKValues填补了低资源语言与多元文化价值观对齐研究的空白,解决了现有基准忽视斯里兰卡语境化价值观(尤其在官方语言僧伽罗语中)的学术问题。此前,主流价值观对齐研究多聚焦西方规范或高资源语言,导致模型在斯里兰卡这类多民族、多语言社会中难以正确处理本地价值观。该数据集通过三语调查、新闻语料驱动的情境构建与人类验证,系统性地识别并操作化了40项斯里兰卡社会价值观,为研究者提供了可复现的、面向特定国家的多元价值观对齐框架。其意义在于证明了即使模型规模扩大或版本更新,低资源语言的价值观推理仍存在显著缺口,从而推动了文化敏感型AI评估方法的发展。
衍生相关工作
LKValues激发了多项衍生研究工作,包括基于其调查驱动的价值观识别方法论构建其他低资源国家(如尼泊尔、孟加拉国)的价值观对齐数据集。同时,其60K混合微调策略(结合通用僧伽罗语指令数据)被后续研究借鉴,用于优化跨语言价值观迁移效率。此外,该数据集的基准评估协议催生了针对模型在价值观冲突情境下决策能力的细粒度分析工作,例如探讨模型在“权威”与“平等”价值观冲突时的权衡表现。这些工作共同推动了从单一文化普适对齐向多元化、地域特异性对齐范式的转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务