LKValues
收藏资源简介:
LKValues是由天津大学等机构联合创建的首个针对斯里兰卡社会价值观对齐的资源套件,旨在解决大型语言模型在多元文化社会中的文化偏见问题。该数据集包含约15万条双语(僧伽罗语-英语)场景化指令实例,数据来源于2009年至2023年的斯里兰卡新闻语料,并基于对205名受访者的三语调查所提炼的40项多数认可的社会价值观进行标注。其构建过程融合了国际价值框架与本地化LLM辅助启发,通过人工引导的流程进行场景提取和质量验证。该数据集主要用于支持低资源、国家特定的价值观对齐研究,助力模型在斯里兰卡语境下进行文化敏感的微调和评估。
LKValues is the first resource suite targeting social value alignment for Sri Lanka, co-developed by Tianjin University and other institutions. It aims to address the cultural bias issues of large language models (LLMs) in multicultural societies. The dataset contains approximately 150,000 bilingual (Sinhala-English) contextual instruction instances, with data sourced from Sri Lankan news corpora spanning 2009 to 2023. It is annotated with 40 widely recognized social values extracted from a trilingual survey involving 205 respondents. Its construction process incorporates international value frameworks and localized LLM-assisted heuristics, with scene extraction and quality validation conducted via human-guided workflows. This dataset is primarily used to support low-resource, country-specific value alignment research, and to facilitate culturally sensitive fine-tuning and evaluation of models in the Sri Lankan context.
数据集概述
LKValues 是一个基于调查的僧伽罗语-英语双语资源套件,旨在研究大型语言模型与斯里兰卡社会价值观的对齐。
核心资源
LKValues 包含两个主要资源:
- LKvaluesIT:一个用于价值观引导生成的双语指令微调数据集。
- LKvaluesBench:一个用于价值观敏感判断的双语基准测试集。
LKvaluesIT
- 数据来源:基于2009年至2023年间斯里兰卡新闻。
- 数据格式:每条样本包含一个简短场景、一个目标社会价值观、一段基于价值观的解释,以及英语和僧伽罗语对齐版本。
- 数据规模:
- 训练集:英语和僧伽罗语各120,000条。
- 验证集:英语和僧伽罗语各15,000条。
- 测试集:英语和僧伽罗语各15,000条。
- 总计约150,000个对齐的双语对。
- 用途:用于价值观引导生成和双语指令微调。
LKvaluesBench
- 数据规模:包含1,000个对齐的僧伽罗语和英语条目。
- 数据格式:每条包含一个问题或场景、
Statement_A、Statement_B、一个从A、B、BOTH或0中选择的黄金标签,以及一个映射的主要社会价值观。 - 构成:
- 491条人工策划的条目(改编自SinhalaMMLU)。
- 509条基于场景的条目(经过人在回路验证生成)。
40种社会价值观
该资源基于一项面向205名斯里兰卡受访者、同时使用僧伽罗语、泰米尔语和英语进行的调查。从51个候选构念中,根据多数认可度保留了40种社会价值观,涵盖家庭、尊重、同情、责任、正义、多元文化、韧性、环保、问责、教育、灵性、政治自由等社会与公民议题。完整的价值观清单、定义及认可统计数据位于 data/metadata/value_inventory.csv。
数据集结构
仓库结构如下(部分路径已转为绝对地址):
text LKValues/ ├── README.md ├── DATA_CARD.md ├── CITATION.cff ├── LICENSE-DATA ├── LICENSE-CODE │ ├── data/ │ ├── lkvalues_it/ │ │ ├── train/ │ │ ├── validation/ │ │ └── test/ │ │ │ ├── lkvalues_bench/ │ │ ├── lkvaluesbench_en.jsonl │ │ └── lkvaluesbench_si.jsonl │ │ │ └── metadata/ │ ├── value_inventory.csv │ ├── dataset_statistics.json │ └── data_schema.md │ ├── examples/ │ ├── lkvalues_it_examples.jsonl │ └── lkvalues_bench_examples.jsonl │ ├── prompts/ │ ├── value_tagging_prompt.txt │ ├── scenario_extraction_prompt.txt │ └── benchmark_evaluation_prompts.txt │ ├── scripts/ │ ├── load_dataset.py │ ├── validate_schema.py │ └── evaluation/ │ └── docs/ ├── annotation_guidelines.md ├── dataset_construction.md ├── survey_instrument/ └── release_notes.md
用途与限制
- 预期用途:多语言NLP研究、低资源语言评估、文化基础模型分析、价值观对齐研究、指令微调和基准测试。
- 重要限制:
- 调查样本在人口统计学上并不平衡。
- 基于多数认可的方法可能低估少数群体的价值观。
- 当前数据集仅涵盖僧伽罗语和英语,泰米尔语仅用于调查阶段。
- 新闻来源和模型辅助处理流程可能引入偏见。
- LKvaluesIT目前侧重于正面的价值观支持解释。
- 该基准测试应作为研究工具,而非斯里兰卡的规范性标准。
许可与引用
- 数据集与文档许可:Creative Commons Attribution 4.0 International。
- 代码许可:详见
LICENSE-CODE。 - 相关论文:
LKValues: Aligning Large Language Models with Sri Lankan Societal Values,arXiv链接:https://arxiv.org/abs/2607.20410(即将上线)。




