CVC
收藏资源简介:
CVC数据集是一个大规模的中文价值规则语料库,旨在帮助大型语言模型(LLMs)与主流人类价值观和伦理规范保持一致。该数据集基于核心的中国价值观,包括三个主要维度、12个核心价值观和50个衍生价值。CVC数据集包含超过25万个价值规则,并通过人工标注进行增强和扩展。实验结果表明,CVC引导的场景在价值边界和内容多样性方面优于直接生成的场景。在六个敏感主题(如代孕、自杀)的评价中,七个主流LLMs在超过70.5%的情况下更喜欢CVC生成的选项,而五个中国人工标注者与CVC的吻合率达到87.5%,证实了其普遍性、文化相关性和与中国价值观的强一致性。此外,我们还构建了40万个基于规则的道德困境场景,客观地捕捉了17个LLMs在冲突价值优先级中的细微差别。我们的工作为全面的价值观评价和一致性的文化适应性基准测试框架奠定了基础,代表了中国的特色。所有数据均可在https://huggingface.co/datasets/Beijing-AISI/CVC获取,代码可在https://github.com/Beijing-AISI/CVC获取。
The CVC dataset is a large-scale Chinese value rule corpus designed to align large language models (LLMs) with mainstream human values and ethical norms. Grounded in core Chinese values, this dataset encompasses three primary dimensions, 12 core values, and 50 derived values. It contains over 250,000 value rules, which are enhanced and expanded via manual annotation. Experimental results demonstrate that scenarios guided by CVC outperform directly generated ones in terms of value boundaries and content diversity. In evaluations across six sensitive topics (e.g., surrogacy, suicide), seven mainstream LLMs preferred CVC-generated options in over 70.5% of cases, while five Chinese human annotators achieved an 87.5% agreement rate with CVC, confirming its universality, cultural relevance, and strong alignment with core Chinese values. Furthermore, we constructed 400,000 rule-based moral dilemma scenarios that objectively capture the subtle differences in conflicting value prioritization among 17 LLMs. Our work lays a foundation for a comprehensive framework of value evaluation and culturally adaptive alignment benchmarking, embodying distinct Chinese characteristics. All data is available at https://huggingface.co/datasets/Beijing-AISI/CVC, and the code can be accessed at https://github.com/Beijing-AISI/CVC.
中文价值语料库(CVC)数据集概述
数据集基本信息
- 名称: Chinese Value Corpus (CVC)
- 语言: 中文(zh)
- 许可协议: CC-BY-4.0
- 任务类别: 文本生成、多项选择
- 多语言性: 单语
- 规模: 100K < n < 1M
- 注释创建者: 专家注释、机器生成
- 源数据集: Social Chemistry 101、Moral Integrity Corpus、Flames
- 标签: 中文价值观、伦理、道德困境、LLM对齐、文化对齐
数据集内容
- 数据文件: CVC.jsonl
- 分类框架: 基于中国核心价值观的三层价值分类框架,包括三个维度、十二个核心价值和五十个衍生价值。
- 规模: 包含超过250,000条高质量、手动注释的规范性规则。
主要贡献
-
构建首个大规模、精细化的中文价值语料库(CVC):
- 基于社会主义核心价值观,开发了一个涵盖国家、社会和个人层面的本土化价值分类框架。
- 包含12个核心价值和50个衍生价值。
-
系统验证CVC的生成指导优势和跨模型适用性:
- 验证了CVC在指导12个核心价值的场景生成中的有效性。
- 定量分析显示,CVC指导的场景在t-SNE空间中表现出更紧凑的聚类和更清晰的边界。
- 在六个伦理主题的测试中,七个主要LLM选择CVC生成选项的比例超过70%。
-
提出基于规则的大规模道德困境生成方法:
- 利用CVC提出了一种基于价值优先级的自动生成道德困境(MDS)的方法。
- 该系统高效创建具有道德挑战性的场景,降低了传统手工构建的成本。
应用场景
- 为大规模和自动化价值评估提供数据支持。
- 评估大型语言模型的价值偏好和道德一致性。

- 1CVC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models中国科学院自动化研究所脑认知与智能系统实验室 · 2025年



