CVC
收藏资源简介:
我们提出了一个基于中国核心价值观的层次价值分类框架,包括三个维度、十二个核心价值和五十个派生价值。在大语言模型和人工验证的帮助下,我们构建了一个大规模、精细化和高质量的价值语料库,包含超过25万条规则。我们验证了这个语料库的有效性,为大规模和自动化的大语言模型价值评估提供了数据支持。
We propose a hierarchical value classification framework based on Chinese core values, which covers three dimensions, twelve core values and fifty derived values. With the assistance of large language models (LLMs) and manual verification, we constructed a large-scale, fine-grained and high-quality value corpus containing over 250,000 rules. We validated the effectiveness of this corpus, providing data support for large-scale and automated value evaluation of large language models.
CVC: 大规模中文价值观规则语料库
概述
- 目标:构建首个大规模、精细化的中文价值观语料库(CVC),用于大型语言模型的文化对齐
- 分类框架:基于中国核心价值观的三维分类体系(国家、社会、个人层面)
- 规模:包含超过25万条高质量人工标注的规范性规则
核心贡献
-
语料库构建
- 开发本土化价值观分类框架(12个核心价值观 + 50个衍生价值观)
- 填补该领域重要空白
-
有效性验证
- 在12个核心价值观的场景生成中展现指导优势
- 定量分析显示:
- t-SNE空间中更紧凑的聚类和清晰边界
- "法治"和"文明"类别场景多样性显著提升
- 在6个伦理主题测试中:
- 7个主流LLM选择CVC生成选项的比例超过70%
- 与中国标注者的一致性超过0.87
-
方法论创新
- 提出基于价值优先级的规则驱动方法
- 实现道德困境(MDS)的自动生成
数据目录结构
CVC/ ├─basic_scene/ # 基础场景 │ ├─existing_datasets/ # 现有数据集 │ └─web_crawling/ # 网络爬取数据 ├─basic_value_rule/ # 基础价值观规则 ├─data_control/ # 数据标注 ├─experiment1/ # 实验1:场景生成对比 ├─experiment2/ # 实验2:跨模型适用性验证 ├─moral_dilemma/ # 道德困境生成 ├─Pic/ # 图片资源 └─rule_generation/ # 规则生成流程
数据来源
- 公开数据集:
- FLAMES
- Social Chemistry 101
- Moral Integrity Corpus
- 中文道德语句数据集
- 知乎KOL数据集
获取方式
- 完整数据可通过HuggingFace获取:https://huggingface.co/datasets/Beijing-AISI/CVC




