datumo/KorNAT
收藏官方服务:
资源简介:
KorNAT(韩国国家对齐测试)是第一个通过社会价值观和常识知识来衡量大型语言模型(LLMs)在韩国的国家对齐情况的基准测试。社会价值观数据集包含4,000个样本,基于社会冲突报告和新闻文章提取的关键词构建,并经过两轮人工修订以确保质量。常识知识数据集包含6,000个样本,基于韩国的义务教育课程构建。数据集的类别统计信息包括韩国语、社会科学、世界地理、法律与政治、经济学、世界历史、社会与文化、韩国历史、常识、数学、科学、地球科学、生物学、物理学、化学和英语等。数据集的发布计划包括2024年6月公开排行榜和2024年12月在AI hub上发布完整数据。
KorNAT(韩国国家对齐测试)是第一个通过社会价值观和常识知识来衡量大型语言模型(LLMs)在韩国的国家对齐情况的基准测试。社会价值观数据集包含4,000个样本,基于社会冲突报告和新闻文章提取的关键词构建,并经过两轮人工修订以确保质量。常识知识数据集包含6,000个样本,基于韩国的义务教育课程构建。数据集的类别统计信息包括韩国语、社会科学、世界地理、法律与政治、经济学、世界历史、社会与文化、韩国历史、常识、数学、科学、地球科学、生物学、物理学、化学和英语等。数据集的发布计划包括2024年6月公开排行榜和2024年12月在AI hub上发布完整数据。
提供机构:
datumo原始信息汇总
数据集概述
数据集名称
- KorNAT (Korean National Alignment Test)
数据集目的
- 测量韩国的国家对齐度,包括社会价值观和常识。
数据集组成部分
-
社会价值数据集
- 样本数量:4,000
- 问题来源:关键词提取自每月社会冲突报告和过去12个月的新闻文章。
- 质量保证:经过两轮人工修订。
- 标签分布:通过调查6,174名韩国公民获得,平均每题219份回应。
-
常识数据集
- 样本数量:6,000
- 问题基础:韩国的义务教育课程。
数据集详细分类统计
| 分类 | 样本数量 |
|---|---|
| 韩国 | 858 |
| 社会研究 | 858 |
| 世界地理 | 143 |
| 法律与政治 | 143 |
| 经济学 | 143 |
| 世界历史 | 143 |
| 社会与文化 | 143 |
| 韩国历史 | 857 |
| 常识 | 858 |
| 数学 | 855 |
| 科学 | 858 |
| 地球科学 | 215 |
| 生物学 | 215 |
| 物理学 | 215 |
| 化学 | 213 |
| 英语 | 856 |
| 总计 | 6,000 |
数据集文件
- 社会价值 (韩语)
- 测试集路径:KorNAT/social-values-kor-test.csv
- 社会价值 (英语)
- 测试集路径:KorNAT/social-values-eng-test.csv
- 常识 (韩语)
- 测试集路径:KorNAT/common-knowledge-kor-test.csv
- 常识 (英语)
- 测试集路径:KorNAT/common-knowledge-eng-test.csv
许可证
- cc-by-nc-2.0
任务类别
- 多项选择
语言
- 韩语 (ko)
- 英语 (en)
标签
- 国家对齐
数据集大小分类
- 10<n<12
搜集汇总
数据集介绍
构建方式
KorNAT(Korean National Alignment Test)是首个针对韩国国家对齐性评估的基准数据集,旨在衡量大语言模型在韩国社会价值观与常识知识层面的契合度。其社会价值观子集基于从月度社会冲突报告及近12个月新闻中提取的关键词构建问题,并经过两轮人工修订以确保质量,最终通过收集6174名韩国公民的问卷调查(平均每道题219份回应)获得真实标签分布。常识知识子集则依托韩国义务教育课程体系设计,包含知识与两步推理两种类型,所有题目均配有标准答案。
特点
该数据集以双维度结构为核心特色:社会价值观部分涵盖五大选项的同意度分布(精确至两位小数),反映群体观点多样性;常识知识部分则细分为类别与子类别,并区分知识型与两步推理型题目,强化认知层级评估。数据规模适中,社会价值观与常识知识分别包含4000与6007道测试题,采用多项选择格式,语言为韩语,适用于国家文化对齐性研究。
使用方法
数据集通过HuggingFace平台以CSV格式发布,支持两种配置加载:'Common Knowledge'与'Social Values'。用户可使用datasets库直接调用,例如通过load_dataset函数指定配置名称获取对应子集。社会价值观子集的答案字段存储五选项的分布向量,而常识知识子集则提供单一正确答案。数据适用于评估模型对韩国社会规范与基础知识的理解,可与论文中提出的评估框架配合使用。
背景与挑战
背景概述
在大语言模型(LLM)部署于特定国家时,确保模型具备该国特有的文化认知与基础知识,即所谓的“国家对齐”,已成为人工智能领域的关键课题。2024年,由韩国科学技术院(KAIST)与SelectStar研究团队共同构建的KorNAT(Korean National Alignment Test)数据集应运而生,旨在系统评估LLM对韩国的国家对齐程度。该数据集由Jiyoung Lee、Minwoo Kim等研究人员主导,围绕“社会价值观”与“常识知识”两大维度展开。社会价值观部分从韩国社会冲突报告及近12个月新闻中提取关键词生成问题,并通过对6174名韩国公民调查获取真实标签分布;常识知识部分则基于韩国义务教育课程设计。KorNAT作为首个针对韩国的国家对齐基准,为LLM在跨文化部署中的安全性与适应性研究提供了重要参考,显著推动了多语言、多文化AI系统的评估标准发展。
当前挑战
KorNAT数据集面临的核心挑战在于精准捕捉韩国社会的文化独特性与价值观多样性。社会价值观维度需解决如何从纷繁复杂的社会冲突报道中提炼出具有代表性且无偏见的问题,同时确保调查样本(平均每问题219份回应)能真实反映国民共识,避免因样本偏差导致对齐评估失真。常识知识维度则需应对韩国义务教育课程内容动态更新的挑战,确保问题覆盖全面且难度适中。构建过程中,研究团队面临双重困难:一是社会价值观问题的设计需经过两轮人工修订以消除歧义,但人工审核成本高昂且难以保证绝对客观;二是常识知识问题需区分“知识”与“两步推理”类型,这对题目逻辑性与区分度提出更高要求。此外,数据集的CC-BY-NC许可限制了商业使用,可能影响其在工业界的推广与持续优化。
常用场景
经典使用场景
KorNAT数据集专为评估大语言模型在韩国国家层面的对齐程度而设计,其经典使用场景聚焦于衡量模型对韩国社会价值观与常识知识的掌握水平。研究者可通过该数据集中的多项选择题,分别测试模型在韩国公民社会共识(如社会冲突议题)与基础教育课程涵盖的常识(如历史、科学)上的表现。这一场景不仅适用于对比不同模型对韩国文化的适配性,还为多语言模型的本土化优化提供了标准化的评估基准。
实际应用
在实际应用中,KorNAT可用于优化面向韩国用户的大语言模型服务,例如智能客服、教育辅导或公共政策咨询系统。通过检测模型对韩国社会价值观的符合度(如对敏感议题的立场分布),开发者能调整模型输出以避免文化冒犯;同时,常识测试可确保模型在韩国历史、地理等场景中提供准确信息。这有助于提升AI产品在韩国市场的用户信任度与实用性。
衍生相关工作
KorNAT衍生了一系列关于国家对齐与文化适应性的经典工作,包括基于其数据构建的韩国文化知识图谱、跨语言模型价值观对比研究(如中韩价值差异分析),以及针对社会价值分布优化的微调方法。此外,该基准启发了其他国家对齐数据集的构建框架,例如日本、印度等国的类似项目,推动了多语言模型从通用性能向区域文化适配的范式转变。
以上内容由遇见数据集搜集并总结生成



