遇见数据集

CARTE

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

CARTE是由巴黎综合理工学院等机构创建的文化锚定区域评估基准,旨在评估大语言模型对法国地理知识与区域差异的细粒度推理能力。该数据集包含2,431道多项选择题,覆盖法国13个本土行政区的14个主题领域,如文化、语言、经济和环境,数据来源于人工筛选的法国开放获取机构文档。其构建过程采用基于文档的增强流程,通过Gemini 3 Flash模型生成问题,并经过自动质量过滤确保内容多样性与地域相关性。该数据集主要应用于大语言模型的文化对齐评估,旨在揭示模型在法语区域文化知识上的覆盖差距,并促进对区域特异性语境的理解与推理能力的提升。

CARTE is a culturally anchored regional evaluation benchmark created by institutions including École Polytechnique in Paris and other relevant academic bodies, which aims to assess the fine-grained reasoning abilities of large language models (LLMs) regarding French geographic knowledge and regional disparities. This dataset consists of 2,431 multiple-choice questions, covering 14 thematic domains across 13 metropolitan administrative regions of France, such as culture, language, economy and environment, with its data sourced from manually curated French open-access institutional documents. Its construction adopts a document-augmented workflow: questions are generated via the Gemini 3 Flash model, followed by automatic quality filtering to guarantee content diversity and regional relevance. This benchmark is primarily utilized for cultural alignment evaluation of LLMs, with the goals of revealing the coverage gaps of models in French regional cultural knowledge, and advancing the improvement of contextual understanding and reasoning capabilities for regional specificity.

创建时间:
2026-06-01
原始信息汇总

根据您提供的数据集详情页面地址(https://huggingface.co/datasets/ScarAlcar/CARTE)及其README文件内容,此数据集的基本信息如下:

  • 数据集名称:CARTE
  • 许可证:CC BY-NC 4.0(知识共享-署名-非商业使用 4.0 国际许可协议)
搜集汇总
数据集介绍
CARTE 数据集图片
构建方式
CARTE数据集的构建基于人工筛选的开放获取法语文献,涵盖法国13个大区的14个主题领域。通过Gemini 3 Flash模型进行文档驱动的增量式问题生成,每道题包含5个选项,其中E为“Je ne sais pas”,以保证认知不确定性。生成的问题经过7种通用大语言模型的自动质量过滤,剔除所有模型均无法正确回答的题目,再通过模型作答正确率进行难度校准,形成低、中、高三个难度层级,最终保留2431道选择题。
特点
CARTE的核心特点在于其精细的地理与文化锚定性。它突破了传统翻译基准仅测评国家级通用知识的局限,聚焦法国13个本土大区之间的文化、经济、语言与环境差异。数据集涵盖14个主题领域,包括文化、人口、语言、经济等,并专门设计了CARTE-LV子集,用于评估区域语言变体。通过多层级难度分布和地理区域细分,该基准能够有效揭示模型在区域性知识上的表现差异与训练覆盖不足。
使用方法
CARTE适用于零样本、单样本和三样本情境下的多选问答评估。研究者可直接加载Hugging Face上的公开数据集,按区域或主题筛选问题,对模型进行细粒度知识评测。推荐配合“Je ne sais pas”选项以避免强制猜测,使用准确率作为主要指标。CARTE-LV子集可独立用于聚焦语言变体的评估,建议结合语法正确性、语言自然度、区域适切性等多维评分进行分析。
背景与挑战
背景概述
CARTE(Culturally Anchored Regional-Territorial Evaluation)是由法国巴黎综合理工学院等机构的研究人员于2026年提出的多选基准评测数据集,旨在评估大语言模型对法国地域文化与知识的细粒度推理能力。该数据集涵盖法国13个大区的2431道题目,横跨文化、语言、人口、经济、环境等14个主题领域,并包含专门针对语言变异的子集CARTE-LV。其核心研究问题在于揭示当前评测基准过度依赖翻译或英语中心数据集,难以捕捉国家内部的区域文化差异。CARTE通过构建地域锚定的评测框架,为法语及欧洲语言模型的区域文化对齐研究提供了重要工具,推动了语言模型评估从通用能力向文化敏感性的范式转变。
当前挑战
CARTE数据集面临的核心挑战在于解决大语言模型对法国内部区域文化知识理解的系统性不足。领域层面,现有评测多聚焦国家层面的通用知识,忽略了区域内文化、语言、经济等维度的细粒度差异,导致模型在涉及地域专属词汇、传统习俗或地方政策等场景时表现不佳。构建过程中,研究人员面临多重困难:需从分散的开放获取文献中手工筛选并确保区域代表性,同时避免依赖现有网络问答数据导致的知识过时问题;自动生成题目时需设计逼真的干扰选项,并确保区域分布的平衡性,而源材料的不均匀性使得部分地区的题目覆盖不足。此外,缺乏人工验证的自动生成流程可能引入偏差,进一步增加了质量控制的难度。
常用场景
经典使用场景
CARTE数据集专为评估大语言模型在法国境内细粒度地域知识与文化理解能力而设计,其最经典的应用场景是衡量模型对13个大区、14个主题领域(包括文化、语言、人口、经济、环境与交通等)的区域性知识掌握程度。通过2431道多项选择题,研究者能够系统性地检验模型是否具备区分法国不同区域之间微妙差异的能力,从而超越以往仅关注国家层面的文化评估基准。
衍生相关工作
CARTE衍生出的经典工作包括其子集CARTE-LV,专门聚焦于法国区域语言变异(如方言词汇、语法标记与语用差异),为评估模型在地区性语言学特征上的表现提供了独立基准。相关后续研究还探索了基于该数据集的困难层级校准与位置偏差检测方法,促进了更精细的文化推理鲁棒性分析,并启发了面向其他语种或国家的区域文化基准构建范式。
数据集最近研究
最新研究方向
CARTE基准的提出标志着大语言模型评估从泛语言与国家级文化理解向细粒度区域化认知的范式转变。该数据集聚焦法国13个大区的14个主题领域,通过2431道多选问题系统评估模型对区域经济、语言变异、文化遗产等本土化知识的掌握程度。研究揭示,即便在法语专用模型中,不同大区间的性能差异与参数规模非单调相关,暴露了预训练语料中区域覆盖的不均衡性。CARTE-LV子集进一步深入语言变体评估,挑战模型对法语地区方言、词汇与语用特征的敏感性。此工作不仅填补了内部文化多样性评估的空白,更促使学界反思当前以英语为中心或翻译式基准的局限性,推动发展更具文化语境感知能力的语言模型,对主权AI系统的地域适应性具有深远指导意义。
相关研究论文
  • 1
    CARTE: A Benchmark for Mapping Language Model Knowledge Across France巴黎综合理工学院; 雅典国立技术大学; 穆罕默德·本·扎耶德人工智能大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务