遇见数据集

CARTE

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

CARTE(文化锚定区域领土评估)是一个基准数据集,旨在评估语言模型对法国本土区域差异的理解能力。该数据集覆盖法国全部13个本土大区,涵盖文化、语言、人口统计、经济、环境、交通和区域认同等多个领域。它包含一个名为CARTE-LV的子集,专门聚焦于法国境内的区域语言变异研究。数据集以单个JSONL文件(carte_benchmark.jsonl)的形式提供,规模在1千到1万条样本之间,每条记录对应一个多项选择题,以JSON对象存储,包括问题文本、选项列表、正确答案、关联的法国大区、所属主题领域以及是否属于CARTE-LV子集的布尔标志。数据集主要用于评估语言模型的地理和语言文化知识,推荐同时报告在完整数据集和语言变异子集上的性能,以便进行更细粒度的分析。数据集语言为法语,采用CC BY-NC 4.0许可协议发布。

CARTE (Culturally Anchored Regional Territorial Evaluation) is a benchmark dataset designed to evaluate language models' ability to comprehend regional differences within metropolitan France. This dataset covers all 13 metropolitan regions of France, spanning multiple domains including culture, language, demographics, economy, environment, transportation, and regional identity. It includes a subset named CARTE-LV, which specifically focuses on research into regional language variation within France. The dataset is provided as a single JSONL file (carte_benchmark.jsonl), consisting of between 1,000 and 10,000 samples. Each record corresponds to a multiple-choice question, stored as a JSON object that includes the question text, option list, correct answer, associated French region, affiliated thematic domain, and a boolean flag indicating whether the sample belongs to the CARTE-LV subset. The dataset is primarily utilized to evaluate the geographic and linguistic-cultural knowledge of language models. It is recommended to report model performance on both the full dataset and the language variation subset to support more fine-grained analytical studies. The dataset is written in French and released under the CC BY-NC 4.0 license.

创建时间:
2026-05-29
原始信息汇总

数据集概述

CARTE(Culturally Anchored Regional-Territorial Evaluation) 是一个用于评估语言模型对法国本土区域变异理解能力的基准数据集。该数据集覆盖法国本土全部13个大区,涉及文化、语言、人口、经济、环境、流动性和区域身份等多个领域。此外,数据集还包含一个子集 CARTE-LV,专门聚焦于法国境内的区域语言变异。

数据集基本信息

  • 许可证: CC BY-NC 4.0
  • 语言: 法语
  • 标签: Benchmark, LLMBenchmark, NLP, FrenchBenchmark, LLM, Evaluation, LLMEvaluation
  • 规模: 1K < n < 10K(样本数量在1000到10000之间)

数据结构

数据集以单个 JSONL 文件形式提供(carte_benchmark.jsonl),每一行对应一个多项选择题,存储为一个 JSON 对象。每个问题包含五个选项(A–E),其中一个是正确答案,三个是合理的干扰项,一个是“我不知道”选项。

数据字段说明

字段 描述
question 问题文本
choices 答案选项列表
answer 正确答案标签
region 关联的法国大区
domain 主题类别(如文化、语言、经济)
is_carte_lv 布尔值,指示该示例是否属于 CARTE-LV 子集

数据集构成

基准 描述
CARTE 完整数据集(所有示例)
CARTE-LV 聚焦区域语言变异的子集(is_carte_lv = true

推荐评估方式

建议在两个子集上分别报告结果:

  • CARTE: 评估区域知识整体表现
  • CARTE-LV: 评估语言变异任务上的表现

这种分离有助于对语言模型的地域和语言理解能力进行更细粒度的分析。

搜集汇总
数据集介绍
CARTE 数据集图片
构建方式
CARTE(Culturally Anchored Regional-Territorial Evaluation)是一个专为评估语言模型对法国本土区域变异理解能力而设计的基准数据集。该数据集覆盖法国全部13个大区,并横跨文化、语言、人口、经济、环境、流动性与区域认同等多个领域。所有数据以单一JSONL文件形式呈现,每行对应一道多项选择题,包含一个问题文本、五个选项(A至E,其中一项为正确答案、三项为合理干扰项、一项为“我不知道”选项)、正确答案标签、所属区域、主题领域以及是否属于CARTE-LV子集的布尔标记。CARTE-LV是聚焦于法国境内区域语言变异的子集,通过布尔字段区分,便于研究者进行针对性分析。
特点
CARTE数据集的核心特点在于其精细的地域与主题双重架构,既覆盖法国所有大区的多维度知识,又通过CARTE-LV子集突出了区域语言变异的独特评估视角。每个问题均配备专业设计的干扰项与“我不知道”选项,有效规避模型随机猜测的干扰,确保评估结果的可靠性。数据集规模介于1K至10K之间,兼顾了评估的全面性与计算效率。此外,基于CC BY-NC 4.0许可协议发布,鼓励学术研究使用,并通过arXiv论文提供详细方法论,增强了数据的透明性与可复现性。
使用方法
使用CARTE数据集时,研究者可直接加载carte_benchmark.jsonl文件,按行解析JSON对象以获取问题与选项。推荐在模型评估中同时报告CARTE全集与CARTE-LV子集的性能:前者反映模型对法国区域知识的整体掌握程度,后者则专门衡量其区域语言变异的理解能力。这种双轨评估策略有助于更细致地剖析模型的地理与语言认知局限。数据集中已通过is_carte_lv字段预标记子集归属,用户只需按布尔值过滤即可分离出CARTE-LV样本,无需额外处理。
背景与挑战
背景概述
CARTE(Culturally Anchored Regional-Territorial Evaluation)是一个于2026年由S. A. Carneiro、C. Xypolopoulos、X. Fei、Y. Zhang和M. Vazirgiannis等研究人员创建的基准数据集,旨在系统评估语言模型对法国本土区域变异性的理解能力。该数据集覆盖法国全部13个大区,横跨文化、语言、人口、经济、环境、流动性和区域认同等多个领域,为自然语言处理领域提供了首个专注于区域地理与语言知识评估的标准化测试工具。CARTE的发布推动了语言模型在细粒度地理文化知识方面的评价研究,对于理解模型如何捕捉和表征区域性文化特征具有重要影响力。
当前挑战
CARTE所解决的领域核心挑战在于现有语言模型评估基准严重缺乏对区域文化变异性的关注,多数基准仅考察通用知识或粗粒度地域特征,无法反映模型在真实多文化情境下的理解能力。数据集构建过程中面临多重挑战:首先,需要从大量地区性资料中提炼出准确、多样且代表各区域独特性的问答内容;其次,设计合理的干扰项以平衡难度并避免模型通过表层模式猜测答案;此外,确保每个问题与对应区域的强关联性,避免跨区域知识混淆,同时保持CARTE-LV子集中语言变异问题的专业性和代表性。
常用场景
经典使用场景
CARTE基准数据集专为评估语言模型对法国本土区域差异的认知能力而设计,涵盖了文化、语言、人口、经济、环境、流动性和区域身份七个领域,覆盖法国全部13个大区。其最经典的使用场景是对大型语言模型进行多领域、多区域的地理知识探查,通过多选问答形式检验模型在区域特征理解上的表现。研究者可借助CARTE全面评估模型对不同法国地区在非语言和语言维度上的知识掌握程度,尤其适用于跨区域知识对比和模型地理文化敏感性的精细分析。
解决学术问题
CARTE数据集解决了自然语言处理领域中一个长期被忽视的学术问题:如何系统性地评估语言模型对特定国家内部区域多样性的理解能力。传统评估基准多聚焦于通用知识或单一语言能力,忽略了地理文化背景对模型表现的深刻影响。CARTE填补了这一空白,为研究者提供了量化模型在区域文化、语言变异、经济特征等维度上认知水平的工具。该基准的出现推动了地理语言学和计算语言学的交叉研究,促使学界关注模型在细粒度地域知识上的偏差与不足,进而推动更具地域包容性的语言模型发展。
衍生相关工作
CARTE数据集的推出催生了一系列相关研究工作。围绕该基准,研究者开发了针对区域知识增强的微调方法和提示策略,例如通过引入地理位置信息改进模型对法国各地区问题的回答准确率。CARTE-LV子集激发了专门聚焦法语方言和地区语言变体的模型评估研究,推动了低资源语言变体的基准构建。此外,该数据集促进了跨语言区域知识基准的对比分析,启发了面向其他多区域国家(如德国、意大利等)类似基准的构建工作,形成了地域化语言模型评估的新研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务