遇见数据集

Data-Gouv-FR/compar-ia

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Compar:IA是一个对话式AI比较器(聊天机器人竞技场),由法国文化部开发,具有双重使命:培训和提升对模型多样性、文化语言偏见及对话式AI环境问题的认识;收集和发布用于观察使用情况和改进法语对话式AI的问题和偏好数据集。该比较器在compar:IA初创公司(隶属于法国数字局DINUM的beta.gouv.fr计划)框架下开发,帮助公共机构构建有用、简单易用的数字服务。收集的数据发布为三个数据集:1. Conversations compar:IA:包含平台上所有提问和回答的数据集。2. Votes compar:IA:汇总用户在完整对话后表达偏好的数据集,用于在没有单个消息反应时比较两个模型。3. Réactions compar:IA:汇总用户在消息级别反应的数据集,反映在讨论过程中逐条消息表达的偏好。

Compar:IA is a conversational AI comparator (a chatbot arena) developed within the French Ministry of Culture with a dual mission: to train and raise awareness about model diversity, cultural and linguistic biases, and environmental issues of conversational AIs; and to create and publish datasets of questions and preferences useful for observing usage and improving conversational AIs in French. The comparator is developed as part of the compar:IA startup (integrated into the beta.gouv.fr program of the Interministerial Directorate for Digital Affairs, DINUM), which helps public administrations build useful, simple, and easy-to-use digital services. The data collected via compar:IA is published in three datasets: 1. Conversations compar:IA: A dataset of all questions asked and answers received on the compar:IA platform. 2. Votes compar:IA: A dataset aggregating user preferences expressed after an entire conversation, used to compare two models when no reactions have been given on individual messages. 3. Réactions compar:IA: A dataset aggregating user reactions at the message level, reflecting preferences expressed message by message during discussions.

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/compar-ia 数据集图片
构建方式
Compar:IA数据集源自法国文化部主导开发的同名对话式人工智能比较平台(Chatbot Arena),旨在通过用户与多个语言模型的实时交互,系统性地收集法语语境下的对话数据。该平台集成于法国政府数字服务计划beta.gouv.fr框架内,由跨部门数字事务局(DINUM)支持。数据采集过程涵盖完整的对话链路:首先记录用户提出的所有问题及对应模型生成的回答,构成“对话”数据集;随后通过会话结束后的用户投票机制,捕获对模型整体表现的偏好,形成“投票”数据集;最后对用户在消息层面的即时反应(如点赞、踩等反馈)进行细粒度记录,构建“反应”数据集。这些结构化数据以开放许可形式发布于法国开放数据平台data.gouv.fr。
特点
该数据集具有三大核心特征:其一,聚焦法语文化与语言多样性,特别关注模型在处理法语表达、文化语境及生态议题时的表现差异,填补了非英语AI评估数据的空白。其二,采用多层级偏好标注体系,既能通过宏观投票勾勒模型间的相对优势,又能利用微观消息反应捕捉对话中的局部质量问题,形成从全局到局部的立体评估视角。其三,数据源自真实用户与模型的自然交互,而非人工构造的测试集,确保了生态效度——用户的随意提问与真实偏好能更精准反映日常使用场景中的模型实用性。
使用方法
该数据集主要服务于三个方向:研究者可下载“对话”数据用于分析模型在法语场景下的生成质量、安全性与文化适应性;“投票”数据适用于基于配对比较的模型排行榜构建,如Elo评分或Bradley-Terry模型;而“反应”数据则能支持细粒度的奖励建模(Reward Modeling),为强化学习人类反馈(RLHF)的偏好训练提供非英语语料补充。用户可直接访问data.gouv.fr上的对应资源链接,获取CSV格式的原始数据并独立开展分析,无需额外授权。
背景与挑战
背景概述
Compar:IA数据集由法国文化部联合跨部门数字事务局(DINUM)于2024年前后创建,旨在应对法语对话式人工智能系统在文化多样性与语言偏见方面的评估需求。该数据集基于“聊天机器人竞技场”平台collective-audience场景,通过收集用户与多个AI模型交互中的问题、回复、偏好投票及即时反馈,构建了一个多维度、开放的法语人机对话语料库。作为法国政府主导的数字公共服务项目,其核心研究问题聚焦于:如何通过用户真实偏好数据提升对话AI对法语文化语境与隐性偏见的适应性。该数据集对法语地区人工智能伦理评估、文化敏感性训练以及多语言模型价值对齐领域具有重要推动意义。
当前挑战
该数据集面临双重挑战。在领域层面,现有对话AI评估体系多以英语为中心,缺乏对法语文化中特定语言习惯(如代词性别、正式/非正式称谓)及政治正确性标准的系统性刻画,亟需通过细粒度偏好数据弥补模型对拉丁文化逻辑的认知鸿沟。在构建过程中,平台需平衡用户隐私保护与数据开放性,尤其涉及政治、宗教等敏感话题的对话需匿名化处理;同时,用户自愿标注的偏好数据可能存在地域文化偏差或极端价值观干扰,需设计动态校准机制以过滤恶意投票,确保数据集真实反映多元文化视角下的合理评价准则。
常用场景
经典使用场景
Compar:IA 作为一个专注于法语对话智能体评估的众包平台,其经典使用场景在于构建和发布法语环境下的大语言模型偏好数据集。研究者利用该平台收集用户在多轮对话中对不同模型回答的偏好选择,从而形成结构化的评估基准。这些数据不仅涵盖模型回答的质量比较,还涉及用户对文化、语言偏见以及环境影响的敏感性反馈。该数据集常被用于训练奖励模型、优化基于人类反馈的强化学习(RLHF)流程,以及推动法语大模型的个性化调优,尤其适用于多语言模型在法语区域的性能验证与迭代。
解决学术问题
该数据集直面法语大语言模型评估中缺乏高质量、多元化人工反馈数据的痛点,系统性地解决了三个关键学术难题:其一,量化和分析模型在法语语境下存在的文化偏见与语言多样性缺失问题;其二,建立基于真实用户交互的开放式对话评估方法,替代传统封闭式基准测试;其三,支持对模型在多维指标(如准确性、流畅性、文化适配性)上的细粒度偏好建模。其意义在于为法语自然语言处理领域提供了第一个大规模、用户驱动的偏好数据源,填补了非英语语言在人类反馈对齐研究中的空白,显著推动了多语言AI公平性与文化包容性研究。
衍生相关工作
基于 Compar:IA 的数据,衍生出一系列具有影响力的工作:包括构建专用于法语偏好对齐的奖励模型(如基于 Bradley-Terry 框架的偏好评分系统)、开发针对多轮对话的细粒度用户反馈聚合方法,以及设计融合文化维度的AI评估指标体系。在学术领域,该数据集催生了围绕法语大模型的文化适配性比较研究,例如分析 GPT 系列与开源模型在法国媒体、文学术语上的表现差异。此外,部分工作将其与 Chatbot Arena 模式结合,探索如何通过众包竞技机制高效收集高质量偏好数据,进而反向推动模型蒸馏与高效微调技术的创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务