遇见数据集

comparia-french-maxx

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

Compar:IA-French-Maxx 是一个针对法语 Compar:IA 对话平台优化的高质量偏好数据集,旨在提升 Compar:IA 竞技场排行榜的性能。数据集包含 6,075 条助手回复,每条回复都是针对真实 Compar:IA 对话的“最佳可能”回答,并与被击败的较弱回复配对。数据分为三个子集:Arena - general(1,500 行,来自竞技场中较难的两个原始回复之一与最优回复的比较)、Arena - both_bad(2,400 行,来自用户评价为“两者都差”的两个回复)、Reactions(2,175 行,来自用户负面反应的确切助手消息)。共提供 6,059 个可用偏好对,其中 4,907 个强偏好、1,031 个中等偏好、121 个弱偏好、16 个无偏好。每条记录包含对话历史(messages)、最优回复(response_optimal 及其格式化版本 response_optimal_styled)、被击败的回复(rejected 和可选的 rejected_2)、偏好强度(pref_strength)、缺陷标签(incorrect, superficial, instructions_not_followed,仅反应子集有)、对话轮次信息(conversation_turns, is_multi_turn, prompt_chars)以及来源标识(source, id)。数据集适用于监督微调(SFT)和偏好优化(如 DPO、ORPO、KTO),并支持按偏好强度、缺陷类型或对话结构进行过滤。注意:回复由模型生成,偏好判断为近似值;弱/中等偏好对可能噪声较大;源数据许可为 Etalab 2.0 和 CC-BY-4.0,已过滤 PII,保留未审核内容。

Compar:IA-French-Maxx is a high-quality preference dataset optimized for the French Compar:IA dialogue platform, aimed at improving the performance of the Compar:IA Arena leaderboard. The dataset contains 6,075 assistant responses, each being the best possible answer to a real Compar:IA conversation, paired with a defeated weaker response. The data is divided into three subsets: Arena - general (1,500 rows, comparing one of two original difficult responses from the arena with the optimal response), Arena - both_bad (2,400 rows, from two responses rated as both bad by users), and Reactions (2,175 rows, from exact assistant messages that received negative user reactions). It provides a total of 6,059 usable preference pairs, including 4,907 strong preferences, 1,031 moderate preferences, 121 weak preferences, and 16 no preferences. Each record includes conversation history (messages), optimal response (response_optimal and its formatted version response_optimal_styled), defeated response (rejected and optional rejected_2), preference strength (pref_strength), defect labels (incorrect, superficial, instructions_not_followed, only in Reactions subset), conversation turn information (conversation_turns, is_multi_turn, prompt_chars), and source identifiers (source, id). The dataset is suitable for supervised fine-tuning (SFT) and preference optimization (e.g., DPO, ORPO, KTO), and supports filtering by preference strength, defect type, or dialogue structure. Note: Responses are model-generated, preference judgments are approximate; weak/moderate preference pairs may have high noise; source data is licensed under Etalab 2.0 and CC-BY-4.0, PII filtered, unmoderated content retained.

创建时间:
2026-07-31
原始信息汇总

Compar:IA-French-Maxx 数据集概述

基本信息

  • 数据集名称: Compar:IA-French-Maxx
  • 语言: 法语
  • 任务类型: 文本生成(text-generation)
  • 标签: comparia、french、sft、dpo、preference、chatbot-arena、instruction-tuning
  • 数据规模: 1K < n < 10K(共 6,575 行)
  • 许可证: etalab-2.0 和 cc-by-4.0
  • 数据格式: Parquet(单个训练集文件,位于 data/train-00000-of-00001.parquet

数据集内容

该数据集包含针对真实 Compar:IA 对话的优化响应,共 6,575 条助手回复,每条回复都被设计为对真实 Compar:IA 对话的“最佳可能”回答,并配有被其击败的较弱回复。可用于监督微调(SFT)偏好优化(如 DPO) 等任务。

数据子集构成

子集 行数 说明
Arena - general 1,500 原始竞技场两条回复中较难的一条(1,485 行有值);第二条竞技场回复(1,476 行有值)
Arena - both_bad 2,400 人类投票者标记为 both_bad 的两条回复中较难的一条;另一条人类拒绝的回复
Reactions 2,675 收到用户负面反应的精确助手消息(2,674 行有值)
总计 6,575 6,559 个可用偏好对;3,876 行有第二个负面回应

偏好强度分布

  • strong: 5,359 对
  • medium: 1,055 对
  • weak: 145 对
  • none: 16 对

核心列说明

列名 类型 用途
messages list[{role, content}] 对话历史(以用户回合结束),用于 SFT 上下文或偏好提示
response_optimal string 优化回复(纯文本、内容优先),用于 SFT 目标或偏好 chosen
response_optimal_styled string 相同内容但已格式化(标题/粗体/列表)
rejected string null
rejected_2 string null
pref_strength string null
incorrect bool null
superficial bool null
instructions_not_followed bool null
conversation_turns int 消息中的用户回合数
is_multi_turn bool 用户回合数是否大于 1
prompt_chars int 最终用户消息的字符数
source string arenareactions
id string 回溯到源数据集的可溯源标识

可筛选的标注信号

反应行保留了用户的非排他性缺陷标签(竞技场行为空值):

  • incorrect(1,185 行): 用户标记回复为事实上或实质上不正确
  • superficial(918 行): 用户标记回复过于浅显或不完整
  • instructions_not_followed(817 行): 用户标记未遵循指令

优化回复的生成方法

  • 使用 Le Chaton Fat 的代理流水线生成,并经过独立交叉评审和绝对批评者门控
  • 竞技场数据: 优化回复经盲法成对评判,击败两个竞技场模型回复,并应用 Compar:IA 的风格控制,使其在实质上而非格式上获胜
  • 反应数据: 优化回复修复了用户标记的特定缺陷,并经专家批评者门控
  • 多轮竞技场对话使用优化的早期回复作为历史上下文

使用建议

  • SFT: 将 response_optimal 作为最终助手回合附加到 messages
  • 偏好优化: 筛选有 rejected 的行(6,559 对),可选仅保留 strong 对(5,359 对);将 messages 作为 prompt、response_optimal 作为 chosen、rejected 作为 rejected
  • 格式变体: 可将 response_optimal 替换为 response_optimal_styled 以训练展示格式变体
  • 按缺陷或对话形态筛选: 可依据 instructions_not_followedis_multi_turnsuperficialprompt_chars 等字段过滤

注意事项

  • 回复为模型生成,LLM-as-judge 的偏好判断近似但不等于人类偏好
  • weak/medium 对噪声较大,建议按 pref_strength 过滤以获得干净的偏好训练数据
  • 源数据许可和隐私条款适用(Etalab 2.0 / CC-BY-4.0,经 PII 过滤,保留未审核内容)
搜集汇总
数据集介绍
comparia-french-maxx 数据集图片
构建方式
该数据集基于法国公共部门人工智能平台Compar:IA的真实用户对话构建,通过代理流水线生成最优回复,并经过独立交叉评审与绝对评论门控。数据集包含三个子集:竞技场通用(1,500行)、竞技场双差(2,400行)和用户反应(2,675行),总计6,575条助手回复。每条记录包含对话历史、最优回复(含纯文本与格式化两种风格)、被击败的较弱回复,以及偏好强度标注。构建过程遵循Compar:IA的风格控制,确保最优回复在实质内容上胜出,而非依赖格式。
特点
数据集的核心特色在于其精细的偏好信号与可过滤的元数据。每条记录提供pref_strength字段(强/中/弱/无)以反映偏好判定的可靠性,反应子集还包含用户标记的缺陷标签(如不准确、肤浅、未遵循指令),为失败模式分析提供依据。对话形态字段(轮次、多轮标志、提示长度)支持多轮训练与长上下文研究。来源追踪字段(id)确保数据可追溯至原始Compar:IA数据集,满足法国公共数据许可要求。
使用方法
数据集设计支持多种训练范式。监督微调可将最优回复追加至消息末尾作为目标;偏好优化(如DPO、ORPO)则使用messages作为提示、response_optimal作为chosen、rejected作为负样本,并可依据pref_strength过滤出最干净的偏好对。研究者还可按缺陷标签或对话形态进行细粒度过滤,例如筛选指令遵循失败或长且肤浅的对话。建议根据任务需求选择纯文本或格式化变体,并注意弱偏好对的噪声特性。
背景与挑战
背景概述
Compar:IA-French-Maxx数据集由法国文化部(ministère de la Culture)于2024年创建,旨在为法语大语言模型的指令微调与偏好优化提供高质量训练资源。该数据集源自真实用户与Compar:IA聊天机器人平台的交互记录,通过智能体管道生成最优回复,并辅以独立交叉评审与绝对评判门槛。其核心研究问题在于如何利用真实世界对话数据,系统性地提升法语模型在开放性任务中的响应质量与人类偏好对齐程度。该数据集提供6,575条人工验证的优选回复,覆盖竞技场对话与用户反馈场景,为SFT及DPO等偏好优化算法提供了丰富的训练样本。其发布对法语NLP社区具有显著推动意义,尤其为低资源语言模型的对齐研究提供了宝贵的数据基础。
当前挑战
该数据集面临的核心挑战涵盖领域问题与构建过程两大层面。在领域问题层面,法语大语言模型在开放域对话中常出现事实性错误、回答肤浅、指令遵循失败等缺陷,而现有人类偏好数据多集中于英语,导致法语模型对齐研究缺乏可靠资源。Compar:IA-French-Maxx通过采集真实用户负面反应及竞技场对比,旨在提供细粒度的缺陷标注(如incorrect、superficial、instructions_not_followed)以精准指导偏好优化。在构建过程中,挑战在于确保生成回复的客观优越性:需采用多阶段智能体管道,结合盲评与绝对评判门槛,以筛选出超越原始回复的优选答案;同时需处理偏好强度的不确定性(如弱标签的噪声),并通过人工核验标注偏好置信度(strong、medium、weak),以保证训练数据的可靠性与有效性。
常用场景
经典使用场景
在自然语言处理与人工智能对齐研究的广阔疆域中,高质量的人类偏好数据始终是驱动大语言模型(LLM)行为塑造的核心燃料。该数据集以6,575条精心构筑的优选回复为核心,每条回复均针对法国真实用户与模型的交互对话而生,并配以被其击败的较弱回应,从而天然构成监督微调(SFT)与偏好优化(如DPO、ORPO、KTO)的黄金训练语料。研究者可便捷地将其转换为标准的prompt-chosen-rejected三元组,亦可直接提取完整对话历史用于指令微调,其简洁的列结构与即用型代码示例,使得从数据到模型的转化路径异常流畅。
衍生相关工作
该数据集已衍生一系列可预见的研究工作,并与当前前沿方法紧密相连。其明确的“偏好强度”标注为校准LLM-as-a-Judge的可信度提供了宝贵基准,催生了关于偏好评估可靠性研究的实证测试。基于“反应”子集中的细粒度缺陷标签,可开发更精细的奖励模型,从而超越单一的胜/负二元判断,实现对多样性失败模式的精确惩罚。此外,该数据集亦为多语言RLHF(人类反馈强化学习)和跨文化风格控制的研究提供了独特素材,其“最优带样式回复”与“纯文本回复”的对照设计,更是为探究格式对主观评价影响的消融实验铺平了道路。
数据集最近研究
最新研究方向
该数据集聚焦于法语大语言模型的指令微调与偏好优化前沿,通过整合真实法语用户对话与多维度质量标注,构建了兼具SFT与DPO训练效能的优质语料库。其核心创新在于引入'最优响应'生成机制与细粒度的偏好强度分级,涵盖事实性错误、浅层回答、指令遵循失败等缺陷标签,为多轮对话、长上下文及指令遵循等复杂场景提供了可筛选的训练信号。这一构建范式呼应了当前对真实性与可控性并重的对齐研究趋势,推动了法语Arena基准的演进,为多语言环境的鲁棒对齐提供了重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务