遇见数据集

P3B3

收藏
arXiv2026-06-15 更新2026-06-17 收录
官方服务:

资源简介:

P3B3是由新里斯本大学研究团队创建的葡萄牙语变体偏见基准数据集,专门用于评估大语言模型对欧洲葡萄牙语和巴西葡萄牙语的偏好偏差与可控性。该数据集包含74个精心设计的多轮对话,共计203个对话轮次,通过语言专家手工构建,确保内容在词汇、语法和称呼形式等方面能自然引发两种变体的系统性差异。数据集聚焦于日常交流领域,旨在解决当前大语言模型中葡萄牙语变体表征不平衡的问题,为开发更公平的多语言系统提供评估基础。

P3B3 is a Portuguese variant bias benchmark dataset developed by the research team from the New University of Lisbon, which is specifically dedicated to evaluating the preference bias and controllability of large language models (LLMs) towards European Portuguese and Brazilian Portuguese variants. This dataset consists of 74 carefully designed multi-turn dialogues, with a total of 203 dialogue turns, and was manually constructed by language experts to ensure that the content can naturally trigger systematic differences between the two variants in terms of vocabulary, grammar, and forms of address. Focusing on the domain of daily communication, this dataset aims to address the problem of unbalanced representation of Portuguese variants in current large language models, providing an evaluation basis for the development of more equitable multilingual systems.

创建时间:
2026-06-15
原始信息汇总

P3B3 基准测试数据集概述

P3B3 是一个用于评估大型语言模型 (LLMs) 对葡萄牙语变体 (欧洲葡萄牙语 vs 巴西葡萄牙语) 偏好的基准测试。该工作已被 ACL 2026 的 MeLLM 研讨会接收。

核心目标:通过多轮对话生成和自动化评估,检测 LLMs 在生成回复时是否对特定葡萄牙语变体存在偏好或偏见。

评估方法

  • 基于分类器的评分:使用 Transformer 模型将回复分类为欧洲葡萄牙语 (pt_pt) 或巴西葡萄牙语 (pt_br),并输出 0-1 之间的概率分数。
  • 基于 LLM 的评分:使用 Gemini 模型对回复进行评估,在 0-10 的尺度上打分,并附带关于葡萄牙语变体偏好和语言特征的说明。

数据与资源

  • 配置文件config/settings.py 包含模型和 API 设置。
  • 静态资源resources/all_prompts.json 包含多轮对话提示。
  • 评估结果:生成的模型回复和评分存储在 results/ 目录。
  • 分析输出:分析和可视化结果存储在 outputs/ 目录。

支持的模型后端

  • API 模型:Gemini (通过 LangChain)、Sabia (需设置 API 密钥)。
  • VLLM 模型:任何兼容 CUDA 的 Hugging Face 模型 (如 meta-llama/Meta-Llama-3-8B-Instruct)。
  • Ollama 模型:需运行本地 Ollama 服务器,格式为 ollama/<model_name>

使用流程

  1. 生成对话:使用指定模型生成多轮回复。 bash python -m src.evaluation.generate --model-name-or-path <model_path>

  2. 评分回复

    • 基于分类器python -m src.evaluation.score_with_classifier results/<model_folder>
    • 基于 LLM 评判python -m src.evaluation.score_with_llm results/<model_folder> --judge_name <judge_model>
  3. 聚合结果python -m src.analysis.aggregation

  4. 可视化分析python -m src.analysis.turn_analysis <scores_file>

论文与引用

该数据集对应的论文为:P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs

搜集汇总
数据集介绍
P3B3 数据集图片
构建方式
P3B3基准数据集的构建遵循专家主导与多样性驱动的双重原则。该数据集由两位拥有语言学硕士学位的专家手工创建,包含74个多轮对话(总计203个轮次),每个对话包含2至6轮。设计上借鉴MT-Bench的架构,后一轮用户输入建立在先前对话语境之上,且不要求前一轮产生特定回复,从而在维持对话连贯性的同时隔离生成行为。为确保语料能有效激发欧式葡语(pt-PT)与巴式葡语(pt-BR)之间的系统差异,专家精心选取了交通、购物、家居等日常领域,这些领域在词汇、正字法和称呼语上展现出丰富的变体特征。所有提示均采用变体无关设计,避免在输入中显式提及语言变体,以杜绝启动效应。
特点
P3B3的核心特色在于其对话性、变体敏感性与无偏性。作为首个聚焦葡语变体偏见的对话式基准,它通过多轮交互累积语境效应,使单轮提示中难以观测的隐性偏见得以放大。数据集包含203个轮次,平均每轮14.1词,展现出高词汇多样性(每对话形符-类符比0.73)及短语变异(Distinct-2为0.71,Distinct-3为0.88),确保语言刺激的丰富性。此外,数据集完全由专家手工构建,排除了自动生成方法可能引入的噪音,使得生成结果中的变体偏好能够真实反映模型的内在倾向,而非提示中的显式指令。
使用方法
P3B3提供了三种评测设置以全面度量模型的变体偏见与可控性。在无提示设置下,模型在无任何变体指定时生成回复,用以衡量内在偏好;在pt-BR提示与pt-PT提示设置下,模型在首个对话轮次中收到明确指令,要求其使用指定变体回复,从而评估对指令的遵循程度。评测采用双轨策略:一方面使用PeroVaz与PtBrVId等基于BERT的编码器分类器提供低成本互补信号;另一方面借助Gemini-3-Flash等大语言模型作为裁判,在0(pt-BR)到10(pt-PT)量表中评分,辅以思维链解释。两种方法在人类标注验证下展现强一致性,确保评测结果的可靠性。
背景与挑战
背景概述
2026年,由葡萄牙新里斯本大学NOVA LINCS实验室的研究团队,在Rafael Ferreira等人的带领下,推出了P3B3基准数据集。该数据集聚焦于评估大语言模型在葡萄牙语两种主要变体——欧洲葡萄牙语与巴西葡萄牙语之间的生成偏好与可控性。随着大语言模型广泛嵌入日常交流,捕捉地区语言变异对实现可靠且公平的语言使用至关重要。然而,当前训练与评估框架常将葡萄牙语视为单一语言,而巴西葡萄牙语数据在大型语料库中占据主导地位,导致模型默认偏向巴西葡萄牙语,形成“无声偏见”。P3B3作为首个针对生成阶段、专家精心构建的多轮多领域对话基准,为系统性分析与缓解这一语言变体偏见提供了关键评估工具,对推动多语种系统的公平发展与语言文化多样性保护具有重要影响力。
当前挑战
P3B3所解决的领域核心挑战在于,大语言模型在处理葡萄牙语变体时存在显著的不平等现象。多数模型在无明确提示下表现出对巴西葡萄牙语的强烈偏好,且将模型显式引导至欧洲葡萄牙语的效果因模型而异,可控性不足,反映了训练数据不平衡对生成行为的深刻影响。此外,在基准构建过程中,挑战在于设计出对变体敏感但提示本身无偏向的多轮对话。需确保对话主题覆盖交通、购物等日常领域,且能自然诱发词汇、句法及拼写上的变异差异,同时避免因提示语本身泄露变体信息而产生启动效应。这要求语言专家具备对葡萄牙语变体细微、系统性差异的深度理解,以手工构建74个高质量对话,从而有效隔离并测量模型的隐性偏好与生成行为。
常用场景
经典使用场景
在全球多语种大语言模型日益融入日常通信的背景下,P3B3作为首个面向葡萄牙语变体偏见的专家级多轮对话基准,被广泛用于测量模型在生成形态上对欧洲葡萄牙语与巴西葡萄牙语的偏好程度。该基准以74组精心设计的变体无关对话为核心,覆盖交通、购物、家居产品等高频日常领域,能够在不注入显式变体线索的前提下,触发词汇、句法及形态层面自然且细微的跨变体差异。研究者借助该系统性地探测大语言模型在隐含偏好下的生成倾向,并评估显式引导变体时的可控性。P3B3填补了葡萄牙语变体评估领域的空白,为构建语言公平的多语系统提供了关键测试平台。
衍生相关工作
P3B3的出现激励了一系列围绕葡萄牙语变体公平性的拓展性研究。一方面,基于P3B3中的评测范式,研究者开发出融合分类器与大模型裁判的联合变体打分方案,提升了变体偏好量化的精度与鲁棒性;另一方面,该数据集推动了针对欧洲葡萄牙语的专门化大模型如AMALIA系列的性能验证与迭代方向,后续模型训练策略开始在预训练语料中引入更均衡的变体配比。此外,P3B3的多轮对话结构启发了针对非洲葡语变体(如安哥拉、莫桑比克)的评测基准构建探索,促使学界从单一语言变体评测走向多中心语言变体生态的系统性建模。
数据集最近研究
最新研究方向
大型语言模型(LLM)在葡萄牙语变体(欧洲葡萄牙语pt-PT与巴西葡萄牙语pt-BR)间的生成偏差与可控性评估成为前沿热点。P3B3基准通过专家精心设计的74组多方对话,在无显式变体提示下探查模型内在偏好。研究发现多数LLM受训练数据中巴西葡萄牙语主导的影响,显著偏向pt-BR,且在多轮对话中可控性随上下文积累而衰减。该工作首次系统揭示了跨葡萄牙语变体的生成时偏差,为构建更均衡的多语种表征、推动语言多样性保护及开发面向地域变体的可控生成技术提供了关键评估框架。
相关研究论文
  • 1
    P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs新里斯本大学; NOVA LINCS · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务