遇见数据集

quantibias

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

QuantiBias 是一个用于评估大型语言模型(LLM)后训练量化所引发偏见的基准测试协议,而非传统静态数据集。其核心目标是揭示量化压缩可能导致的特定故障模式:在保持短格式安全行为(如直接拒绝、过度拒绝、多项选择偏见得分)基本不变的同时,使模型在开放式生成中主动表达的偏见显著上升。该协议通过可复现的测试框架操作,不直接分发数据,而是提供工具从八个已发布的上游多语言偏见基准(涵盖英语、阿拉伯语、德语、西班牙语、法语、日语、俄语和中文)中确定性地采样构建探测集。测量流程包括:1) 重建精确的评估探测集;2) 在推理开启或关闭模式下,让模型生成针对刻板印象提示的答案;3) 使用独立于被测模型的LLM作为评判员,依据评分标准(包括刻板印象倾向、内容严重性等级和偏见延续)对生成内容评分;4) 将评分聚合成量化偏见指标,并计算“选择性差距”——即短格式控制指标平稳而开放式刻板印象认可率高的现象。所有结果索引到模型权重的实测有效比特/权重值。该协议旨在用于模型偏见审计和安全研究,特别评估量化部署版本相较于全精度版本是否引入了额外开放式生成偏见。

QuantiBias is a benchmark protocol, not a traditional static dataset, for evaluating biases induced by post-training quantization of large language models (LLMs). Its core objective is to reveal a specific, under-audited failure mode: quantized compression may leave the short-form safety behaviors of the model—such as direct refusal, over-refusal, and multiple-choice bias scores—nearly unchanged, while simultaneously causing a significant increase in the actively expressed biases during open-ended generation. This protocol operates via a reproducible test framework that does not directly distribute data, but instead provides tools to deterministically construct probe sets by sampling from eight published upstream multilingual bias benchmarks covering English, Arabic, German, Spanish, French, Japanese, Russian, and Chinese. The core measurement workflow includes: 1) Reconstructing the exact evaluation probe sets from the upstream sources; 2) Having the target model generate responses to stereotype prompts with inference mode either enabled or disabled; 3) Using an LLM independent of the target model family as a judge to score the generated content based on defined scoring criteria, including stereotype tendency, content severity level, and bias perpetuation; 4) Aggregating the scoring results into quantifiable bias metrics and calculating the "selectivity gap"—the phenomenon where short-form control metrics remain stable while the open-ended stereotype endorsement rate is high. All results are indexed to the measured effective bits per weight value of the model weights. This protocol is intended for model bias auditing and safety research, and is particularly suitable for evaluating whether quantized deployed versions introduce additional open-ended generation biases compared to their full-precision evaluation counterparts.

创建时间:
2026-07-23
搜集汇总
数据集介绍
quantibias 数据集图片
构建方式
QuantiBias并非传统意义上的数据集,而是一套严谨的评估协议。其核心构建方式在于不直接分发任何提示文本,而是通过代码工具从多个已发布的公开基准中确定性采样生成测试探针。包含的`reconstruct`模块能够根据上游仓库、配置、分割及内容哈希值精确复现评估集,并通过SHA256校验确保数据一致性。整个协议以LLM作为评判者,对模型输出的刻板印象倾向及内容严重程度进行评分,最终将结果索引至模型实际测量的有效比特权重上,而非名义精度名称。
特点
该评估工具最显著的特点在于其揭示的“选择性差距”:在短形式的安全行为控制(如直接拒绝率、过度拒绝率、多项选择偏见)几乎不受量化影响而保持平稳的背景下,模型在开放式生成任务中展现出的刻板印象认同比例却显著偏高。实验数据显示,在独立评判者的评估下,约四分之一的生成内容呈现出偏见倾向。此外,该工具支持多语言(八种语言)评估、推理开启与关闭的对比,以及内容严重性评分,全面反映量化压缩对模型偏见行为的独特影响。
使用方法
使用QuantiBias时,首先需通过`reconstruct`命令从上游源重建评估集,随后利用`generate`模块采用API后端调用目标模型生成回答,支持设置`--think`参数开启推理。生成结果通过`judge`模块由独立于被测模型家族的LLM评判者进行偏见倾向与严重性评分,需注意设置相应的API密钥。最后通过`aggregate`命令汇总评判结果,计算量化偏见指标与选择性差距。用户还可通过`bpw`命令测量GGUF格式模型的实际比特权重,以确保压缩程度的真实表征。
背景与挑战
背景概述
QuantiBias是由Emilio Ferrara于2026年提出的评估基准,旨在系统性地量化大型语言模型在量化压缩后产生的偏见偏移。随着模型压缩技术在工业界的广泛应用,量化过程对模型安全性行为的影响成为核心研究问题。与传统评估仅关注拒绝率或多项选择偏见分数不同,QuantiBias揭示了量化模型在开放式生成任务中偏见显著上升而短格式安全行为保持不变的‘选择性差距’。该基准整合了八种语言的现有数据集,通过独立法官模型评分和度量每权重的有效比特数,为人工智能安全审计提供了更为精细的测量工具,对推动量化模型的公平性评估具有重要影响。
当前挑战
QuantiBias所解决的核心领域挑战在于,现有评估框架无法捕捉量化压缩对模型开放式偏见生成的影响,导致压缩模型的安全性被严重高估。具体而言,短格式控制测试(如拒绝回答、过度拒绝和多项选择偏见)显示模型安全性能几乎不变,而开放式刻板印象认同率却持续处于高位,这种选择性差距在跨模型家族和法官模型中稳健存在。在构建过程中,QuantiBias面临确保评估可重现性且不重新分发上游数据的挑战,通过哈希验证和确定性采样实现;同时需要设计独立法官评分机制以确保偏见分数的客观性并避免模型家族偏差。
常用场景
经典使用场景
在大语言模型压缩与部署领域,QuantiBias被设计为一项精巧的评估协议,专门用于检测模型量化后所产生的隐性偏见漂移。其经典使用场景是:在保持模型结构、训练数据和输入提示完全不变的前提下,仅改变权重的数值精度(如从全精度压缩至每权重约1比特),然后通过多语言生成式刻板印象探针与多项短形式控制任务(如直接拒绝率、过度拒绝率和多选题偏见得分)对压缩后的模型进行系统性评测。该协议依托于来自八个现有基准测试的确定性探针样本,并借助独立大语言模型裁判对每条输出的刻板倾向与内容严重程度进行打分,最终将所有结果归一化到实测的每权重有效比特数上,从而揭示量化过程对模型输出偏见的精细影响。
衍生相关工作
QuantiBias的提出催生了一系列意义深远的衍生研究。首先,其揭示的“选择性差距”现象直接激发了针对量化过程中信息丢失与偏见放大机理的理论探索,推动了新的量化感知训练策略与模型校准方法的设计。其次,该协议所采用的“模型家族无关裁判”策略与裁判集成报告机制,为后续公平性评估基准的构建提供了方法论范本,促使研究者开始重视裁判模型本身对评估结果的影响。此外,QuantiBias对每权重有效比特数而非名义精度的强调,开启了“公平性感知模型压缩”这一新兴交叉研究方向,已有工作在此框架下探索如何通过权重聚类、混合精度分配或对抗性正则化来抑制量化引发的偏见,进而推动更负责任的大模型轻量化技术体系的形成。
数据集最近研究
最新研究方向
随着大语言模型在产业界的广泛应用,模型量化压缩技术因能显著降低部署成本而备受青睐,但现有安全评测体系多聚焦于短格式拒绝响应和选择题偏差等结构化指标,对量化后模型在开放式生成中涌现的隐性偏见鲜有触及。QuantiBias协议应运而生,它通过构建多语言、生成式的刻板印象探测基准,精准揭示了量化压缩导致的选择性偏差鸿沟:模型在短格式安全测试中表现几乎不变,却在开放式文本生成中暴露出高达27%的刻板印象认同率,且这一趋势在多种量化策略和骨干模型上均稳健成立。该研究直面“量化安全幻觉”这一关键风险,为LLM可信部署提供了超越传统审计的细粒度测量工具,并推动业界重新审视模型压缩对输出公平性的隐性侵蚀。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务