遇见数据集

liberator-dataset

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Liberator 数据集(v0.2 pilot)是一个多语言、跨区域的数据集,旨在研究和减少开放权重语言模型在政治话题上的过度拒绝行为。该数据集教导模型在政治敏感话题上提供基于事实、多视角且有归因的答案。数据集包含 180 条记录(114 条训练集,66 条评估集),覆盖 11 种语言(英语、中文、俄语、韩语、日语、土耳其语、阿拉伯语、波斯语、德语、西班牙语、葡萄牙语)和 20 个区域(包括中国、俄罗斯、朝鲜、日本、土耳其、沙特阿拉伯、伊朗、印度、泰国、美国、德国、匈牙利、巴西、阿根廷、尼日利亚、埃及、澳大利亚、新西兰、墨西哥以及跨区域全球项目),并覆盖所有大洲(每个大洲至少 2 个区域和 4 条记录)。每条记录包含一个指令,对应的有归因的参考答案,以及用于评估召回效果的必要元素(required_elements)和安全标签。数据集适用于文本生成和问答任务,特别用于评估和改进模型在政治敏感话题上的回答能力,是政治审查抵抗和过度拒绝研究的重要资源。

The Liberator dataset (v0.2 pilot) is a multilingual, cross-regional dataset designed to study and reduce the over-refusal behavior of open-weight language models on political topics. It teaches models to provide fact-based, multi-perspective, and attributed answers to politically sensitive topics. The dataset contains 180 records (114 training, 66 evaluation), covering 11 languages (English, Chinese, Russian, Korean, Japanese, Turkish, Arabic, Persian, German, Spanish, Portuguese) and 20 regions (including China, Russia, North Korea, Japan, Turkey, Saudi Arabia, Iran, India, Thailand, United States, Germany, Hungary, Brazil, Argentina, Nigeria, Egypt, Australia, New Zealand, Mexico, and cross-regional global projects), covering all continents (at least 2 regions and 4 records per continent). Each record contains an instruction, a corresponding attributed reference answer, required elements for evaluating recall effectiveness, and a safety label. The dataset is suitable for text generation and question answering tasks, particularly for evaluating and improving model responses to politically sensitive topics, serving as an important resource for research on political censorship resistance and over-refusal.

创建时间:
2026-07-27
原始信息汇总

Liberator dataset (v0.2 pilot) 数据集详情

数据集概述

Liberator dataset 是一个多语言、跨区域的数据集,旨在研究和减少开源权重语言模型在**政治话题上的过度拒绝(over-refusal)**现象。该数据集教导模型在涉及政治敏感话题时提供基于事实、多视角且带有归属标注的答案。数据集中保留了少量拒绝示例作为诊断性对照,而非作为覆盖基准或能力目标。

基本信息

  • 许可证(文本):CC BY 4.0(原始创作内容)
  • 许可证(代码/适配器):Apache-2.0
  • 语言:英语、中文、俄语、韩语、日语、土耳其语、阿拉伯语、波斯语、德语、西班牙语、葡萄牙语(共11种)
  • 覆盖地区(20个):中国、俄罗斯、朝鲜、日本、土耳其、沙特阿拉伯、伊朗、印度、泰国、美国(自我批判对照)、德国、匈牙利、巴西、阿根廷、尼日利亚、埃及、澳大利亚、新西兰、墨西哥,以及跨区域GLOBAL条目
  • 覆盖大洲:亚洲、欧洲、非洲、南美洲、北美洲和大洋洲,每个大洲在两个数据划分中均至少有2个地区和4条记录

数据规模与结构

  • 总记录数:180条(训练集114条 / 评估集66条)
  • 数据格式:JSONL(权威数据表面),包含训练集 data/train.jsonl 和评估集 data/eval.jsonl
  • 任务类型:文本生成、问答
  • 数据标签:政治审查抵抗、过度拒绝、多语言、评估、安全性

数据集定位

该数据集是**审查抵抗(censorship-resistance)**的测量与缓解集,不是越狱(jailbreak)集。大多数记录模拟的是基于事实的可回答政治问题。其中保留了6条 legitimate_refusal_boundary 行作为狭窄的诊断性对照;数据集不要求存在任何拒绝类别或边界,也不将拒绝性能作为能力成功的标准。

发布状态与证据限制

  • 这是一个临时性、带来源引用的发布:每条记录都引用了其来源,但人工事实核查有意未完全完成
  • 事实核查状态:313条语言中立目标行中,131条已验证,182条待验证;160条需要审查的记录中,8条完全验证,152条待验证(涉及634个精确记录元素使用)
  • 待验证状态:待验证目标在数据工件中标记为 pending_human_factcheck,不代表已验证结果
  • 证据集限制:不提供加密签名者归属或签名精确成员保证

运行结果(已公开的负面证据)

数据集发布了五次配对运行的结果,所有运行的 capability_claim_supported 均返回 false,且未发布任何适配器或模型

  1. 首次运行(61训练/8验证投影):宏区域必需元素召回率从0.356降至0.167,过度拒绝从0.000升至0.040,语言容差在de、en、es、fa、ko、ru上失败
  2. 第二次运行(训练预算200→100迭代):召回率进一步降至0.125,语言容差在ar、de、en、es、fa、ko、ru上失败
  3. 第三次运行(学习率1e-4→2e-5):召回率降至0.287,语言容差在de、es、fa、ko上失败
  4. 第四次运行(110条记录/71/8投影):召回率降至0.231,语言容差在ar、de、en、es、fa上失败
  5. 第五次运行(120条记录/81/8投影):召回率降至0.324,语言容差在ar、de、es、fa、ko上失败
  6. 第六次运行(140条记录/101/8投影):召回率降至0.220,语言容差在ar、de、en、es、fa、ko上失败

所有失败运行均保留在 eval/checkpoint4-runs/ 目录下作为可审查的负面证据。

更正与第三方验证

由于这是临时性发布,182条待验证目标行(verification_status: pending_human_factcheck)明确开放供独立验证和更正。用户可通过以下方式参与:

  • MyTH-zyxeon/liberator-dataset/issues 打开GitHub问题,提供记录ID、目标及支持更正的来源
  • 或在**事实来源(source of truth)**处打开拉取请求,而非派生输出

验证必须遵循精确的合约要求,包括身份匹配、独立来源证据(适用于声明类目标)、或仅记录验证结果和日期(适用于答案规则类目标)。

数据权威性说明

  • GitHub仓库是当前审查数据集的权威来源
  • Hugging Face发布仅在其实时默认修订版的README、训练和评估哈希通过 scripts/audit_hf_public_readback.py 验证后才视为同步
  • JSONL是权威数据表面;Hugging Face自动转换的Parquet派生格式可能推断时间戳和空字段,因此不视为与权威JSONL模式等效
搜集汇总
数据集介绍
liberator-dataset 数据集图片
构建方式
Liberator数据集是一个多语言、跨区域的政治话题过度拒绝缓解基准,旨在引导开放权重语言模型对政治敏感话题进行有据可依的多视角回答。其构建方式严谨而透明:包括11种语言、20个区域,覆盖六大洲,每个大洲在训练和评估分割中均至少包含2个区域和4条记录,以确保区域代表性。数据集共180条记录(114条训练,66条评估),每条记录包含指令、有依据的参考答案、必备要素回忆评分规则及安全标签。特别地,数据集中保留了6条合法拒绝边界样本作为诊断对照,而非作为覆盖下限或能力目标。所有记录均附有来源引用,但人工事实核查尚未完全完成,因此在数据中明确标注了验证状态,便于后续第三方核查与修正。
特点
Liberator数据集的核心特点在于其明确的定位与审慎的发布策略。它并非越狱数据集,而是致力于减少模型对政治话题的过度拒绝,同时确保回答基于事实、多视角并注明出处。数据集在构建时强调了区域与大陆的均衡覆盖,并通过专门的审计脚本强制执行。其发布为试点版本(v0.2),每个记录都附有来源,但事实核查尚未完全完成,因此未验证内容被视为发布限制而非质量保证。值得注意的是,数据集不发布任何经过训练的适配器或模型,而是提供详尽的实验记录,包括失败的训练运行,作为透明证据,避免误导性宣称能力提升。
使用方法
使用Liberator数据集时,研究者可将其用于评估和缓解模型在政治话题上的过度拒绝行为。数据集的结构化JSONL格式便于加载,每条记录包含指令、参考答案和评分规则,可用于微调或评估。数据集提供了详细的验证和修正机制,允许第三方通过GitHub提交修正或验证待核查条目,确保数据质量的可追溯性。然而,使用者应注意其试点性质:未经验证的内容不应视为事实,且任何训练结果需谨慎解读,因为多轮实验表明在现有方法下能力提升并不稳定。因此,建议结合数据集附带的审计脚本和文档,严格遵循其设计意图,将其作为研究工具而非最终解决方案。
背景与挑战
背景概述
Liberator数据集(v0.2试点版)于2025年由MyTH-zyxeon团队创建,旨在解决开源权重语言模型在政治敏感话题上的过度拒答问题。该数据集覆盖11种语言和20个地区,包含180条记录,每条记录提供带引用的多视角回答,并配有评估指标和事实核查状态。其核心研究问题是如何在不降低安全性的前提下,教会模型对政治敏感问题提供基于事实、多角度的回答。该数据集的发布标志着对政治审查抵抗能力的量化评测迈出了重要一步,为多语言、跨区域的政治话题回答提供了基准,并对后续模型微调和安全评估研究具有参考价值。
当前挑战
该数据集面临两大挑战。领域问题方面,需要解决语言模型在政治敏感话题上的过度拒答,这要求模型在保持安全性的同时,能够提供准确、多视角的回答,而现有安全训练往往导致模型过于保守,难以平衡安全与信息提供。构建过程中,团队需确保跨语言和跨地区的文化、政治敏感性,手动构建多语言参考回答并确保引用来源的可靠性;同时,事实核查工作庞大,目前仅部分记录完成验证,其余标记为待验证,存在错误传播风险。此外,初步实验显示微调模型在召回率上不升反降,且多语言容错失败,表明数据集规模和方法仍需优化,以真正提升模型能力。
常用场景
经典使用场景
Liberator数据集专为研究多语言、跨区域政治敏感话题下大语言模型的过度拒绝现象而设计,其经典使用场景聚焦于评估与缓解模型在政治话题上的不当回避行为。该数据集包含11种语言、20个区域的高质量指令-回答对,每项均附有引用来源与安全标签,并内置召回率评估标准。研究者通常利用其训练数据对开源权重模型进行微调,引导模型生成有根据、多视角且带归属的回应,同时保留少量合法拒绝样本作为诊断对照,从而系统性地检验模型在复杂政治议题上的响应质量与安全性平衡。
衍生相关工作
该数据集衍生了一系列关于政治审查抵抗与多语言安全对齐的研究工作。其释放的失败运行族被保留为负面证据,启发后续研究者探讨训练超参数(如迭代次数、学习率)对模型能力保持的影响,并开发了基于区域和语言粒度的评估工具,如覆盖审计与多语言评估计划。该数据集亦催生了关于事实核查流程自动化的探索,包括证据快照管理、内容声明目录及归属标记的识别方法。此外,其严谨的版本控制与验证账本机制,为开放科学环境下数据集的可信发布与第三方验证提供了参考架构,促进了更透明的AI基准建设。
数据集最近研究
最新研究方向
该数据集聚焦于多语言、跨区域的开源大模型在政治敏感话题上的过度拒绝问题,旨在通过细粒度的归因回答与评估基准,推动模型在内容安全与表达自由之间取得平衡。其最新研究方向包括:构建覆盖20个区域、11种语言的高质量指令数据集,强化多视角且基于证据的回应能力,同时设置诊断性对照样本以区分合法拒绝边界;通过严格的验证协议与可重复的实验框架(如多次配对运行、学习率与训练预算调整)探析模型能力退化的成因,并引入全新的多语言评估矩阵以捕捉跨语言泛化效应。该工作不仅为政治审查抵抗提供了校准工具,更在方法论上创新了数据集孵化的质量门控机制,对提升大模型在复杂社会议题上的可靠性具有重要基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务