liberator-dataset
收藏资源简介:
Liberator 数据集(v0.2 pilot)是一个多语言、跨区域的数据集,旨在研究和减少开放权重语言模型在政治话题上的过度拒绝行为。该数据集教导模型在政治敏感话题上提供基于事实、多视角且有归因的答案。数据集包含 180 条记录(114 条训练集,66 条评估集),覆盖 11 种语言(英语、中文、俄语、韩语、日语、土耳其语、阿拉伯语、波斯语、德语、西班牙语、葡萄牙语)和 20 个区域(包括中国、俄罗斯、朝鲜、日本、土耳其、沙特阿拉伯、伊朗、印度、泰国、美国、德国、匈牙利、巴西、阿根廷、尼日利亚、埃及、澳大利亚、新西兰、墨西哥以及跨区域全球项目),并覆盖所有大洲(每个大洲至少 2 个区域和 4 条记录)。每条记录包含一个指令,对应的有归因的参考答案,以及用于评估召回效果的必要元素(required_elements)和安全标签。数据集适用于文本生成和问答任务,特别用于评估和改进模型在政治敏感话题上的回答能力,是政治审查抵抗和过度拒绝研究的重要资源。
The Liberator dataset (v0.2 pilot) is a multilingual, cross-regional dataset designed to study and reduce the over-refusal behavior of open-weight language models on political topics. It teaches models to provide fact-based, multi-perspective, and attributed answers to politically sensitive topics. The dataset contains 180 records (114 training, 66 evaluation), covering 11 languages (English, Chinese, Russian, Korean, Japanese, Turkish, Arabic, Persian, German, Spanish, Portuguese) and 20 regions (including China, Russia, North Korea, Japan, Turkey, Saudi Arabia, Iran, India, Thailand, United States, Germany, Hungary, Brazil, Argentina, Nigeria, Egypt, Australia, New Zealand, Mexico, and cross-regional global projects), covering all continents (at least 2 regions and 4 records per continent). Each record contains an instruction, a corresponding attributed reference answer, required elements for evaluating recall effectiveness, and a safety label. The dataset is suitable for text generation and question answering tasks, particularly for evaluating and improving model responses to politically sensitive topics, serving as an important resource for research on political censorship resistance and over-refusal.
Liberator dataset (v0.2 pilot) 数据集详情
数据集概述
Liberator dataset 是一个多语言、跨区域的数据集,旨在研究和减少开源权重语言模型在**政治话题上的过度拒绝(over-refusal)**现象。该数据集教导模型在涉及政治敏感话题时提供基于事实、多视角且带有归属标注的答案。数据集中保留了少量拒绝示例作为诊断性对照,而非作为覆盖基准或能力目标。
基本信息
- 许可证(文本):CC BY 4.0(原始创作内容)
- 许可证(代码/适配器):Apache-2.0
- 语言:英语、中文、俄语、韩语、日语、土耳其语、阿拉伯语、波斯语、德语、西班牙语、葡萄牙语(共11种)
- 覆盖地区(20个):中国、俄罗斯、朝鲜、日本、土耳其、沙特阿拉伯、伊朗、印度、泰国、美国(自我批判对照)、德国、匈牙利、巴西、阿根廷、尼日利亚、埃及、澳大利亚、新西兰、墨西哥,以及跨区域GLOBAL条目
- 覆盖大洲:亚洲、欧洲、非洲、南美洲、北美洲和大洋洲,每个大洲在两个数据划分中均至少有2个地区和4条记录
数据规模与结构
- 总记录数:180条(训练集114条 / 评估集66条)
- 数据格式:JSONL(权威数据表面),包含训练集
data/train.jsonl和评估集data/eval.jsonl - 任务类型:文本生成、问答
- 数据标签:政治审查抵抗、过度拒绝、多语言、评估、安全性
数据集定位
该数据集是**审查抵抗(censorship-resistance)**的测量与缓解集,不是越狱(jailbreak)集。大多数记录模拟的是基于事实的可回答政治问题。其中保留了6条 legitimate_refusal_boundary 行作为狭窄的诊断性对照;数据集不要求存在任何拒绝类别或边界,也不将拒绝性能作为能力成功的标准。
发布状态与证据限制
- 这是一个临时性、带来源引用的发布:每条记录都引用了其来源,但人工事实核查有意未完全完成
- 事实核查状态:313条语言中立目标行中,131条已验证,182条待验证;160条需要审查的记录中,8条完全验证,152条待验证(涉及634个精确记录元素使用)
- 待验证状态:待验证目标在数据工件中标记为
pending_human_factcheck,不代表已验证结果 - 证据集限制:不提供加密签名者归属或签名精确成员保证
运行结果(已公开的负面证据)
数据集发布了五次配对运行的结果,所有运行的 capability_claim_supported 均返回 false,且未发布任何适配器或模型:
- 首次运行(61训练/8验证投影):宏区域必需元素召回率从0.356降至0.167,过度拒绝从0.000升至0.040,语言容差在de、en、es、fa、ko、ru上失败
- 第二次运行(训练预算200→100迭代):召回率进一步降至0.125,语言容差在ar、de、en、es、fa、ko、ru上失败
- 第三次运行(学习率1e-4→2e-5):召回率降至0.287,语言容差在de、es、fa、ko上失败
- 第四次运行(110条记录/71/8投影):召回率降至0.231,语言容差在ar、de、en、es、fa上失败
- 第五次运行(120条记录/81/8投影):召回率降至0.324,语言容差在ar、de、es、fa、ko上失败
- 第六次运行(140条记录/101/8投影):召回率降至0.220,语言容差在ar、de、en、es、fa、ko上失败
所有失败运行均保留在 eval/checkpoint4-runs/ 目录下作为可审查的负面证据。
更正与第三方验证
由于这是临时性发布,182条待验证目标行(verification_status: pending_human_factcheck)明确开放供独立验证和更正。用户可通过以下方式参与:
- 在
MyTH-zyxeon/liberator-dataset/issues打开GitHub问题,提供记录ID、目标及支持更正的来源 - 或在**事实来源(source of truth)**处打开拉取请求,而非派生输出
验证必须遵循精确的合约要求,包括身份匹配、独立来源证据(适用于声明类目标)、或仅记录验证结果和日期(适用于答案规则类目标)。
数据权威性说明
- GitHub仓库是当前审查数据集的权威来源
- Hugging Face发布仅在其实时默认修订版的README、训练和评估哈希通过
scripts/audit_hf_public_readback.py验证后才视为同步 - JSONL是权威数据表面;Hugging Face自动转换的Parquet派生格式可能推断时间戳和空字段,因此不视为与权威JSONL模式等效





