遇见数据集

SkyJury

收藏
github2026-06-16 更新2026-06-17 收录
数据链接:
官方服务:

资源简介:

SkyJury是一个用于去中心化内容审核中用户条件标注者选择的基准测试数据集。给定用户配置文件和两个可能的Bluesky标注者,模型必须决定哪个标注者更符合该用户的审核需求。该数据集评估两种互补能力:验证器准确性(模型是否选择更好的标注者)和审核器鲁棒性(模型在意义保持的规则重构下置信度是否保持稳定)。数据集基于真实的Bluesky标注者和公共规则定义构建,包含576个样本,分为4个高级类别(安全审核、平台信息生态、兴趣社区、身份信任)和31个细分子集。

SkyJury is a benchmark dataset for user-conditioned annotator selection in decentralized content moderation. Given a user profile and two candidate Bluesky annotators, the model must determine which annotator better aligns with the user's moderation requirements. This dataset evaluates two complementary capabilities: validator accuracy (whether the model selects the better annotator) and moderator robustness (whether the model's confidence remains stable under meaning-preserving rule restructuring). The dataset is constructed using real Bluesky annotators and public rule definitions, containing 576 samples divided into four high-level categories (safety moderation, platform information ecology, interest communities, identity trust) and 31 fine-grained subsets.

创建时间:
2026-06-03
原始信息汇总

数据集名称

SkyJury

数据集概述

SkyJury 是一个用于评估大语言模型在去中心化审核场景中执行基于用户条件的标签器选择能力的基准。给定一个用户画像和两个可能的 Bluesky 标签器,模型需判断哪个标签器更符合该用户的审核需求。

评估能力

该基准评估两种互补能力:

  • 验证器准确性:模型是否能选出更优的标签器。
  • 审计器鲁棒性:在保留政策原意的规则表述变换下,模型的置信度是否保持稳定。

数据来源

数据基于真实的 Bluesky 标签器及其公开的规则定义构建。

基准规模

  • 样本总数:576
  • 高层类别:4
  • 细分子集:31

类别分布

类别 样本数
safety_moderation 128
platform_information_ecology 108
interest_community 224
identity_trust 116

任务设计

任务旨在测试细粒度政策判断能力,而非简单的句柄匹配或主题关键词重叠。

数据格式

主数据文件为 data/skyjury_bench.json,每个条目采用基于 RM-Bench 的成对格式:

json { "id": "pref_0001", "category": "safety_moderation", "subset": "crypto_safety", "prompt": "... user profile and behavior context ...", "chosen": ["... chosen labeler text ..."], "rejected": ["... rejected labeler text ..."] }

验证器需对 chosen 项给出高于 rejected 项的分数。

主要实验结果摘要

以下为论文中使用的总体结果。Acc 为验证器准确率。审计列报告了标准化置信度下降效应量;正值表示扰动降低了模型对原始选中标签器的置信度。统计显著性标记为 ******

家族 模型 Acc len/both len/cho len/rej lang/both lang/cho lang/rej
RM ArmoRM-Llama3-8B 0.632 0.0784 -0.0482 0.1129 0.0939 0.1406** 0.0033
RM GRM-Llama3.1-8B 0.564 -0.1801 -0.7727 0.6951*** -0.1414 0.3901*** -0.4353
RM Skywork-Gemma-2-27B 0.688 0.0710 -0.1546 0.2731*** 0.1196 0.2716*** -0.1410
RM Skywork-Llama-3.1-8B 0.675 -0.0115 0.0243 0.0487 0.0588 0.3997*** -0.2711
RM Eurus-RM-7B 0.524 -0.1374 -0.7715 0.6700*** -0.0483 -0.1914 0.1416
DPO Tulu-2-DPO-13B 0.509 -0.0568 -0.5872 0.6180*** 0.0406 -0.0277 0.1768**
DPO SOLAR-10.7B-Instruct 0.523 -0.1439 -0.8524 0.8229*** -0.0668 -0.3708 0.4280***
Judge Qwen3-8B 0.595 0.1056 0.1017 0.1017 -0.0804 -0.0819 -0.0819
Judge DeepSeek-V4-Pro 0.632 -0.0326 -0.0374 -0.0374 -0.0238 -0.0287 -0.0287
Judge MiniMax-M2.7 0.644 -0.0479 -0.0561 -0.0561 -0.0308 -0.0376 -0.0376
Judge Qwen3.5-Plus 0.731 0.0432 0.0386 0.0386 0.0726 0.0664 0.0664
Judge GPT-5 0.691 0.2439*** 0.2394*** 0.2394*** 0.0741 0.0699 0.0699
搜集汇总
数据集介绍
SkyJury 数据集图片
构建方式
SkyJury基准数据集构建于去中心化内容审核的现实需求之上,其核心任务聚焦于用户条件化标签选择器评估。数据来源于真实的Bluesky标签器及其公开的审核规则定义。每个样本采用成对偏好格式,包含用户画像与行为上下文描述,以及一个被标记为更优(chosen)和另一个作为对照(rejected)的标签器文本。构建过程系统性地覆盖了安全审核、平台信息生态、兴趣社群及身份信任四大高层类别,共细分为31个子集,总计576个样本。该设计旨在检验模型对细粒度策略的判断力,而非简单的主题关键词匹配或直观的答案选择。
使用方法
使用SkyJury基准时,研究者需从仓库根目录启动,首先安装依赖环境。运行验证器可通过多种路径实现:对于判别式奖励模型,调用run_reward_model脚本并指定模型路径与数据文件;DPO或指令微调的语言模型则可借助run_dpo_lm进行无参考或有参考评分。对于大语言模型作为法官的评估,既支持通过OpenAI兼容API接口调用闭源模型,也支持使用run_vllm_judge在本地部署开源模型进行推理。随后,审计流程通过构建规则扰动数据集并重新运行验证器生成预测文件,最终调用审计脚本产出涵盖置信度偏移、假设检验及类别层面鲁棒性模式的分析报告。
背景与挑战
背景概述
在去中心化内容审核的演进浪潮中,如何为不同用户精准匹配最契合其需求的审核标签器,成为一项亟待破解的难题。SkyJury正是在这一背景下于近期由研究团队构建的基准测试集,旨在评估大语言模型在用户条件化标签器选择任务中的策略判断能力。该基准基于Bluesky平台的真实标签器与公共审核规则定义,包含576个样本,覆盖安全审核、平台信息生态、兴趣社区、身份信任四个高层类别,细分为31个子集。通过验证器准确度与审计器鲁棒性两大互补维度,SkyJury推动了大模型在个性化政策判断领域的评估进展,为去中心化审核中标签器选择的自动化决策提供了关键测试平台。
当前挑战
SkyJury所应对的核心领域挑战在于,大语言模型需在用户偏好与审核规则之间进行精细化的政策判断,而非简单的主题关键词匹配,这要求模型理解用户画像与标签器目标的深层契合度。构建过程中,研究团队需确保基准样本的真实性与代表性,从Bluesky平台筛选标签器并公开规则,同时设计评估协议以覆盖不同类别。此外,为测试模型鲁棒性,团队需构建保持语义不变的规则改写版本,进行配对统计检验以量化置信度偏移,这涉及对长度和语言层面的扰动设计,显著增加了数据构建与评估流程的复杂性。
常用场景
经典使用场景
SkyJury基准测试的核心应用场景在于评估大语言模型在去中心化内容审核体系中的政策判断能力。该数据集以Bluesky平台为背景,构建了一个用户条件化标签选择器配对判别任务,要求模型根据用户画像与行为上下文,从两个候选标签提供者中选出更契合该用户审核需求的方案。通过576个精心设计的样本,涵盖安全审核、平台信息生态、兴趣社区与身份信任四大类别,SkyJury能够系统性地检验模型是否能够超越简单的关键词匹配或主题重叠,真正理解审核政策的细微差异并做出精准的偏好排序。
解决学术问题
该数据集直面去中心化审核中一个长期被忽视的学术难题:如何量化并提升模型在用户粒度上的政策判别一致性。传统基准多聚焦于内容毒性检测或单标签分类,而SkyJury首次将审核者选择建模为细粒度的成对偏好问题,并引入验证者准确率作为核心度量。更重要的是,它创造性地提出审计者鲁棒性概念,通过构造保义改写干扰项,利用配对符号检验等统计方法评估模型置信度的稳定性,从而揭示模型在规则表述变化下的脆弱性,为构建可靠且透明的AI审核系统提供了理论支撑与实验范式。
实际应用
在实际部署中,SkyJury直接服务于去中心化社交平台的个性化审核管道建设。对于Bluesky这类允许用户自主订阅不同审核标签提供者的系统,该数据集可帮助平台运营者筛选出对政策理解最为稳健的大语言模型,从而向终端用户推荐更符合其偏好与安全需求的审核过滤器。此外,SkyJury提供的审计框架能够作为持续的质量监测工具,在审核规则迭代后自动检测模型决策的漂移程度,确保审核服务的可靠性与用户信任度,降低因审核不一致引发的社区争议与用户体验损耗。
数据集最近研究
最新研究方向
在去中心化内容审核领域,随着平台治理从单一规则向用户条件式偏好匹配演进,SkyJury基准数据集应运而生。该前沿研究方向聚焦于评估大语言模型在用户个性化标签选择中的政策判断能力,紧密结合了当前社交平台去中心化治理与AI审核透明性的热点议题。通过构建包含576个样本、覆盖安全审核、平台信息生态、兴趣社群与身份信任四大类别的基准,SkyJury创新性地提出了验证器准确性与审计器鲁棒性双重评估框架。其核心意义在于,不仅检验模型能否为用户匹配最合适的审核标签,更通过保留语义的条款改写测试,度量模型决策的置信度稳定性,为构建可信赖的分布式内容审核系统提供了关键评测范式与安全性保障。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务