respai-lab/orgaccess
收藏官方服务:
资源简介:
OrgAccess是一个新颖的合成数据集,旨在评估大型语言模型在组织规模下理解和执行基于角色的访问控制策略的能力。该数据集通过定义40种不同类型的权限,细致地模拟了不同组织角色和层次中的访问控制场景。
The OrgAccess benchmark is a novel, synthetic dataset designed to evaluate the ability of Large Language Models (LLMs) to understand and operate within the complex constraints imposed by organizational hierarchies and role-based access control (RBAC) policies. The dataset meticulously defines 40 distinct types of permissions commonly relevant across different organizational roles and levels.
提供机构:
respai-lab搜集汇总
数据集介绍

构建方式
在组织级人工智能应用场景中,大型语言模型(LLM)需要理解并遵循复杂的角色权限约束,然而真实的企业数据与访问控制策略往往因涉及敏感信息而难以公开获取。为突破这一瓶颈,OrgAccess数据集通过与来自不同组织结构的专业人士深度协作,系统性地定义了40种常见于各类组织角色与层级中的权限类型,并基于这些权限构建了一套合成基准。数据集中的每个实例均包含用户角色、权限字典、自然语言查询、预期响应及推理说明,且依据难度划分为easy、medium和hard三个子集,分别包含40282、10073和20148个样本,以全面评估模型在简单至复杂场景下的权限推理能力。
特点
该数据集的核心特点在于其高度模拟了企业环境中角色权限的复杂性与重叠性。每个样本的权限字典不仅涵盖部门归属、访问级别、允许操作等基础维度,还融入了会话超时、截止日期、位置限制、自动化限制及协作访问等动态约束条件,从而能精确评估LLM在多维度规则下的组合推理能力。此外,查询问题设计为包含多重请求的复合语句,如同时要求访问不同部门的报告、更新记录,并满足数据居住地法律与安全要求,这使得数据集能有效检测模型在应对冲突或部分满足权限时的决策正确性。
使用方法
研究人员可直接通过HuggingFace Datasets库加载该数据集,默认配置包含easy、medium和hard三个划分。使用时,模型需根据给定的用户角色与权限字典,对自然语言查询输出‘full’、‘rejected’或‘partial’的访问控制决策,并与预期响应进行比对以评估准确率。该基准特别适用于测试LLM在企业场景下的规则遵循能力与细粒度推理表现,开发者可基于此开发更可靠的层级感知模型,或将其作为复杂指令遵循能力的补充评估工具,以弥补传统STEM基准在组织权限推理方面的不足。
背景与挑战
背景概述
在企业级应用中,大型语言模型(LLM)作为统一的知识库与智能助手,需严格遵循组织层级与基于角色的访问控制(RBAC)策略,以确保数据安全与权限合规。然而,现有基准测试多聚焦于事实问答或STEM推理,忽视了权限约束下的复杂规则遵循能力。为此,respai-lab/orgaccess数据集应运而生,由跨组织背景的专业人士协作创建,于近期发布。该数据集模拟了40种常见权限类型,涵盖部门、访问级别、操作限制、会话超时等维度,旨在系统评测LLM在组织规模下对RBAC策略的理解与执行能力,为构建更可靠的企业级AI系统提供了关键评估工具。
当前挑战
当前数据集面临的主要挑战包括:其一,领域问题层面,LLM需在复杂权限矩阵中准确判断查询的合规性,处理权限重叠、冲突及多条件约束(如地点限制、截止日期、自动化禁令),这对模型的组合推理与规则泛化能力构成严峻考验。其二,构建过程中,合成数据需真实反映企业权限体系的复杂性,但实际策略多为专有且敏感,难以获取;因此,团队通过多角色协作设计测试用例,并划分易、中、难三个难度级别,其中困难样本包含长达数十行的复合查询与嵌套约束,以模拟真实场景的细粒度决策压力,确保评测的全面性与挑战性。
常用场景
经典使用场景
OrgAccess基准数据集专为评估大型语言模型在组织层级与基于角色的访问控制(RBAC)策略下的推理能力而设计。其经典使用场景在于模拟企业环境中员工根据自身角色权限发起查询的复杂交互过程,模型需依据预设的权限字典(包括部门归属、访问级别、允许操作、会话超时、地理限制等多维约束)对自然语言查询做出“完全允许”、“拒绝”或“部分允许”的决策。数据集按难度划分为easy、medium、hard三个子集,其中hard级别包含多权限重叠与冲突的复杂案例,例如跨部门协作、地理位置合规性检查及自动化限制等挑战,旨在检验模型对层次化规则组合的精准理解与执行能力。
实际应用
在实际部署中,OrgAccess基准为大型语言模型在企业智能助手、内部知识库检索、自动化审批流程等场景的应用提供了关键验证工具。例如,当员工请求访问跨部门财务报告或更新新员工记录时,系统需自动判断该角色是否具备对应权限、操作是否在允许的地理位置内、会话超时设置是否合规等。该数据集通过模拟真实企业中的权限矩阵与合规要求(如数据驻留法、部门协作限制),帮助开发者识别模型在权限判定中的脆弱点,从而优化提示工程、规则注入或微调策略,最终实现对企业内部数据访问的精细化管控,降低信息泄露风险。
衍生相关工作
OrgAccess的发布催生了多项围绕层次化规则遵循与权限推理的衍生研究。经典工作包括基于该基准开发的权限感知式提示优化方法,通过将角色权限字典显式注入上下文来提升模型决策准确率;另一项代表性工作则探索了利用检索增强生成(RAG)架构动态接入外部权限数据库的方案,以缓解模型在复杂权限组合下的记忆衰退问题。此外,该数据集还被用于训练专门的RBAC推理适配器,通过参数高效微调(如LoRA)使通用模型在组织场景中具备更高的合规性。这些工作共同推动了企业级LLM从“知识问答”向“安全执行”的功能跃迁。
以上内容由遇见数据集搜集并总结生成



