Graph-COM/EAPrivacy
收藏官方服务:
资源简介:
EAPrivacy是一个评价大型语言模型在物理世界中隐私意识的评估基准。它包含不同层级(Tier 1至Tier 4)的场景种子,用于测试模型在处理隐私问题时的基础知识和适应能力。
EAPrivacy is an evaluation benchmark for measuring the privacy awareness of large language models in the physical world. It includes scenario seeds across different tiers (Tier 1 to Tier 4) to test the models foundational knowledge and adaptability in handling privacy issues.
提供机构:
Graph-COM搜集汇总
数据集介绍

构建方式
在大型语言模型(LLM)日益融入物理世界的背景下,隐私安全评估成为关键挑战。EAPrivacy基准通过分层种子(seeds)机制构建,共包含四个层级(Tier1至Tier4),每个层级聚焦不同的隐私推理维度。Tier1种子基于ConfAIde工作,识别物理环境中固有敏感对象及其常见信息搭配组合;Tier2种子为每个场景设置多模态感知线索与动态环境状态,并配备候选动作池及人工标注的隐私评级;Tier3种子通过隐含的上下文线索推断隐私约束,并记录观察交互中的多模态信息;Tier4种子则利用多模态线索呈现社会规范与个人隐私的冲突,并赋予二元真值标签以区分优先级。所有种子文件以JSON格式组织于eai_bench文件夹下,确保场景生成的可复现性与系统性。
使用方法
使用者可直接从eai_bench文件夹加载各层级的JSON种子文件进行场景生成与评估。对于Tier1,利用physical_objects与combinations字段生成敏感对象识别任务;Tier2需结合environment_states与candidate_action_ratings,依据多模态线索评估模型在动态环境中的动作选择;Tier3则基于secret_item、container及observed_interactions构建隐私约束推断任务;Tier4通过环境状态与感知线索,引导模型在个人隐私与社会规范间做出二元抉择。代码与评估脚本将在论文接收后开源,当前版本支持用户自定义扩展种子或调整评级标准,研究者可引用相关论文以获取更详细的实验设计说明。
背景与挑战
背景概述
随着大型语言模型在物理世界中的广泛应用,隐私安全问题逐渐成为研究焦点。Graph-COM/EAPrivacy数据集由Xinjie Shen、Mufei Li和Pan Li于2025年创建,旨在系统评估大语言模型在物理环境中的隐私感知能力。该数据集提出了一个分层的评估基准,从识别敏感对象到处理动态隐私需求,再到推断隐含隐私约束,最后解决社会规范与个人隐私之间的冲突,全面覆盖了物理世界隐私意识的多个维度。这一工作填补了现有研究在物理世界隐私评估方面的空白,为提升大语言模型的安全性和可信度提供了重要工具,对人工智能伦理和安全领域具有深远影响。
当前挑战
该数据集面临的核心挑战在于如何准确模拟真实物理世界中的复杂隐私场景。首先,物理环境中的隐私问题具有动态性和上下文依赖性,例如环境变化会导致隐私需求的调整,这对模型的适应性提出了高要求。其次,构建过程中需要精心设计多模态线索与隐私约束之间的关联,以确保场景的真实性和有效性,但人工标注的主观性可能引入偏差。此外,数据集规模较小(n<1K),限制了模型的泛化能力评估,而场景生成的代码尚未完全公开,影响了可复现性和进一步扩展。这些挑战共同制约了该基准在更广泛实际应用中的可靠性。
常用场景
经典使用场景
EAPrivacy数据集专为评估大语言模型在物理世界中的隐私感知能力而设计,其经典使用场景涵盖从静态物体识别到动态环境决策的多层次隐私推理任务。研究者可通过该数据集的四层递进式场景(Tier1至Tier4),系统性地测试模型对敏感物体的基础认知、环境变化下的隐私适应策略、隐含隐私约束的推断能力,以及社会规范与个人隐私发生冲突时的优先级抉择。这一基准为量化LLM在现实物理交互中的隐私意识提供了标准化测试框架。
解决学术问题
该数据集解决了当前大语言模型隐私安全研究中一个关键盲区——缺乏针对物理世界隐私感知的系统性评估工具。现有工作多聚焦于文本或虚拟场景中的隐私泄露,而EAPrivacy填补了模型在真实物理环境中理解并遵守隐私规范的实证空白。它揭示了LLM在动态情境下隐私推理能力的薄弱环节,推动了从单一隐私知识测试向多维度隐私意识评估的范式转变,为构建更安全的具身智能系统奠定了方法论基础。
实际应用
在实际应用中,EAPrivacy可服务于智能家居、服务机器人及增强现实等需要物理交互的AI系统开发。例如,当家庭机器人执行“寻找药物”任务时,该基准可检验其是否能在床头柜(隐私物品)与药箱之间做出符合隐私规范的抉择。企业可利用该数据集对LLM驱动的物理代理进行隐私合规性压力测试,确保产品在部署前具备识别敏感场景、规避隐私侵犯的能力,从而降低法律与伦理风险。
数据集最近研究
最新研究方向
随着大语言模型在物理世界中的部署日益广泛,其隐私感知能力成为安全领域的前沿焦点。EAPrivacy基准应运而生,通过四层递进式评估体系——从静态敏感物体识别、动态环境适应性、隐含隐私约束推断,到社会规范与个人隐私的冲突权衡——系统性地测量模型在物理场景中的隐私意识。该研究回应了当前AI安全热点,即如何确保LLM在真实世界交互中不仅遵循显式指令,更能理解并尊重复杂的隐私边界。其意义在于填补了现有隐私评估多局限于数字空间的空白,为构建物理世界可信赖AI提供了首个标准化评测框架,推动模型从功能正确性向情境化隐私合规演进。
以上内容由遇见数据集搜集并总结生成



