遇见数据集

BOSS

收藏
arXiv2022-06-22 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

BOSS数据集是由新加坡-麻省理工学院研究与技术联盟创建的一个大型多模态视频数据集,专注于在物体-上下文场景中预测人类信念状态。该数据集包含900个视频,总计347,490帧,通过捕捉非言语沟通信号如目光、姿态和上下文信息来记录参与者的信念状态。数据集的创建过程涉及招募参与者进行特定的协作任务,并通过创新方法获取信念状态的精确标注。BOSS数据集旨在为研究机器理论的心智模型提供标准,特别是在需要非言语沟通的环境中,如人机交互和协作领域。

The BOSS Dataset is a large-scale multimodal video dataset developed by the Singapore-MIT Alliance for Research and Technology, focusing on predicting human belief states in object-contextual scenarios. This dataset includes 900 videos with a total of 347,490 frames, and records participants' belief states by capturing nonverbal communication cues such as eye gaze, body posture and contextual information. The creation process of this dataset involves recruiting participants to complete specific collaborative tasks, and acquiring precise annotations of belief states through innovative methodologies. The BOSS Dataset aims to serve as a benchmark for researching theory of mind models for machines, especially in scenarios requiring nonverbal communication such as human-computer interaction and collaborative fields.

创建时间:
2022-06-22
搜集汇总
数据集介绍
构建方式
在自然语言处理领域,现有分布偏移评估基准常因数据集选择缺乏系统化设计而面临挑战,如ID与OOD数据集语义高度相似或偏移难度不足。为克服此问题,BOSS基准套件基于一套严谨的构建协议,涵盖三大原则:ID数据集需具备大规模与多样性以提供全面知识;OOD数据集应源自不同文本来源并呈现低语义相似性;分布偏移需具备足够挑战性,通过预训练模型在ID数据上的性能衰减量化。该协议综合运用语义相似度计算(如SimCSE)与性能降级测量,从候选池中筛选出每个任务的一个ID数据集与三个对应的OOD数据集,最终覆盖情感分析、有毒检测、自然语言推理、命名实体识别和抽取式问答五项任务,共二十个数据集。
特点
BOSS基准套件具备三大显著特点。首先,其覆盖任务类型广泛,不仅包含常见的分类任务(情感分析、有毒检测、自然语言推理),还纳入结构化预测(命名实体识别)与阅读理解(抽取式问答),从而实现对模型能力的多维度评估。其次,每个任务中的OOD数据集均经过精心挑选,确保与ID数据集在文本来源和语义空间上存在显著差异,且能引发明显的性能退化,从而提供更具挑战性的评估环境。最后,该基准揭示了ID与OOD性能之间三种典型关联模式:单调线性正相关、分段线性正相关以及非单调V形相关,为理解模型的学习机制提供了深刻洞察。
使用方法
使用者可遵循标准微调流程,首先在指定任务的ID数据集上训练模型(如T5-large或DeBERTa-large),随后在对应的三个OOD数据集上评估其泛化能力。为全面分析鲁棒性,建议调节模型规模、训练步数、可用样本数量及可调参数等变量,以观察ID-OOD性能关联模式。此外,该基准支持评估现有鲁棒性增强方法(如数据增强、对抗训练)及大型语言模型(如LLaMA、GPT系列)的零样本与上下文学习表现。所有实验代码及数据均公开于GitHub,便于复现与扩展。
背景与挑战
背景概述
在自然语言处理领域,分布外鲁棒性研究长期受限于缺乏系统化基准的困境。现有评估常基于独立同分布假设,而真实场景中语义偏移与概念漂移普遍存在,导致模型泛化能力被高估。为突破这一瓶颈,由清华大学、伊利诺伊大学厄巴纳-香槟分校及腾讯等机构的研究人员于2023年联合构建了BOSS(Benchmark suite for Out-of-distribution robustneSS evaluation)基准。该基准覆盖情感分析、毒性检测、自然语言推理、命名实体识别及抽取式问答五大核心任务,包含20个数据集,旨在通过严格协议确保分布偏移的显著性与挑战性。BOSS的提出不仅为NLP模型鲁棒性评估树立了标准化标杆,更推动了领域内对模型学习机制与泛化能力的深层认知,成为NeurIPS 2023数据集与基准赛道的重要里程碑。
当前挑战
BOSS基准面临的核心挑战呈现双重维度。首先,在领域问题层面,现有自然语言处理模型面对分布偏移时表现出显著脆弱性——传统微调方法在域内数据上表现强劲,却难以应对语义相似的分布外样本,而大语言模型虽具备零样本泛化潜力,但在结构化预测任务中仍存在严重性能衰减,如命名实体识别任务上微调小模型远超LLMs。其次,基准构建过程中遭遇多重困境:需在候选数据集中筛选语义差异显著且性能退化剧烈的分布对,避免因数据集间高相似性导致评估失真;同时要平衡任务多样性(分类、结构化预测与抽取式问答)与标签对齐的复杂性,例如命名实体识别中不同数据集的实体类型映射需手动设计;此外,对抗性样本的自动生成与人工验证流程(如AdvCivil数据集)进一步增加了构建成本与质量控制难度。
常用场景
经典使用场景
在自然语言处理领域,分布外鲁棒性评估一直是核心挑战之一。BOSS数据集作为一套覆盖情感分析、毒性检测、自然语言推理、命名实体识别和抽取式问答五大任务的综合性基准套件,为模型在非独立同分布场景下的泛化能力提供了严谨的评估框架。其经典使用场景在于构建具有清晰语义差异和显著性能退化的分布偏移对,从而替代传统基于流行度或启发式的数据集选择方法,确保评估结果的区分度和挑战性。研究者通常利用BOSS中精心设计的ID-OOD数据集组合,系统性地衡量预训练语言模型在面对背景偏移和概念偏移时的鲁棒性表现。
衍生相关工作
BOSS数据集的提出催生了一系列后续研究。在鲁棒性增强方法方面,研究者基于BOSS评估了数据增强、对抗训练、标签平滑和模型集成等经典技术的有效性,发现普通经验风险最小化仍是最强基线,而自由对抗训练在部分数据集上展现出有限优势。在大型语言模型评估方面,BOSS催生了关于LLM泛化能力与数据污染问题的深入讨论,促使社区关注时间偏移等更严格的评估范式。此外,该基准构建协议被后续工作借鉴,用于更新和扩展OOD评估套件,推动了如GLUE-X等类似基准的改进,形成了NLP鲁棒性研究的新标准。
数据集最近研究
最新研究方向
在自然语言处理领域,分布外鲁棒性研究正成为焦点,而BOSS数据集的提出为这一方向注入了新的活力。该数据集覆盖情感分析、毒性检测、自然语言推理、命名实体识别和抽取式问答五大任务,包含20个数据集,旨在解决以往基准测试中分布偏移挑战不足的问题。前沿研究方向聚焦于揭示模型在分布内与分布外性能之间的复杂关联,如单调线性正相关、分段线性正相关及非单调V形相关三种典型模式,这为预测模型泛化能力提供了新视角。同时,BOSS评估了传统鲁棒性增强方法与大型语言模型的表现,发现微调领域模型在分布内数据上占优,而大型语言模型结合上下文学习在分布外场景中更具潜力,凸显了当前方法在应对分布偏移时的局限性,推动了更先进鲁棒技术的探索。
相关研究论文
  • 1
    Revisiting Out-of-distribution Robustness in NLP: Benchmark, Analysis, and LLMs Evaluations · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务