遇见数据集

FriendBench

收藏
arXiv2026-08-01 更新2026-08-04 收录
官方服务:

资源简介:

FriendBench是一个多模态基准数据集,由流体概念研究机构创建,旨在从20秒的破冰对话片段中推断两人是否已有交集(熟悉或陌生人)。该数据集包含96个经过严格平衡的二元组,每个二元组均提供文本、音频和视频三种模态,数据源自Seamless Interaction数据集的Either-Or互动任务。通过交叉平衡录制地点、关系和性别组成,并辅以质量过滤和LLM内容审核,确保无参与者重叠和语义泄露。该数据集专为评估多模态大语言模型的社会感知能力而设计,尤其关注从行为线索而非语义内容中识别关系状态,以弥补现有基准在客观标签和模态控制上的不足。

FriendBench is a multimodal benchmark dataset developed by Fluid Concepts Research, which aims to infer whether two individuals have an existing connection (either acquaintances or strangers) from 20-second icebreaker conversation clips. This dataset includes 96 strictly balanced dyads, each providing three modalities: text, audio, and video, with data sourced from the Either-Or interaction task of the Seamless Interaction dataset. It is constructed via cross-balancing of recording locations, relational backgrounds, and genders, supplemented by quality filtering and LLM-based content auditing to ensure no participant overlap and no semantic leakage. This dataset is specifically designed to evaluate the social perception capabilities of multimodal large language models, with particular focus on identifying relational states from behavioral cues rather than semantic content, to address the shortcomings of existing benchmarks in objective labeling and modality control.

提供机构:
流体概念研究
创建时间:
2026-08-01
原始信息汇总

FriendBench 数据集概述

基本信息

  • 数据集名称:FriendBench
  • 许可证:CC-BY-NC 4.0(非商业用途)
  • 语言:英语
  • 大小:少于1K样本
  • 任务类型:音频分类、视频分类、文本分类
  • 标签:社交认知、关系推断、多模态、二元交互

数据集简介

FriendBench是一个用于社会感知的基准测试套件,其核心任务是评估模型或人类能否仅通过20秒的互动片段推断两个人之间的关系(熟悉或陌生)。该数据集构建于Seamless Interaction数据集之上,具有以下特点:

  • 多模态:每个片段包含文本、音频和视频三种模态
  • 客观标签:记录的是二人是否实际见过面,而非观者的主观印象
  • 匹配的人类+模型基线:约90名标注员/模态和26个零样本模型
  • 受控设计:每对受试者使用相同的破冰提示,且样本均衡分层

已发布配置

validation(验证集)

这是当前唯一已发布的配置,也是MINT 2026论文所涵盖的范围。

数据集构成

  • 96对受试者,每对一段片段(平均时长20.2秒,范围15.6–25.0秒)
  • 三个二元因素完全交叉且均衡(12个单元 × 8对):
    • 关系(relationship):48熟悉 / 48陌生(标签)
    • 性别配置(gender_config):48混合 / 48同性别
    • 时间位置(temporal_position):48早期 / 48晚期
  • 均衡覆盖三个录制地点(V00/V02/V03)
  • 参与者不重叠:每位个体仅出现在一对中

文件结构

validation/ ├── data/ # 包含metadata.csv、音频(16kHz mono WAV)、视频(H.264)、文本转写 ├── ratings/ # 人类评分(8,941次试验,280名标注员)和模型预测 ├── baselines/ # results.csv排行榜 ├── eval.py # 评估脚本 └── make_websafe.py # 生成网页友好媒体

元数据列

主要列包括:sample_idrelationship(标签)、gender_a/b(基于语音的性别估计)、gender_configtemporal_positionclip_durationn_turnsvendor_idsession_id、媒体文件路径等。

基线结果

模态 最佳模型 准确率 人类群体 准确率 人类个体 准确率
文本 gpt_text_mini 56.2% 多数投票 51.0% 平均 49.9%
音频 gemini_audio_pro 66.7% 多数投票 63.5% 平均 56.3%
视频 gemini_video 66.7% 多数投票 71.9% 平均 60.9%

随机猜测准确率为50%。该任务难度较高:文本模态对人和模型都几乎无信号,音频提供可靠信号,视频是人类最强的模态。

评估方法

用户可编写包含sample_idprediction两列的CSV文件,通过运行eval.py评估模型表现。评估报告包括总体准确率、覆盖率、按关系(每类召回率)、性别、时间位置和设计单元的细分结果。准确率仅针对已回答试验计算,模型不因拒绝回答而受罚。

使用注意事项

  1. 公开参考集,非盲测集:该数据集包含真实标签和完整的人类/模型响应,可用于复现论文和直接评分,但不能作为防污染的测试集使用。
  2. 仅用于零样本评估:无训练/测试划分,整个集合仅用于零样本评估。
  3. 性别标签为估计值:所有性别标签均基于语音模型预测,非自我报告,应视为噪声协变量。
  4. 访问限制:需同意条款后方可下载,仅限非商业研究用途。
搜集汇总
数据集介绍
FriendBench 数据集图片
构建方式
FriendBench基准的构建源于Seamless Interaction数据集,精选其中的Either-Or破冰对话,确保每对参与者回答同一类型的问题,从而排除话题内容作为线索。仅保留自然互动,排除即兴表演,并运用严格的质量筛选,涵盖转写完整性、说话者平衡及音频同步等维度。通过跨地点、关系类型和性别组成的分层抽样,选取96对二元组合,每对提取20秒片段,且确保参与者不重复出现,防止身份识别泄漏。此外,利用LLM审计验证提示标签的准确性,保证数据纯净。
特点
该基准的特色在于其精确控制变量与多模态评估。所有对话统一主题,使互动方式成为唯一线索,同时标签的客观性确保了任务的明确性。基准涵盖文本、音频和视频三种模态,并引入匹配人类评分的对照实验。基于信号检测理论的分析揭示了人类与模型在判别力和响应偏向上的差异,人类保持平衡,而模型倾向于“陌生人”回答,暴露了模型在视觉线索利用上的不足。
使用方法
使用FriendBench时,研究者可针对不同模态进行模型评估,采用零样本方式,将模型预测与人类评分进行比较。建议报告准确率外,还需涵盖每类召回率、信号检测指标(d'和c)以及试题难度分析,以全面洞察模型行为。该基准支持跨模态性能对比,并允许探究个体差异与群体智慧效应。通过标准化提示和响应解析,可复现实验,追踪模型在社交感知任务中的进展。
背景与挑战
背景概述
FriendBench是由Fluid Concepts Research的Jeffrey M. Girard及其团队于2026年提出的多模态基准测试,旨在评估人类与多模态大语言模型从短暂的双人对话片段中推断双方先前熟悉程度的能力。该基准基于Seamless Interaction数据集,选取96对平衡的双人组,采用20秒的破冰对话片段,跨越文本、音频和视频三种模态。其核心研究问题在于,当前AI系统在观察和参与人类互动时,能否像人类一样依赖多模态行为线索(如协调性、回应和朝向)而非语义内容来识别关系。FriendBench通过控制对话主题,迫使判断完全基于互动方式,为社交智能提供了一个客观、可验证的评估框架。该基准在领域内具有开创性,首次系统比较了26个模型与匹配的人类评分者在相同刺激下的表现,揭示了模型与人类在策略上的关键差异。
当前挑战
FriendBench面临的挑战首先体现在领域问题的本质难度上:推断两人是否先前熟悉,需从极短的行为样本中捕捉微妙的社会信号,这要求超越言语内容的深层社交感知能力。文本模态几乎不携带关系信号,人类与模型均难以从转录文本中提取有效线索,而音频虽提供额外信息,但视觉模态的利用成为关键分水岭——人类能有效结合可见行为提升准确率,而最强模型在音频和视听条件下表现持平,未能充分利用视觉信息。构建过程中亦遭遇多重挑战:需确保对话主题一致以防止语义泄漏,平衡研究地点、关系和性别构成以避免混淆变量,并保证参与者不重叠以防识别泄漏。此外,人力评分者的招募与设计需精细控制,采用计划缺失设计以建模个体差异,而模型评估则需统一提示与解析,处理部分模型拒绝回答的覆盖问题,这些均对基准的可靠性和可比性构成了严峻考验。
常用场景
经典使用场景
FriendBench作为一项新颖的多模态基准,其核心应用场景在于评估人工智能系统从短暂的双人互动片段中推断人际熟悉度的能力。该基准以20秒的破冰对话视频片段为单元,涵盖文本、音频和视频三种模态,要求判断对话双方是熟人抑或陌生人。这一场景精妙地控制了对话主题,迫使模型必须依赖行为风格而非语义内容进行判断,从而精准探测社会智能中非言语线索的解读能力。研究者可借此统一框架,系统比较人类与多模态大语言模型在社会感知任务上的表现差异。
解决学术问题
该数据集解决了一个长期困扰社会智能研究的关键问题:如何客观、可复现地度量模型对人际关系的感知能力。相较于以往研究中对意图、情绪等主观概念的模糊标注,FriendBench以'先前是否相识'这一具有明确真实标签的二元分类任务,为行为社会感知提供了清晰的操作化定义。它有效隔离了语义内容的干扰,迫使模型与人类同样依赖行为线索,从而揭示了当前模型在利用视觉信息上的不足以及系统性偏向'陌生人'的响应偏差,为理解人机社会认知差异提供了量化依据。
衍生相关工作
FriendBench的发布催生了多个富有成效的研究方向。其类偏置分析启发了后续工作系统探索多模态模型在社交判断中的校准策略,信号检测理论框架的引入促使研究者更精细地区分判别力与响应偏向。在人机比较方法上,其匹配式人类评估设计被广泛借鉴,推动了跨模态社会感知研究中控制变量的标准化实践。更为重要的是,该基准揭示了视觉模态对当前模型的提升瓶颈,直接激励了针对社交线索的多模态融合架构创新,并为后续研究如何利用可见行为信号提升AI社会智能提供了实证起点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务