FriendBench
收藏资源简介:
FriendBench是一个多模态基准数据集,由流体概念研究机构创建,旨在从20秒的破冰对话片段中推断两人是否已有交集(熟悉或陌生人)。该数据集包含96个经过严格平衡的二元组,每个二元组均提供文本、音频和视频三种模态,数据源自Seamless Interaction数据集的Either-Or互动任务。通过交叉平衡录制地点、关系和性别组成,并辅以质量过滤和LLM内容审核,确保无参与者重叠和语义泄露。该数据集专为评估多模态大语言模型的社会感知能力而设计,尤其关注从行为线索而非语义内容中识别关系状态,以弥补现有基准在客观标签和模态控制上的不足。
FriendBench is a multimodal benchmark dataset developed by Fluid Concepts Research, which aims to infer whether two individuals have an existing connection (either acquaintances or strangers) from 20-second icebreaker conversation clips. This dataset includes 96 strictly balanced dyads, each providing three modalities: text, audio, and video, with data sourced from the Either-Or interaction task of the Seamless Interaction dataset. It is constructed via cross-balancing of recording locations, relational backgrounds, and genders, supplemented by quality filtering and LLM-based content auditing to ensure no participant overlap and no semantic leakage. This dataset is specifically designed to evaluate the social perception capabilities of multimodal large language models, with particular focus on identifying relational states from behavioral cues rather than semantic content, to address the shortcomings of existing benchmarks in objective labeling and modality control.
FriendBench 数据集概述
基本信息
- 数据集名称:FriendBench
- 许可证:CC-BY-NC 4.0(非商业用途)
- 语言:英语
- 大小:少于1K样本
- 任务类型:音频分类、视频分类、文本分类
- 标签:社交认知、关系推断、多模态、二元交互
数据集简介
FriendBench是一个用于社会感知的基准测试套件,其核心任务是评估模型或人类能否仅通过20秒的互动片段推断两个人之间的关系(熟悉或陌生)。该数据集构建于Seamless Interaction数据集之上,具有以下特点:
- 多模态:每个片段包含文本、音频和视频三种模态
- 客观标签:记录的是二人是否实际见过面,而非观者的主观印象
- 匹配的人类+模型基线:约90名标注员/模态和26个零样本模型
- 受控设计:每对受试者使用相同的破冰提示,且样本均衡分层
已发布配置
validation(验证集)
这是当前唯一已发布的配置,也是MINT 2026论文所涵盖的范围。
数据集构成
- 96对受试者,每对一段片段(平均时长20.2秒,范围15.6–25.0秒)
- 三个二元因素完全交叉且均衡(12个单元 × 8对):
- 关系(relationship):48熟悉 / 48陌生(标签)
- 性别配置(gender_config):48混合 / 48同性别
- 时间位置(temporal_position):48早期 / 48晚期
- 均衡覆盖三个录制地点(V00/V02/V03)
- 参与者不重叠:每位个体仅出现在一对中
文件结构
validation/ ├── data/ # 包含metadata.csv、音频(16kHz mono WAV)、视频(H.264)、文本转写 ├── ratings/ # 人类评分(8,941次试验,280名标注员)和模型预测 ├── baselines/ # results.csv排行榜 ├── eval.py # 评估脚本 └── make_websafe.py # 生成网页友好媒体
元数据列
主要列包括:sample_id、relationship(标签)、gender_a/b(基于语音的性别估计)、gender_config、temporal_position、clip_duration、n_turns、vendor_id、session_id、媒体文件路径等。
基线结果
| 模态 | 最佳模型 | 准确率 | 人类群体 | 准确率 | 人类个体 | 准确率 |
|---|---|---|---|---|---|---|
| 文本 | gpt_text_mini | 56.2% | 多数投票 | 51.0% | 平均 | 49.9% |
| 音频 | gemini_audio_pro | 66.7% | 多数投票 | 63.5% | 平均 | 56.3% |
| 视频 | gemini_video | 66.7% | 多数投票 | 71.9% | 平均 | 60.9% |
随机猜测准确率为50%。该任务难度较高:文本模态对人和模型都几乎无信号,音频提供可靠信号,视频是人类最强的模态。
评估方法
用户可编写包含sample_id和prediction两列的CSV文件,通过运行eval.py评估模型表现。评估报告包括总体准确率、覆盖率、按关系(每类召回率)、性别、时间位置和设计单元的细分结果。准确率仅针对已回答试验计算,模型不因拒绝回答而受罚。
使用注意事项
- 公开参考集,非盲测集:该数据集包含真实标签和完整的人类/模型响应,可用于复现论文和直接评分,但不能作为防污染的测试集使用。
- 仅用于零样本评估:无训练/测试划分,整个集合仅用于零样本评估。
- 性别标签为估计值:所有性别标签均基于语音模型预测,非自我报告,应视为噪声协变量。
- 访问限制:需同意条款后方可下载,仅限非商业研究用途。





