遇见数据集

IFLLM

收藏
arXiv2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

IFLLM数据集是由马萨诸塞大学阿默斯特分校和约克大学的研究团队构建的首个多模态隐式反馈数据集,旨在通过记录用户与大型语言模型交互过程中的眼动轨迹和鼠标移动数据,以解决显式反馈稀缺且成本高昂的问题。该数据集包含1336条多轮问答交互,数据来源于59名亚马逊土耳其机器人工作者,覆盖数百个维基百科主题,通过定制化网站收集了高精度的眼动与鼠标轨迹特征,并附有点对点和成对偏好标注。数据集创建过程涉及基于网络摄像头的眼动校准、多轮对话设计以及严格的质量控制流程,确保了数据的真实性与可靠性。其核心应用领域在于提升LLM对齐效果,通过隐式行为信号训练奖励模型,显著增强偏好预测准确性和响应质量,为下一代个性化对齐方法奠定基础。

The IFLLM dataset is the first multimodal implicit feedback dataset constructed by research teams from the University of Massachusetts Amherst and York University. It aims to address the scarcity and high cost of explicit feedback by recording eye movement trajectories and mouse movement data during user interactions with large language models. This dataset contains 1,336 multi-turn question-answering interactions sourced from 59 Amazon Mechanical Turk workers, covering hundreds of Wikipedia topics. High-precision eye movement and mouse trajectory features were collected via a customized website, paired with point-wise and pairwise preference annotations. The dataset creation process involves webcam-based eye movement calibration, multi-turn dialogue design, and strict quality control procedures, ensuring the data's authenticity and reliability. Its core application lies in improving LLM alignment: training reward models using implicit behavioral signals, which significantly enhances preference prediction accuracy and response quality, laying a foundation for next-generation personalized alignment methods.

创建时间:
2026-06-19
搜集汇总
数据集介绍
IFLLM 数据集图片
构建方式
IFLLM数据集通过众包平台Amazon Mechanical Turk,招募59名工作者在真实的多轮对话场景中与多个大语言模型(如DeepSeek V3、GPT-4o Mini、Claude Sonnet 4.5、Llama 3.3 70B)进行交互。研究者开发了专门的网页界面,记录用户从30至60个维基百科主题中选择感兴趣的领域,并就每个主题提出至少三个问题。在对话过程中,系统以约0.1秒的间隔持续捕捉用户的鼠标轨迹和网络摄像头捕获的眼动数据,并结合用户对回答的点数或两两比较的显式偏好标注,最终收集到1336条多轮问答交互数据。
特点
该数据集的核心特点在于首次在大语言模型对齐领域融合了隐式反馈信号——鼠标移动与眼动注视轨迹,并匹配了用户显式偏好标注。数据揭示了用户阅读行为的高度多样性:注视模式随回答长度和界面布局动态变化,短回答时眼动信号更为关键,而长回答下鼠标滚动行为与注视高度相关,使得鼠标轨迹成为更强的偏好指示器。此外,隐式反馈特征(如阅读时间、注视深度)的重要性远超传统长度特征和模型身份特征,为训练奖励模型提供了更丰富、更真实的信号来源。
使用方法
使用IFLLM时,研究者首先从轨迹数据中提取文本特征、注视特征和鼠标特征,并基于重要特征子集训练随机森林奖励模型,以预测用户对LLM回答的偏好。随后,将偏好预测结果应用于Direct Preference Optimization(DPO)训练流程,通过rDPO结合负对数似然损失,对多个1B至4B规模的基础语言模型进行对齐优化。实验表明,基于鼠标信号的奖励模型可将文本基线的偏好预测准确率从55%提升至64%,并使DPO带来的回答质量相对提升近两倍,验证了隐式反馈在真实世界场景中的有效性。
背景与挑战
背景概述
在大规模语言模型(LLM)的快速发展浪潮中,将其与人类价值观对齐已成为提升系统实用性的核心课题。然而,传统方法高度依赖用户主动提供的显式反馈,这类数据不仅采集成本高昂,且在实际部署中仅有极少数用户愿意参与标注,严重制约了模型优化的效率与规模。为探索隐式反馈——如鼠标轨迹与眼动数据——在LLM对齐中的潜力,马萨诸塞大学阿默斯特分校的研究人员于2026年发布了IFLLM数据集。该数据集基于59名亚马逊Mechanical Turk工作者完成的1336轮多轮问答交互,首次系统性地记录了用户在与LLM交互过程中的眼动与鼠标运动轨迹,并配套了显式的偏好标注。这一开创性工作为利用用户无意识行为信号改善模型对齐提供了全新范式,标志着LLM对齐研究从依赖昂贵标注向规模化、低成本化演进的重要转折。
当前挑战
IFLLM数据集所应对的核心挑战在于,如何在不依赖人工显式标注的前提下,从用户自然交互行为中提取可靠的偏好信号。传统的奖励模型仅基于响应文本,难以捕捉用户真实的阅读与评估模式,尤其当响应长度、界面布局和个体阅读习惯存在显著差异时,文本信号往往失效。数据集构建过程中同样面临多重困难:眼动追踪需借助普通网络摄像头而非专业设备,导致信号噪声大、校准难;鼠标与眼动轨迹的时空关联性复杂,不同长度响应下的信号有效性截然不同——短响应时眼动信号更关键,长响应则需依赖鼠标滚动行为。此外,用户行为的高度异质性(如部分用户仅粗略浏览)对数据清洗与质量把控提出了严苛要求,需通过多维度的阈值筛选与人工核验剔除低质样本,才能在真实嘈杂环境中确保隐式反馈信号的可用性与鲁棒性。
常用场景
经典使用场景
在大语言模型(LLM)与人类交互的背景下,IFLLM数据集为研究者提供了一种全新的范式来捕捉用户对模型输出的隐式偏好。该数据集通过记录用户在阅读LLM回答时的鼠标轨迹与眼动注视点,将微观行为信号与显式的评分偏好对齐。其最经典的用法在于训练基于隐式反馈的奖励模型,使得原本仅依赖文本内容的偏好预测从约55%的准确率跃升至64%,实现了近三倍的相对改善。这种将用户非言语行为转化为对齐信号的思路,为理解人类如何自然评价AI输出开辟了数据的先河。
实际应用
在实际部署中,IFLLM所代表的隐式反馈机制天然适配于各类用户面对LLM的交互界面,如智能客服、教育辅导系统和创意写作助手等。由于鼠标轨迹几乎可在任何联网设备上无成本采集,平台无需频繁弹窗请求用户评价,即可持续优化模型输出。例如,用户长时间停留并滚动阅读的段落往往意味着更高的满意度,此类信号可实时反馈至奖励模型,驱动LLM生成更符合个体偏好的内容。这一数据飞轮效应不仅降低了对显式用户参与的依赖,还为实现规模化、个性化的LLM对齐铺平了道路。
衍生相关工作
IFLLM数据集催生了一系列后续研究,最显著的是将眼动和鼠标信号融入奖励建模的跨模态对齐工作。例如,OASST-ETC数据集在受控实验室环境下使用专用设备收集眼动数据,而IFLLM则证明了廉价网络摄像头与鼠标信号在野外的有效性,推动了对眼动辅助SFT权重估计、Transformer注意力与人类注意力对齐等课题的探索。此外,鼠标滚动与注视点的强关联启发了一些研究者利用光标行为代替眼动仪进行低成本阅读分析,并催生了结合隐式反馈与RLHF的混合范式,使得LLM对齐走向更加自然、可扩展的迭代路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务