IFLLM
收藏资源简介:
IFLLM是一个用于LLM对齐的隐式反馈数据集,包含来自59名Mechanical Turk工人的1,336个多轮LLM对话,配对了网络摄像头记录的眼动和鼠标移动轨迹数据。该数据集用于训练奖励模型(超越仅文本基线,配对准确率从约55%提升至64%)并通过rDPO + NLL对齐八个1-4B规模的LLM,从而在响应质量上实现可测量的提升。
IFLLM is an implicit feedback dataset for large language model (LLM) alignment. It encompasses 1,336 multi-turn LLM conversations sourced from 59 Mechanical Turk workers, paired with eye-tracking and mouse movement trajectory data captured via webcams. This dataset is utilized for training reward models, which outperform text-only baselines with their pairing accuracy improved from approximately 55% to 64%; additionally, it is employed to align eight 1–4B scale LLMs via rDPO + NLL, resulting in measurable enhancements to response quality.
数据集概述
数据集名称: IFLLM (Implicit Feedback for LLM Alignment)
核心内容: 一个包含 1,336 次多轮 LLM 对话的数据集,数据来自 59 名 Mechanical Turk 工作人员,并配有用网络摄像头记录的眼动轨迹和鼠标移动轨迹。
研究目标: 利用这些隐式反馈信号(眼动和鼠标行为)训练奖励模型,以改进大语言模型的对齐效果。
主要成果:
- 训练出的奖励模型在成对准确率上优于纯文本基线(从约 55% 提升至 64%)。
- 通过 rDPO + NLL 方法对齐了 8 个 1B 到 4B 参数规模的 LLM,在回复质量上取得了可衡量的提升,优于纯文本奖励和显式反馈奖励。
数据集结构
数据集包含以下核心文件,均位于 dataset/ 文件夹内:
query_logs_table.csv:包含查询、LLM 回复以及偏好标签。record_info_table.csv:包含工作人员的人口统计信息。task_table.csv:包含每个任务的摘要信息。user_behavior/<worker>/<task>/*.csv:包含每位工作人员在每个任务中的眼动和鼠标移动轨迹数据。
处理流程
- 数据收集 (
eye_gazing_LLM/):一个基于 PHP/JS 的研究网站,用于运行 MTurk 实验。该网站提供问答界面,运行 WebGazer 校准,并将原始眼动/鼠标轨迹、查询、回复和偏好数据写入数据库。 - 特征提取 (
NLP-Gazing/):读取query_logs_table.csv和user_behavior/目录,将每个眼动样本与用户正在阅读的查询进行匹配,并提取约 426 个偏好比较相关的特征(如阅读位置、停留时间、注意力窗口等)。- 产出文件:
output/extracted_features.csv
- 产出文件:
- 数据集组装与基线模型 (
feature_creator/):整合extracted_features.csv、query_logs_table.csv、all_metrics.csv(来源未指明)和task_table.csv,构建成对和逐点特征版本,并训练论文中报告的随机森林奖励模型。- 产出文件:
pairwise_output/*.csv、pointwise_output/*.csv以及用于下游 DPO 的 OOF 偏好预测。
- 产出文件:
- 基于 Transformer 的奖励模型 (
llm_reward/):使用 ModernBERT、Longformer、DistilBERT 等模型,通过 5 折交叉验证训练成对(分类)和逐点(回归)的奖励模型,作为论文中奖励模型表格的纯文本和文本+隐式反馈基线。 - LLM 对齐 (
dpo_eye_gazing/):在 8 个基础模型上通过 rDPO + NLL 方法进行对齐,使用来自feature_creator/或llm_reward/的偏好预测作为 DPO 标签来源,并使用 GPT-4.1-mini 作为评估法官。- 对齐的模型: GPT2-XL, Pythia 2.8B, OLMo2 1B, Llama3.2 3B, Qwen2.5 1.5B/3B, Qwen3 1.7B/4B。




