遇见数据集

RECOM (Reddit Evaluation for Correspondence of Models)

收藏
arXiv2026-06-17 更新2026-06-19 收录
官方服务:

资源简介:

RECOM数据集是由斯坦福大学等机构联合构建的用于评估大语言模型在开放式问答任务中的基准数据集,其全称为Reddit Evaluation for Correspondence of Models。该数据集包含15,000条源自r/AskReddit子论坛的英文问题及对应的真实社区回复,数据规模总计约647,973条对比样本,所有数据均采集于2025年9月以确保免受训练数据污染。数据集通过Pushshift API收集原始帖文,并筛选高互动内容构建而成,旨在为评估模型生成内容与社区共识的匹配度提供纯净测试环境。该数据集主要应用于自然语言处理领域,用于探究自动评估指标在开放式、观点驱动型问答任务中的有效性-判别力权衡问题,为衡量语言模型与人类社区观点的一致性提供标准化的评估框架。

The RECOM dataset, whose full name is Reddit Evaluation for Correspondence of Models, is a benchmark dataset jointly constructed by Stanford University and other institutions for evaluating large language models (LLMs) in open-ended question answering tasks. It contains 15,000 English questions sourced from the r/AskReddit subreddit and their corresponding authentic community responses, with a total of approximately 647,973 paired comparison samples. All data was collected in September 2025 to avoid contamination from model training corpora. The dataset was built by collecting original posts via the Pushshift API and filtering for high-engagement content, aiming to provide a clean test environment for assessing the alignment between model-generated content and community consensus. Primarily applied in the field of natural language processing (NLP), this dataset is used to explore the effectiveness-discrimination trade-off of automatic evaluation metrics in open-ended, opinion-driven question answering tasks, and to provide a standardized evaluation framework for measuring the consistency between language models and human community viewpoints.

创建时间:
2026-06-17
搜集汇总
数据集介绍
RECOM (Reddit Evaluation for Correspondence of Models) 数据集图片
构建方式
RECOM (Reddit Evaluation for Correspondence of Models) 是一个专为评估开放域问答中自动指标表现而设计的无污染评测数据集。其构建过程始于利用 Pushshift API 采集2025年9月间来自 r/AskReddit 的132,728条英文帖子,随后依据互动热度筛选出前25,000条,并从中随机抽取15,000条形成数据集。每个问题均附带其真实的深度一级社区回复作为参考集,而非合成答案,以保留社区观点的多样性与真实性。经过对包含AI自我指涉或能力声明等拒绝性回答的过滤后,最终保留了11,528个问题-回复对,所有数据均晚于被评测模型的训练截止日期,从而彻底杜绝了数据污染风险。
特点
RECOM 数据集的核心特征在于其内建的随机置乱基线(random-derangement baseline),这一设计使得研究者能够在统一的尺度上同时量化自动指标的两种关键能力:有效性(区分真实内容与表面巧合的能力)和判别力(区分不同系统优劣的能力)。数据集的开放性体现在其11,528个问题均为观点驱动型,无标准答案,参考集由平均56.2条社区回复构成,覆盖了广泛的意见分布。此外,所有数据点均位于2025年9月这一时间窗口内,确保了与所有被评测模型训练数据的严格时间隔离,使其成为衡量指标设计优劣的理想试验台。
使用方法
使用 RECOM 时,研究者首先利用五个7B至10B参数规模的开源大语言模型对每个问题生成答案,并在统一推理参数下控制回答长度在50词以内。随后,每个生成答案需与对应问题的所有深度一级社区回复进行多参考评估,依据指标家族惯例采用最大值或平均值聚合。关键的创新在于必须将每个指标与随机置乱基线配对计算,通过 Cohen's d 效应量分别衡量指标的有效性(真实vs随机差异)和判别力(模型间最大差异),最终将各指标绘制在有效性-判别力二维空间中,以直观揭示两者间的权衡关系。
背景与挑战
背景概述
在大型语言模型(LLM)广泛应用于开放式、观点驱动型问答任务的背景下,如何准确评估生成文本的质量成为关键挑战。2026年,由阿拉巴马大学亨茨维尔分校、北阿拉巴马大学、斯坦福大学、Meta AI和亚马逊GenAI的研究人员联合提出了RECOM(Reddit Evaluation for Correspondence of Models)数据集。该数据集包含15000条来自r/AskReddit的子版块问题(2025年9月),每条问题均配有真实的社区回复,且所有数据均处于评估模型训练截止日期之后,从根本上杜绝了数据污染。RECOM的核心研究问题聚焦于探究自动评估指标在开放式问答中的有效性-区分度权衡(validity–discrimination tradeoff),即同一指标能否同时可靠区分真实内容对齐与表面巧合,并有效排序不同模型的性能。该数据集的提出对自然语言处理领域产生了重要影响,为评估LLM在主观问答场景下的表现提供了反污染、高生态效度的基准平台。
当前挑战
RECOM数据集致力于解决两大核心挑战。首先,在领域问题层面,自动评估指标被同时要求完成两项任务:一是判断高分数是否反映真实的语义对齐(有效性),二是区分不同系统孰优孰劣(区分度)。然而在开放式、观点驱动型问答中,这两项任务存在本质上的矛盾——余弦相似度虽能有效分离真实与随机回答(Cohen's d ≈ 2),却无法区分不同模型(|d| < 0.1);而BERTScore精度虽能排序模型(raw |d| 达 0.63),但控制回答长度后降至 0.09,且其有效性较弱(d ≈ 0.8)。其次,在数据集构建过程中,如何确保数据无污染是一大难题:所有模型训练截止日期均早于2025年9月的数据采集窗口(至少9个月),从而确保社区回复完全在模型训练数据之外。此外,过滤模型拒绝回答(如“作为一个AI…”等自指表述)导致有效样本从15000条降至11528条(保留率76.9%),这一过程本身也构成数据质量控制的重要挑战。
常用场景
经典使用场景
RECOM(Reddit Evaluation for Correspondence of Models)是一个专为开放式、观点驱动型问答任务设计的大规模评估数据集,包含来自r/AskReddit的15,000条社区问答对。其经典使用场景在于为研究者提供一个无数据污染、时间标定明确的基准测试平台,用以评估大语言模型在开放式问答中生成答案与社区共识之间的对齐程度。通过将每个模型的生成回答与原始社区回复进行多参考指标打分,RECOM能够系统性地揭示不同自动评估指标在有效性与判别力之间的内在张力,成为衡量模型语义契合能力的标准载体。
实际应用
在实际应用中,RECOM为对话系统、搜索引擎和智能问答助手的开发与调优提供了关键的评估支撑。当需判断模型生成的回答是否真正与社区观点共鸣时,该数据集可指导工程团队选择恰当的评价指标组合,避免因单一高分导致的误判。例如,在优化客服机器人或意见聚合系统时,开发者可借助RECOM的随机基线定位模型真实表现区间,并通过长度残差化处理剥离文本长度的混杂效应,从而获得更纯粹的内容质量评估。此外,RECOM亦为跨语言社区问答系统的迁移学习效果验证提供了可复现的标准化测试环境。
衍生相关工作
RECOM的出现催生了多项衍生研究工作。其一,推动了对自动评估指标表征设计的理论分析,研究者开始探索非对比训练编码器在开放式任务中的表现,试图解耦有效性与判别力的耦合机制。其二,基于RECOM提出的有效性—判别力二维报告框架,后续工作延展至摘要生成、长文本问答及多轮对话等更广泛的开放式生成场景,检验该权衡现象是否具有普遍性。其三,该数据集所采用的LLM-as-Judge验证协议,启发了更系统的自动评价器校准方法,尤其是在多评判者一致性分析与长度偏差修正方面,形成了新的评估范式共识。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务