遇见数据集

ytc1997/multisource-membench

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Multi-Source Memory Benchmark(多源记忆基准)是一个诊断测试平台,用于在冲突的多源个人记忆上进行选择性问答(ANSWER/SKIP)。每个人物角色有五个证据流,这些证据流从单个潜在事件表投影而来,具有已知、受控的每源失真(包括偏差方向、丢失率和粒度)。这使得方法能够针对潜在真实情况(而非任何单一源)进行评估。该基准伴随论文《Selective QA over Conflicting Multi-Source Personal Memory: A Diagnostic Testbed and Method Comparison》,并用于比较基线方法、结构化融合方法以及前沿大型语言模型(如GPT、Gemini、DeepSeek、Qwen3系列)。数据集完全合成,包含34,560个问题实例,覆盖5个主题(工作、饮食、社交、睡眠、锻炼)和8种推理类型。它旨在评估方法在冲突证据、缺失字段和主题依赖的自我报告偏差下的表现,并研究选择性问答中的跳过成本与错误成本之间的权衡。

Multi-Source Memory Benchmark is a diagnostic testbed for selective question-answering (ANSWER/SKIP) over conflicting multi-source personal memory. Each persona has five evidence streams projected from a single latent event table with known, controlled per-source distortions (bias direction, dropout rate, granularity), allowing methods to be measured against the latent ground truth rather than against any single source. The benchmark accompanies the paper Selective QA over Conflicting Multi-Source Personal Memory: A Diagnostic Testbed and Method Comparison and is used to compare baselines, structured fusion methods, and frontier LLMs (GPT, Gemini, DeepSeek, Qwen3 families). The dataset is fully synthetic, with 34,560 question instances covering 5 topics (Work, Diet, Social, Sleep, Exercise) and 8 reasoning types. It is intended for evaluating methods under conflicting evidence, missing fields, and topic-dependent self-report bias, and for studying the cost-of-skip vs cost-of-wrong trade-off in selective QA.

提供机构:
ytc1997
搜集汇总
数据集介绍
ytc1997/multisource-membench 数据集图片
构建方式
该数据集通过完全合成的流程构建,从单一潜在事件表出发,为每个模拟人物投射出五个证据流,并引入已知的可控失真模式,包括偏差方向、丢失率及粒度差异。每个种子包含480个合成人物,每个人物对应18个覆盖八类推理类型的问题,总计34,560个测试实例。数据生成管道可从源代码完整复现,经字节等效性验证确保一致性。
特点
数据集的核心特点在于其诊断性设计,能够精确度量方法在冲突性多源记忆聚合中的表现。五个证据流分别模拟了长期记忆的理想化、规划者的乐观偏差、日常自述的主题依赖偏差、客观日志的微小噪声以及设备日志的显著缺失。每个问题均基于潜在真实状态确定性标注,支持在受控失真条件下比较选择性问答的聚合策略。
使用方法
推荐通过代码仓库中的fetch_benchmark.py脚本下载经SHA256校验的压缩归档,避免HuggingFace速率限制。用户可通过survey2agent路径API加载单个种子或人物文件夹,读取事件表、真实标签及结构化源数据。数据集支持以训练、开发、校准和测试四部分划分使用,并提供了冻结的第三方模型输出用于复现论文结果。
背景与挑战
背景概述
在大型语言模型(LLM)的快速演进中,如何精准模拟与评估其对多源、冲突性个人记忆的选择性问答能力,已成为一项关键研究挑战。2026年,由Tiancheng Yang、Matthias Schonlau和Ilia Sucholutsky等研究人员共同构建的Multi-Source Memory Benchmark(多源记忆基准)应运而生。这一全合成诊断测试平台聚焦于个人记忆领域中多源信息冲突下的选择性问答(ANSWER/SKIP)任务,通过为每个虚拟角色生成五条具有已知、受控失真特征(如偏差方向、信息丢失率、粒度差异)的证据流,并设定潜在的客观世界状态作为隐式真实基准,从而以标准化方式衡量不同方法在面对冲突证据时的聚合与决策能力。该基准已对GPT、Gemini、DeepSeek、Qwen3等前沿模型进行了系统性对比分析,为评估LLM在个人记忆场景中的可靠性提供了重要实验平台。
当前挑战
该基准所聚焦的核心挑战在于解决个人记忆问答领域长期存在的领域难题:多源信息不可避免地存在偏见、缺失、时间延迟及主观描述与客观记录之间的矛盾,例如日常自述可能带有主题依赖的倾向性,而设备日志则常因采样不全面导致信息空白。这要求模型不仅能够整合异构证据,还需在信息不足时明智地选择跳过回答,而非强行输出可能错误的结果。在构建过程中,研究团队同样面临显著挑战——设计一套完全合成的、高度控制的失真模型以确保每个角色的记忆缺陷在统计上可知可解,同时保证34,560个问题实例在多种推理类型(如仲裁、时间趋势、缺失数据处理)与难度层(稳定、时间偏移、陈述与揭示矛盾)下的科学分布,这对生成流程的精确度和统计一致性提出了极高要求。
常用场景
经典使用场景
在个人记忆与多源信息融合的研究领域中,Multi-Source Memory Benchmark被设计为一个诊断性测试平台,专门用于评估模型在面对来自多个信源的、相互冲突的个人记忆信息时,执行选择性问答(Selective QA)的能力。其核心使用场景在于,通过为每个虚拟人物提供五类拥有已知且可控失真特性(如偏向方向、缺失率、粒度差异)的证据流,研究者能够精确测量不同方法相对于潜在真实世界状态的表现,而非单纯依赖于某一特定信源的准确性。该基准包含34560个精心构造的问答实例,覆盖八个推理类型与三个难度等级,为系统性比较基线方法、结构化融合技术与前沿大语言模型提供了标准化的实验场域。
解决学术问题
该数据集精准地解决了当前学术研究中一个棘手但尚未被充分探索的难题:如何让智能系统在推理源自个人记忆的复杂问题时,能够明智地选择回答还是跳过,尤其是在面对多源信息存在明确冲突、缺失或系统性偏差的情况下。传统问答任务往往假设信息源可靠且一致,但在现实个人记忆中,来自日志、计划、自我报告或设备记录的信息往往相互矛盾。该基准通过提供完全可追溯的潜在真实标签,首次使得研究者能够量化不同策略在平衡‘错误回答成本’与‘跳过回答成本’之间的权衡效果,从而推动了关于证据融合、冲突消解以及不确定性管理理论的深入发展。其研究成果对于构建更鲁棒、更值得信赖的个人AI助手具有重要的方法论指导意义。
衍生相关工作
围绕Multi-Source Memory Benchmark,已经催生了一系列重要的后续研究工作。该基准附带的方法比较论文系统性地评估了包括传统基线、结构化融合方法(如ABF)以及GPT、Gemini、DeepSeek、Qwen3等前沿大语言模型族在内的数十种方法,建立了一个清晰的能力对比图谱。该数据集的高质量合成特性与完全暴露的潜在真实标签,为开发新的选择性问答算法、冲突消解机制以及不确定性量化技术提供了理想的研究平台。已有学者基于该基准提出的多源信息融合框架,开始探索将类似策略迁移至更广泛的知识融合与机器推理任务中,其衍生的开源代码仓库和缓存的大模型推理输出,进一步降低了该领域的研究门槛,促进了可重复研究的生态建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务